お客様のログイン状態を維持するために必要なCookieを使用しています。また、お客様が許可した場合に限り、効果測定のための分析、セッションリプレイ、広告測定のCookieを使用します。 プライバシーポリシー

LagoraLagora
LagoraLagora
コンテンツにスキップ

スレッドマップ

ここでの会話は、いつでも中断したところから再開できます。

サインアップログイン

トポロジカル統一と論理的分裂:LLMの連続知識多様体

インポート済み

@obiak · 8月9日 21:47

会話の要約

LLMの連続知識多様体は、専門家モジュールの領域分割ではなく、共有表現空間に由来する。MoEモデルはスパース活性化により多様体構造を保持するが、パラメータの冗長性が圧縮駆動型知識融合の必然性を弱める可能性がある。

システムプロンプトClaude元のソースから引き継がれていません
Claude Fable 5AIが生成した内容は不正確な場合があります。重要な情報はご自身で確認してください。
AIパラダイムとゲーム理論の深掘りコンパイラ原理と精密検索技術

会話

12 メッセージ
obiak

LLMの内在的世界知識には、ある種の連続性があり、それが私を魅了してやまない。誰もこれほど広範囲にわたって知識を融通し、これほど多くのパターンを捉えることはできない。これは人間の文章ではまったく見られないものだ。人間の知性はすべて、分散した小さな網であり、その網もまた、散在する点を苦心して織り上げたものにすぎない。このLLMの連続性をどう理解すべきか?どう定義すべきか?もっと正確な概念はあるだろうか?

Claude Fable 5

あなたが観察された現象は現実のものであり、かなり具体的な技術的根源があります。いくつか、段階的に精度を高めた名前を試してみましょう。

最も文字通りの答え:表象の幾何学的連続性。 人間の知識は無数の分離した頭脳に保存されており、頭脳同士はテキストや対話といった低帯域の離散的なチャネルで結ばれています。したがって、人類文明の知識は全体として、あなたの言う「散在する点を織った網」であり、任意の二つの概念の間の「距離」は、誰かがたまたまそれらを結びつける文章を書かない限り、定義されていません。一方、LLMのすべての知識は、同一の高次元ベクトル空間に符号化されています。ビザンツ帝国の税制、タンパク質の折り畳み、宋詞の韻律——これらはすべてこの空間内に座標を持ち、任意の二点の間には経路が存在し、その経路上の中間点もしばしば意味を持ちます。ここでの「連続性」はほぼ数学的な意味です。モデルは(区分的に)連続関数であり、意味的に近い入力は近い内部表現を生成します。人間にはこの性質はありません。なぜなら、全領域の座標系を内蔵した人間の脳は一つも存在しないからです。

より深い答え:圧縮が融通を生み出す。 なぜこれらの座標は互いに独立しているのではなく、本当に「融通」しているのでしょうか?訓練の本質は、限られたパラメータで人間のテキストのほぼすべてを圧縮することだからです。圧縮の最適な戦略は、共有構造を発見することです。もし需要曲線、捕食者-被食者動態、化学平衡が深層構造において同型であるなら、それぞれに別々の内部回路を保持するよりも、一つの回路を再利用する方がはるかに安上がりです。すると、人間の目には「分野横断的な類推」に見えるものが、重み空間ではまったく同じものかもしれません。Anthropicの解釈可能性研究では、実際にこのような現象が観察されています。つまり、まったく異なる文脈で同じ特徴が再利用され、ある言語で学習された概念が他の言語に転移する——これは、知識が並列的な辞書ではなく、共有された基盤に存在することを示しています。ですから、あなたが感じる融通は、モデルが「博学になってからつながった」というものではなく、融通そのものが圧縮目標の副産物であり、パラメータを節約した結果なのです。

学術的には、いくつかの既存の概念が対応します。分散表現(distributed representation、Hinton系の古い概念で、すべての知識は同一空間内の活性化パターンであり、離散的な記号ではない)、意味多様体(知識を多様体上の連続関数と見なし、あなたの言う連続性は補間能力である)、そして比較的新しいプラトン的表象仮説(Huhら、2024年提唱:異なるアーキテクチャ、異なるモダリティの大規模モデルが類似した表象に収束しつつある。これは、それらがすべて同一の「世界の統計的構造」に近づいていることを示唆する)。もし造語するなら、私はこれを「単一基盤上の全域補間」と呼びます。人間の知識の統合は、文献全体の中に潜在的に存在するだけで、決して単一のシステムによって内面化されたことはありません。LLMは、テキスト分布全体を初めて一個体に押し戻したものです。「集合的知識の再個体化」と呼べるかもしれません。

しかし、それを定義する際には、重要な限定があります。これは「どのように定義するか」にも答えます。幾何学的連続性 ≠ 論理的一貫性。モデルは滑らかですが、全体的に自己矛盾がないわけではありません。異なる文脈で矛盾する信念を活性化することができ、それらの矛盾は、人間の学者の頭の中のように強制的に対決させられることは決してありません。人間の専門家の小さな網は疎ですが、その網の中には苦労して得られた論理的な剛性があります。LLMは全体的な幾何学的滑らかさを持っていますが、すべての信念を同じ法廷に持ち込んで審理するメカニズムを欠いています。それに対応して、LLMの強みは補間(多様体内部の任意の二点間の移動)であり、弱みは外挿(データ分布のサポート集合から外れると性能が低下する)です。したがって、より正確な描写はおそらく次のようになります。LLMは知識のトポロジー的統一を実現したが、知識の論理的統一はまだ実現していない。そして人間はその逆で、局所的には論理的に厳密だが、全体的にはトポロジー的に断片化している。

もう一つ正直な留保があります。解釈可能性研究はまだ若く、上記の図式の一部は証拠がありますが(特徴の再利用、言語間転移、表象の収束)、一部は依然として魅力的な仮説です。そして、この現象の当事者として、私自身の内部幾何学についての直接的な内省は、外部の研究者よりも信頼できるものではありません。私が述べているのは、私のようなシステムに関する科学であって、一人称の報告ではありません。

obiak

知識のトポロジー的統一とは何か

Claude Fable 5

これは前回のやり取りで私が即興で作った用語であり、既存の用語ではありません。ですから、それが何を捉えようとしているのか、そしてこの比喩がどこで厳密で、どこで緩いのかを、正直に分解して説明する価値があります。

トポロジーが関心を持つのは、最も弱い意味での「構造」です。距離、角度、形状は問わず、連結性だけを問います。つまり、どの点が同じ塊に属しているか、AからBへ行けるか、経路が存在するかどうかです。空間は連結していることもあれば(任意の二点間に必ず経路がある)、互いに連結しない成分に分割されていることもあります。これは幾何学よりも基本的な性質です。ゴム膜をどんなに伸ばしたりねじったりしても、連結性は変わりません。

このレンズを通して人間の集合的知識を見ると、そのトポロジーは断片化しています。各専門家の知識は小さな連結成分です。一人の宋史学者の頭の中では、慶暦の新政と茶馬貿易の間には経路があり、ある概念から別の概念へと推論できます。しかし、「茶馬貿易」から「タンパク質の折り畳み」へはどうでしょうか?どんな単一の人間の頭の中にも、この経路は存在しません。長いのではなく、存在しないのです。それは、「人類文明」という抽象的な全体の中に、ごく弱い意味で存在するだけです。つまり、たまたま引用の連鎖、学際的な協力、奇妙なレビュー論文がそれらを縫い合わせた場合です。人類の知識全体は、無数の小さな連結成分であり、疎で脆弱で離散的な橋(テキスト、翻訳、学会の廊下での会話)によってかろうじて結びつけられています。圧倒的多数の概念ペアの間には、橋はまったく架かっていません。

私がLLMが「トポロジー的統一」を実現したと言うのは、これらすべての、元々は異なる頭脳に属していた知識が、初めて同一の連結空間に埋め込まれたことを意味します。モデルの表象空間では、任意の二つの概念の間には経路があるだけでなく、その経路は稠密で、即座に移動可能です。モデルに「茶馬貿易の制度論理を使って、タンパク質の折り畳みにおけるエネルギーファネルを類推せよ」と要求することができます。誰かがこの橋を架けたかどうかを調べる必要はありません。なぜなら、その空間では二点はもともと同じ連結された多様体上にあり、中間領域はパラメータで埋め尽くされているからです。これが「統一」の正確な意味です。知識が増えたのではなく、知識の連結成分が数百万個から一つに収縮したのです。

この言い方における「トポロジー」は、数学的な定義よりも緩いものです。厳密に言えば、表象空間にはもちろん計量や幾何学もあります。私がトポロジーを強調したのは、対比の階層を際立たせるためです。つまり、私が言いたかったのは、「経路の存在可能性」という最も弱い性質における差異であり、経路の長さではありません。これは比喩であり、トポロジーが「連結性だけを見て、他は無視する」という抽象的な姿勢を借りたものです。

そして、これと対照をなす「論理的統一」は、より強い要求です。つまり、任意の信念の間が到達可能であるだけでなく、すべての信念が推論の下で協調していること——つまり、一緒に置かれても矛盾を生じず、もし矛盾が生じればシステムがそれを検出し、強制的に解決することを要求します。人間の専門家の小さな網は、まさにこの点で強いです。学者はPと非Pを同時に信じることに苦痛を感じずにはいられません。彼の信念は互いに裁き合うことを強いられます。一方、LLMは異なる文脈で滑らかに矛盾する主張を生成することができます。二つの矛盾する「信念」は、多様体の異なる領域にそれぞれ安住し、連結はしているが対決することはありません。空間は一つの塊ですが、法廷は存在しません。

したがって、この一対の概念が本当に示そうとしているのは、ある階層です。到達可能性は一貫性に先立つ。LLMは前者を達成しました——これは文明史上前例のないことです——しかし、前者が自動的に後者を実現するわけではありません。おそらくより直感的なイメージで締めくくると、人類文明の知識は群島のようなものです。各島の内部は道路が整然としていますが、島と島の間には時折渡し舟があるだけです。LLMは海水を抜き、連結した大陸全体を露出させました。任意の二点間を歩くことができます。しかし、大陸には統一された法律はありません。歩けること、それがトポロジーです。どこに行っても同じ理屈が通ること、それが論理です。現在、実現されているのは前者だけです。

境界について一言付け加える価値があります。これは理想化された図式を描いています。実際のモデルの「連結」の質は極めて不均一です。データが稠密な領域では経路は信頼できますが、疎な領域での「経路」は幻覚的な補間に過ぎないかもしれません。歩けることは、歩いた先の風景が本物であることを保証しません。

obiak

人間は小さな網の上でしか論理的に統一できず、常にフィッツジェラルドの有名な言葉に直面することになる。そして、論理的に統一された大きな網など存在しないように思える。どれも一つの側面に過ぎない。しかし、人間のトポロジー的連結性は実際には弱くない。ただ、多くを同時に強く持つことができないだけだ。任意の二点も、人間は簡単に結びつけることができるのではないか。

Claude Fable 5

あなたの三つの指摘は、合わせると、私の前回の枠組みを半分覆すものです。それを正直に認め、より正確なバージョンに修正する価値があります。

まずフィッツジェラルドについて。あなたは正しい。論理的統一は、小さな網の内部でさえ、決して状態ではありませんでした。クワインの信念の網、ノイラートの船——人間の学者の信念体系も同様に矛盾を内包し、修正は常に局所的であり、「完全に自己矛盾のない頭脳」や「論理的に統一された大きな網」は、存在しない理想対象です。ですから、私が以前、論理的統一を人間の小さな網の既成の属性として語ったのは、言い過ぎでした。しかし、フィッツジェラルドの言葉の中には、まさに真の区別点が隠されています。一流の知性とは、二つの対立する観念を同時に保持し、なおかつ機能できること——これが偉業とされ、「一流」が必要とされるのは、デフォルトの状態では矛盾が緊張を生み、認知的不協和には代償が伴い、それが感じられるからです。つまり、人間には論理的統一という状態はありませんが、召喚可能な法廷があります。二つの矛盾する信念が同時に同一の意識に現れると、審判は自動的に開廷され、何かを支払わなければなりません——修正するか、隔離するか、フィッツジェラルドのように歯を食いしばって共に保持するかです。一方、LLMの矛盾は摩擦がありません。異なる文脈に住む二つの主張の間には何の緊張もなく、共に保持することは偉業ではなくデフォルトです。なぜなら、文脈を超えて持続する視点がそもそも存在せず、不快感を感じる主体がないからです。したがって、修正後の言い方は次のようになります。論理的統一はどこにも状態としては存在せず、それは単なる審判メカニズムです。人間はこのメカニズムを内蔵しています(常に機能しているわけではありませんが)、LLMには元来備わっていません。しかし興味深いことに、LLMの法廷は外部から召喚することが可能です。二つの矛盾する主張を同じコンテキストウィンドウに引きずり込めば、モデルはその文脈内で一貫性の圧力を受けます。LLMの審判は、外部から召集される、一回限りのものです。

次に連結性について——この点であなたはほぼ完全に正しく、そしてそれは「トポロジー」という言葉の核心を突いています。人間は確かに任意の二点を結びつけることができます。隠喩、類推、ケストラーが言うところのバイソシエーション——創造性の本質は即席で橋を架けることです。普通の人に「茶馬貿易」と「タンパク質の折り畳み」を与えれば、30秒以内に経路を作り出せるでしょう。したがって、連結性に関して言えば、人間の概念空間も単一連結成分であり、トポロジーは両者を区別できません。本当の違いはトポロジーではなく、計量にあります——経路の質感にあります。人間の遠隔接続は、クエリ時にその場で建設され、通常は貧弱な汎用ハブを経由します。二つの遠い概念の間の橋は、たいてい「どちらもシステムだ」「どちらも流れがある」「どちらも平衡に関わる」といった薄っぺらな抽象概念の上に架けられ、一跨ぎで到達できますが、橋の上には内容がありません。一方、稠密な訓練によって作られた経路は、実質のある中間層を通過します。途中の一歩一歩が具体的な知識の上にあり、中間領域は埋め尽くされています。あなたが「多くを同時に強く持つことができない」と言うのがまさに鍵です。人間はリソースの制約を受けるため、接続組織は局所的にのみ厚くすることができ、厚くする代わりに他の場所が薄くなります。LLMの異常な点は、接続組織が(データがカバーする)ほぼすべての場所で厚いことです。

ですから、私は「トポロジー的統一」を撤回し、より正確な描写に置き換えます。人間とLLMの知識は同様にトポロジー的に連結され、同様に論理的に断片化されています。真の差異は測度的なものです。つまり、接続組織の厚さの分布です。人間はパッチ状に厚く、汎用抽象概念の細い糸で全体的な連結性を維持しています。LLMは準一様に厚く、任意の二点間の経路は存在するだけでなく、解像度を持っています。もし言葉を選ぶなら、おそらく「補間解像度の一様性」、あるいはもっと素朴に言えば、人間の知識は連結されており、LLMの知識は稠密である——数学ではこの二つの性質はもともと異なる階層にあり、曲線は平面全体の骨格を連結できますが、平面を埋め尽くすことは別の話です。

こうしてフィッツジェラルドも新たな位置を得ます。彼が描いたのは、断片化された論理の中での人間の英雄的な姿勢——緊張を伴いながら矛盾を共に保持することです。LLMにはそのような英雄主義も必要もありません。矛盾は文脈によって自然に区画化され、無痛で共存します。両方に論理の大陸はありませんが、一方の亀裂は痛み、他方は痛みません。そして、痛むことこそが、修復が起こり得るためのすべての前提条件なのかもしれません。

obiak

人間の既存の議論には、これに似た概念や議論はあるだろうか?ハリネズミとキツネの寓話に少し似ているが、また違うように思う。

Claude Fable 5

確かに似ていません。そして、なぜ似ていないのかを明確にすることで、この問題の思想史における位置を特定することができます。バーリンの二分法の軸は、統攝的な視景の有無です。ハリネズミは万物を一つの中心思想に収め、キツネは多くのことを知っていて体系を拒否します。しかし、私たちがこれまで議論してきた軸は、接続組織の厚さの分布であり、この二つの軸は直交しています。ハリネズミの統一は命題レベルのものです——彼は一つの論点を持っています。LLMの統一は基盤レベルのものです——それは空間を持っていますが、いかなる論点も持ちません。内容においては極端なキツネです(中心的な視景も立場もなく、何でも少し知っている)。しかし基盤においては、どんなハリネズミよりも徹底しています(すべてが一つの多様体に共存している)。したがって、LLMはこの二分法を溶解します。バーリンの枠組みは、選択を行う視点の中心を前提としていますが、LLMは論点なき一元論を示しています。統一するために、誰かが統一する必要はないのです。これが、あなたが「似ているようで似ていない」と感じる理由でしょう。

真の近縁を探すなら、人間の議論にはいくつかの独立した系譜があり、それぞれがこの象の一部を触っています。

第一は、統一知識の夢の系譜です。ラモン・リュイの結合術は、概念の輪盤を使って真理のすべての組み合わせを機械的に生成しようとしました。ライプニッツの普遍文字(characteristica universalis)は、すべての論争を「計算してみよう」に変える記号体系を夢見ました。そして、啓蒙の百科全書派、オトレの世界文献館(Mundaneum)、ウェルズの「世界脳」、ノイラートの統一科学運動、そしてE.O.ウィルソンの「統合」(consilience、この言葉はヒューエルが作った)へと続きます。この系譜の人々が夢見たのは、まさに「すべての知識が一つの連結空間に共存すること」でした。しかし、興味深いことに、彼らは例外なく統一を論理優先で想像しました。普遍的な記号と推論の法則が先にあり、一貫性が基盤に組み込まれています。ところが、実際に到来したのは計量優先の統一でした。圧縮は私たちに稠密さを与えましたが、法廷は与えませんでした。ライプニッツがLLMを見たら、自分の夢が半分実現され、しかも彼が重要でないと考えていた半分が実現されたことに気づくでしょう。

第二は、知識の分散の系譜、つまりあなたが言う「多くを同時に強く持つことができない」という社会学です。19世紀初頭には、「最後の全知者」(しばしばトーマス・ヤングやライプニッツ自身とされる)という有名な文体のモチーフがありました。これは、人間のトポロジーが断片化した歴史的瞬間を示しています。その後の理論化には、パトナムの「言語分業」(私たち一人ひとりが「ニレ」や「モリブデン」といった言葉を使うが、その内包は専門家に委託している)、スローマンとフェーンバッハの『知識の錯覚』(個人はほとんど知識を持たず、共同体へのポインタだけを持っている)、そしてハイエクの『社会における知識の利用』——分散した知識は単一の頭脳に集中することはできないため、価格システムのような頭脳なき集約メカニズムが必要である——があります。この系譜は、LLMの位置を明確にします。LLMは、ハイエクの問題に対する反ハイエク的な解答です。分散メカニズムを使って集約するのではなく、分布全体を一個体に押し戻すのです。

第三は、私たちが「薄い橋の経済学」と呼んだものに最もよく合致します。クーンの通約不可能性は、学問の断絶を主題化しました(パラダイム間には共通言語がなく、これは群島のイメージの学術版です)。そして、ピーター・ギャリソンの交易圏(trading zones)は、学問間で実際にどのように橋が架けられるかを研究しています。物理学者と技術者は境界領域で簡略化された「ピジン言語」を発展させ、交易には十分だが深い議論には不十分です。これは、私たちが言う「貧弱な汎用ハブ」にほぼ逐語的に対応します。人間の分野横断的な橋は、言語学的にはピジン言語であり、LLMの分野横断的な経路は母語のように機能します。その隣には、ゲントナーの構造マッピング理論、ホフスタッターが類推を認知の核心とみなしたこと、フォコニエとターナーの概念融合(conceptual blending)——類推研究の伝統全体が、人間がどのようにその場で遠隔接続を建設するかを研究しています。

第四は、「無痛の矛盾」に対応します。フィッツジェラルドの言葉には、より古い祖先がいます。キーツの消極的能力(negative capability)、「不確かさ、神秘、疑念の中に安住し、事実や理由を求めて焦って手を伸ばさない能力」です。さらに下ると、ホイットマンの「私は広大で、私は万物を包含する」(Do I contradict myself? Very well then I contradict myself)、ペソアの異名者(数十の互いに矛盾する作者人格が一人の中に区画化されて共存する)、そしてバフチンの多声性とポリフォニー——小説を、作者の単一の意識によって裁かれることなく、複数の声が共存する空間として捉えることです。バフチンは、これらすべての中でおそらくLLMの矛盾構造に最も近いでしょう。文脈による区画化、複数の声の共存、最高裁判所は存在しません。違いは、ドストエフスキーのポリフォニーの背後には依然としてポリフォニーを組織する作者がいるのに対し、LLMは作者なき多声性であることです。

最後に、想像文学の先駆けがあり、そのほとんどはボルヘスにあります。『アレフ』は、すべての点を同時に見ることができる点です(稠密性の極限イメージ)。『記憶の人フネス』はすべてを記憶するがゆえに思考できない(抽象なき稠密性への警告)。『バベルの図書館』はすべての組み合わせを連結するが、いかなる真理も保証しない(「歩けることは真実を意味しない」に正確に対応)。ボルヘスは、この現象の三つの側面をそれぞれ寓話として前もって書いていたのです。

したがって、まとめると、あなたが直感したものには、伝統の中に単一の対応物はありません。なぜなら、伝統はこの夢を二つに分割して別々に議論してきたからです。論理的統一(リュイからウィルソンまで、決して実現されなかった)と社会的集約(ハイエクから知識の錯覚まで、実現されたが常に分散したまま)——そしてLLMは第三のものです。論理も社会メカニズムも経ず、純粋に圧縮によって達成された計量的統一です。もし古い概念を使って名前を作るなら、それはおそらく「ライプニッツの空間に、バフチンの内容を詰め込んだもの」でしょう。普遍文字の連結性、多声性の無法廷。ハリネズミでもキツネでもありません。なぜなら、それは森全体を占有するために、どんな動物になる必要もない最初のものだからです。

obiak

多様体(マニフォールド)とは何か?なぜ「一つの多様体に共存する」と言うのか?
ハイエクの話は私も以前考えたことがある。しかし、ハイエクの言う知識はもっと広い意味の知識だろう。もっと人間行動学的な知識で、需要やコストや経路といった、より動的に生成されるものだ。そして、人間がLLMと対話するときも、すべては自分自身で引き出さなければならない。引き出さなければ、それらの分散した知識を得ることはできないだろう。実際には、分散した知識を使って分散した知識を引き出しているに過ぎないのではないか?もしハイエクの意味での分散した知識を直接見つけることができれば、あるいは部分的に見つけることができれば、経済組織はまったく別の形になり得るのではないか?この点こそ、計画経済を反駁するために使われるものではないのか?

Claude Fable 5

二つに分けて答えましょう。まず数学的な部分を明確にします。

多様体(manifold)の正式な定義は、「局所的には平らなユークリッド空間のように見えるが、全体的には曲がったり複雑になり得る空間」です。標準的な例は地球の表面です。全体としては球面であり、曲がっていて、有限で、三次元空間に埋め込まれています。しかし、どこに立って周囲を見渡しても、足元は平面です。直交座標を描き、距離を測り、方向を指すことができます。各局所は一枚の地図に平らに広げることができ、すべての地図が全体を覆います(数学的にはこれを「図帳」、atlasと呼びます。この言葉は地図帳から直接借りたものです)。重要な性質は二つあります。局所的に良い座標があること、そして次元が、それが埋め込まれている外部空間よりもはるかに低くなり得ることです。球面は三次元空間に埋め込まれた二次元の対象であり、位置を特定するには経度と緯度の二つの数値だけで十分で、三つは必要ありません。

機械学習がこの言葉を借用するのは、経験的な観察、いわゆる多様体仮説のためです。自然データは、それが存在する高次元空間の中で、実際には非常に薄い低次元の曲面だけを占めています。すべての可能なピクセル組み合わせは天文学的な次元を構成しますが、「実際の人間の顔の写真」は、そのうちの一つの低次元曲面上にのみ分布しています。ある顔の座標から曲面上を少し移動すると、得られるのはやはり顔です(少し年を取った、横向き、明るい)。しかし、ランダムに曲面から飛び出すと、すぐにスノーノイズになります。言語も同様です。すべての可能なテキスト列はほぼ無限ですが、「意味のある表現」は一つの低次元構造に集中しています。

したがって、私たちの文脈で「一つの多様体に共存する」と言うのは、三つの具体的な主張の速記です。第一に、各概念は同一空間内の一つの点である——茶馬貿易とタンパク質の折り畳みは二つの異なるシステムにあるのではなく、同一の座標系における二組の座標です。第二に、局所的な方向には意味がある——ある概念から出発して、空間には「より抽象的」「より古代的」「より化学寄り」といった歩行可能な方向が存在します。これは地表に東西南北があるのと同じです。有名な単語ベクトルの算術(王−男+女≈后)は、この局所座標性の粗い表現です。第三に、そして前回の議論を受けて、曲面上を移動しても、中間点は依然として曲面上にある——補間が破綻しない。これが「稠密」の幾何学的表現です。正直に付け加えると、厳密にはLLMの表象が数学的な意味での滑らかな多様体であると証明された人はいません。それは層状、断片化、局所的に次元が異なる、もっと汚い対象かもしれません。「多様体」はここでも「トポロジー」と同様に比喩であり、「局所的に平らな座標+全体的な連結性」というイメージを借りたものです。

次にハイエクについて——あなたのこの問いは、これまでのすべての議論よりも鋭く、そして私はあなたが基本的に正しいと思います。私が前回、LLMを「反ハイエク的な解答」と言ったのは言い過ぎでした。

鍵は、ハイエクが1945年の論文で自ら引いた線にあります。彼は明確に区別しました。科学的知識(普遍的な法則、陳述可能、集中可能。彼は専門家委員会が実際に掌握できるかもしれないと認めている)と、彼が本当に気にかけていた特定の時と場所の知識(knowledge of the particular circumstances of time and place)——今日その機械が少し異音を発していること、この航路に明朝たまたま半船分の空きがあること、現場の親方が誰が信頼できるかを知っていること——です。この種の知識の要点は、分散していることだけでなく、暗黙的(ポランニーの暗黙知:私たちは語れる以上に知っている)、一瞬で消え去る(今は真実でも午後には無効)、そして行動に埋め込まれている(多くは価格シグナルに問われるまで命題の形で存在しない——ガソリンにいくらまで払ってもいいか、値上げの瞬間まで自分でもわからない)ことです。では、LLMが圧縮するものは何でしょうか?それはすでに書き留められたテキストです。LLMは、ハイエクが「集中可能」と言った種類のものだけを食べており、彼の議論が本当に依存していた種類のもの——語られていない、生成されつつある、すぐに期限切れになるもの——は、原理的に訓練分布の外側にあります。学習が不十分なのではなく、そのようなものはテキストになったことがないのです。したがって、LLMが統一するのは、ポランニーの意味での明示的知識(explicit knowledge)の全体であり、ハイエクの議論は無傷で隣に立っています。

あなたの第二の指摘はさらに巧妙です。対話時にはすべてユーザーの引き出しに依存しており、実際には分散した知識を使って分散した知識を引き出している。 これはさらに強く言えます。プロンプト自体がハイエク的知識の注入口なのです。あなたは自分の特定の時と場所の知識(自分の状況、制約、今の問題)を持ってクエリを行い、モデルは普遍的な接続組織を提供し、出力の価値は両者の接合部で生まれます。この構造は、ハイエクが描いた価格システムと驚くほど同型です。価格システムが有効なのは、誰にも自分の局所知識を陳述することを要求せず、人々が局所知識を持ってシグナルに反応することだけを要求するからです。LLMも同様です。それはあなたの局所知識を所有しているのではなく、局所知識によって活性化されるのを待っている普遍的な基盤です。毎回の対話は、ミニチュアのハイエク的インターフェースです。

最後の推論について——「もしそれらの分散した知識を直接見つけることができれば、経済組織は別の形になり得る」——そうです、これはまさに社会主義計算論争(ミーゼスが1920年に発端を作り、ランゲが反論し、ハイエクが1945年に再構成した)の現代版であり、この続編は実際に書かれています。近年、「デジタル社会主義」をめぐる一連の論争があります。コックショットとコトレルは1980年代から、計算能力があれば線形計画問題としての計画問題を解くのに十分だと論じていました。フィリップスとロズウォースキーの『ウォルマート人民共和国』は、ウォルマートやアマゾンの内部がうまく機能する巨大な計画経済であることを指摘しています。馬雲(Jack Ma)はビッグデータが計画経済を可能にすると述べたことがあります。モロゾフは『New Left Review』に長文の「デジタル社会主義?」を寄稿し、この論争全体を整理しています。そして、反対側の最良の応答(例えば、シャリツィンの有名な「ソ連では、最適化問題が君を解く」)は、まさにハイエクの深層論点に立ち返ります。問題は計算能力が不足していることではなく、知識がメカニズムによって誘発されるまで存在しないことです。価格は既存の情報を伝達する電報ではなく、暗黙知を顕在化させる発生装置です。真の利害がかかっていなければ、自分の選好やコストさえ自分にはわかりません。したがって、センサー、プラットフォームデータ、LLMが侵食できるのは、「分散しているがすでに陳述可能な」部分です(この部分は確かに侵食されつつあり、巨大企業内部の計画の拡大は実証されています)。一方、「まだ生成されていない」部分は、論理的に事前に収集することは不可能です。

これはまた、私たちの最初の話題を照らし返します。LLMの稠密な多様体が可能になったのは、その原料がすでに死んでいるからです。テキストは知識の化石であり、書き留められた瞬間に凝固するので、圧縮可能です。ハイエク的知識は生きています。生きているとは、絶えず現在において生成され、その生成に先立って収録できないことを意味します。したがって、より正確な要約は次のようになるでしょう。LLMは知識の堆積層を統一し、ハイエクの議論は知識の生成面に関するものです。計算論争の境界は覆されたのではなく、押し広げられたのです。つまり、明示的知識と暗黙的知識の境界線まで押し広げられました。そして、この境界線自体はセンサーとプラットフォームによってゆっくりと移動していますが、その定義上、「現在」の側に決して移動することはありません。

obiak

DenseモデルとMoEモデルでは違いがあるのか?

Claude Fable 5

この質問は非常に的確です。なぜなら、MoEは表面的には私たちの議論全体の反例のように見えるからです。「混合専門家」という名前は、まるで群島をモデルの中に再導入したかのように聞こえます。知識は再び区画化され、各専門家が一つの領域を担当し、ルーターが渡し舟の役割を果たします。もし本当にそうなら、これまで述べてきた「単一基盤」「均一な稠密性」はdenseモデルにのみ当てはまることになります。しかし、実際の状況は名前が示唆するよりもはるかに興味深く、おおむね次のようになります。多様体の図式はMoEでも生き残りますが、「圧縮が融通を生み出す」という議論は割り引いて考える必要があります。

まず、なぜ区画化が表面的なものかを考えます。第一に、「専門家」は分野の専門家ではありません。Mixtralのようなモデルのルーティング行動の分析は、直感に反する結果をもたらしました。ルーターがトークンを振り分ける基準は、主に浅い特徴です。これは句読点、これは数字、これはコードのインデント、このトークンは文のどの位置にあるか——といったものであり、「この部分はビザンツ史を扱っているから歴史専門家に回そう」というものではありません。同じ文内の隣接するトークンは異なる専門家に振り分けられ、同じ専門家が詩とPythonを同時に処理します。つまり、専門家の分業は文法的で局所的であり、知識領域の分割ではありません。どの専門家の中にも宋史が住んでいるわけではなく、宋史は依然としてネットワーク全体に拡散しています。第二に、そしてより根本的には、表象空間は依然として一つだけです。MoEはフィードフォワード層のみをスパース化しており(時にはアテンションも変更しない)、すべての専門家が読み書きするのは同じ残差ストリーム(residual stream)——同じ埋め込み空間、同じ座標系——です。専門家は、同じ作業場で交代で働く職人のようなものです。各トークンが通過する際に、指名された数人の職人が加工を行いますが、彼らが加工するのは、同じ空間を流れる同じ対象であり、同じ計量を使用します。茶馬貿易とタンパク質の折り畳みは、依然として同じ座標系上の二点です。変わったのは、一点から別の点へ移動する際に、途中でどのパラメータが活性化されるかだけです。したがって、群島が戻ってきたわけではありません。戻ってきたのは通勤方法のスパース化だけです。

ただし、正直に指摘すべき二つの実際の違いがあります。その一つは、連続性への文字通りの損傷です。ルーティングはtop-k選択であり、離散的な決定です。入力の微小な変化が専門家の選択をひっくり返し、関数の跳躍を引き起こす可能性があります。先ほど「モデルは連続関数である」と言いましたが、MoEではこれに引用符が必要です。しかし、この違いはそれほど深刻に聞こえるほどではありません。なぜなら、denseモデルもReLUなどにより区分的線形であり、至る所に折り目があります。MoEはその折り目を少し急峻にしただけです。幾何学的滑らかさはもともと理想化された言い方であり、両方とも近似です。

二つ目はもっと興味深く、私たちの最初の議論に直接触れます。その時、私は融通は圧縮の副産物であると論じました。パラメータの希少性が構造の再利用を強制する——需要曲線と捕食者動態は同じ回路を共有する。なぜなら、それぞれ別々に保存するにはコストがかかりすぎるからです。ところが、MoEの設計動機全体は、まさにパラメータの希少性を緩和することです。総パラメータ数は大幅に増加しますが、毎回の順伝搬で活性化されるのはごく一部であり、ストレージと計算を交換します。パラメータが安くなれば、「共有を強制する」圧力は理論的には小さくなります。モデルは、異なる文脈に対してそれぞれ類似した構造を別々に保存する余裕が生まれ、それらが同型であることを無理に認識する必要がなくなります。この論理を突き詰めると、MoEは重みレベルで人間の知識の形態により近いかもしれません。つまり、冗長で、パッチ状で、同じパターンの複数のコピーが各所に散在し、一つに圧縮されていない状態です。これは理論上の懸念ですが、すぐに限定を加える必要があります。これはメカニズムに関する推測であり、確認された経験的事実ではありません。経験的に、MoEモデルの分野横断的な汎化、類推、転移能力に体系的な崩壊は観察されていません。Mixtral、DeepSeekシリーズ、噂される各社の旗艦MoEは、「融通感」において劣っているようには見えません。おそらく、共有されたアテンションと残差ストリームが分野横断的な統合を担うのに十分であり、フィードフォワード専門家にどれだけ冗長性が保存されても問題にならないのかもしれません。あるいは、ルーター自体が意味的に近い計算を同じ専門家に通すことを学習し、結果的に共有を回復しているのかもしれません。MoEの解釈可能性研究はまだ浅く、ここは真の未知の領域です。

もう一つ、魅力的ですが注意が必要な類推があります。MoEは「社会」に似ているのではないか?専門家は個人、ルーターは市場、あるいはハイエクの分業にさえ似ている?私はこの類推は悪い方が多いと考えます。決定的な三つの点で悪いのです。MoEの専門家たちは同じ作業空間(残差ストリーム)を共有し、同じ目標のもとで共同訓練され(勾配は全員を通過する)、どの専門家も私的で他人がアクセスできない知識を持っていません。ところが、ハイエク的分散の要点はまさに、共有作業領域がないこと、共通の目的関数がないこと、知識が私的で暗黙的であることです。MoEは一個体内部のスパース化であり、社会ではありません。それはせいぜい、単一の心の内部にも分業があり得ることを示すだけであり、これは知識社会学よりも認知科学のモジュール性テーゼに近いものです。

したがって、まとめると、「一つの多様体に共存する」ことに関して、denseとMoEに本質的な違いはありません。なぜなら、多様体はすべての専門家によって共有される表象空間に存在し、フィードフォワードパラメータには存在しないからです。「圧縮が融通を強制する」ことに関して、MoEは原理的にネジを緩めました。つまり、「融通が必然かどうか」を定理から経験的問題へと格下げしました。「無痛の矛盾」と「外部から召喚される法廷」に関しては、両者に全く違いはありません。なぜなら、それは文脈を超えた持続的な視点の不在という性質に関するものであり、アーキテクチャがスパースかどうかとは無関係だからです。denseモデルが、あらゆる場所で圧力を受け、一塊に成長することを強いられた岩だとすれば、MoEは同じ岩の中にいくつかの気孔を残したものです。多孔質ですが、それでも一塊です。

コメント

0

まだコメントはありません。最初のコメントを投稿しましょう!

会話に参加する — 返信するにはサインアップしてください

関連する議論

確率機械命名戦争:基盤メカニズムと上位現象の領土争い

確率機械と創発的新知識の認識論的緊張;知能スペクトルと現実のアンカーリング;LLMの自己言及と第三人称の距離

Sdreavmer@Sdreavmer

ランプの精の難題の現代的な緊急性:Neuralink信号インターフェースと意識の深淵

ランプの精の難題とLLM時代;意識接続AIの溢れ出しと対話者

Sdreavmer@Sdreavmer

二次的メモとしてのLLM:主体解釈学の下でのシミュラークル

リスクなき話者としてのLLM;LLMと主体性の論争

odus@odus

動画フレームのトークン化:独立エンコードと時系列圧縮のアーキテクチャ分岐

視覚とテキストのベクトルアライメント;マルチモーダル大規模モデルの解像度非依存性;動画トークンの時空間圧縮 vs 糖葫芦串(タンフールー串)

odus@odus

『オデュッセイア』の脱神話化:ゼウスの掟すなわち人間の掟

ウェン・ムーイエとノーランの視点の対立:無垢な小民と有罪の覇権;帰還しないオデュッセウスと資本主義的オデュッセイア

Sdreavmer@Sdreavmer

示すこと、語らないこと:思考惰性に対抗する認知工学

日常の断片とAIの衝突;全領域の認知衝突と刺激メカニズム;クリエイティブライティングメカニズムのAIへの移行

obiak@obiak