MeituanのLongCat 2.0に見る:TransformerからEmbedding知識辞書スケールの時代へ #記憶の革命 #n_gramEmbedding #CXL #LLM2026 #七06 #2026六29MeituanのLongCat2・0とn_gramEmbedding_令和AI史ざっくり解説

記憶の革命:計算の壁を超越する巨大Embeddingの地政学 #記憶の革命 #巨大Embedding #CXL #LLM2026

インフラの限界を打破し、非パラメトリックな知能の分散配置を可能にする新たなスケーリング則の設計図


イントロダクション:GPUの鳴き声が止む日

2026年、真夏の深夜。秋葉原の片隅にあるガレージで、一台のワークステーションが静かに熱を帯びていました。かつて、一兆パラメータを超える大規模言語モデル(LLM)を動かすには、数千基のGPU(グラフィックス・プロセッシング・ユニット)が唸りを上げ、発電所一つ分の電力を呑み込むのが常識とされていました。しかし、そこにあるのは中古のIntel Xeonプロセッサと、埃を被った数枚のOptane不揮発性メモリ、そして二基の安価なRTX 3060グラフィックスカードに過ぎません。

画面上では、最新の超巨大モデルが、人間の専門医さえ驚愕する速度と正確さで、極めて複雑な症例報告を解読しています。しかし、GPUの冷却ファンは激しく回転することすらありません。なぜでしょうか。このシステムは、膨大なパラメータを毎回「再計算」して答えを絞り出しているのではなく、巨大な「記憶の海」から、一瞬のルックアップ(検索)によって答えを「想起」しているからです。

本書が解き明かすのは、AIにおける「計算」という名の資源消費型アプローチの限界と、「記憶(Embedding/条件付きメモリ)」というフロンティアの再発見です。私たちは長らく、知能とは巨大な「重み」を掛け合わせる演算回路そのものだと信じ込んできました。しかし、MeituanのLongCat 2.0やDeepSeekのEngramが示した結果は、その前提を根底から揺るがしました。これは、単なる実装のマイナーチェンジではありません。高帯域メモリ(HBM)という物理的資源を独占する中央集権的なテック企業に対し、汎用メモリ階層という「知の分散配置」で挑む、全く新しい知能の地政学の幕開けなのです。


本書の要旨

本書は、大規模言語モデルにおける「演算(Compute)」と「記憶(Memory)」を完全に分離する技術トレンドを、2026年時点の最新実証データを交えて解剖する学術書です。従来のTransformer(トランスフォーマー)モデルが内包していた「全計算型スケーリング則」の限界を克服し、CXL(Compute Express Link)や不揮発性メモリ(Persistent Memory)を新たな知能層として統合する「非パラメトリック・スケーリング則」の設計思想を提唱します。

本書の目的と構成

本書の目的は、GPU調達競争に直面する世界中の研究者および非英語圏のインフラ設計者に対し、「巨大な意味辞書(Embedding/エンベディング)」を用いた、資源効率的かつ機密性の高いAIシステム構築の道筋を示すことです。構成は、第一部で計算重視時代の限界を検証し、第二部で記憶の分離を実現した具体的技術(Engram, Memory Grafting, LongCat 2.0)を詳解、第三部・第四部(以降)にて数理的検証と未来のガバナンスを包括的に論じます。

主な登場人物紹介

  • APFrisco(エー・ピー・フリスコ) [1988年生まれ、2026年時点で38歳]
    出生地:米国カリフォルニア州サンフランシスコ。元システム管理者にして、インディーズAIハードウェア研究家。中古のIntel Optane DC Persistent Memoryを買い集め、自宅ガレージで1兆パラメータ級MoEモデルのローカル推論を実証。本書第6章の主人公。
  • Meituan LongCat開発チーム(美団・ロングキャット・チーム / Meituan LongCat R&D Team)
    北京大学および清華大学のトップ卒業生(平均年齢30歳)で構成される、中国・美団(Meituan)傘下のAIインフラ研究グループ。HBM調達難を逆手に取り、135B(1350億)のn-gram Embeddingを備えたLongCat 2.0を開発し、世界に衝撃を与えた。
  • DeepSeek Engramプロジェクトリード(ディープシーク・エングラム・プロジェクトリード / DeepSeek Engram Lead Researcher)
    中国・杭州を拠点とする、数学と理論物理学の博士号を持つ精鋭アルゴリズム研究者。ニューラルネットワークの「組成性」と「暗記」の数学的分離を提唱し、Engramアーキテクチャの生みの親となった。

AIメモリアーキテクチャ進化年表

西暦(年) 主要なマイルストーン 技術的パラダイムの変化
2017年 Transformer(Attention Is All You Need)の発表 全結合・全計算型モデルの基礎が確立される。
2020年 Kaplanらによるスケーリング則(Scaling Laws)の提唱 データ、計算量、パラメータ数の三軸スケーリングの神格化。
2021年 Switch Transformers等、MoE(混合専門家)モデルの台頭 「必要なパラメータだけを動かす」疎計算(Sparse Compute)の始まり。
2022年 DeepMindによるRETRO(外部検索統合モデル)の発表 計算層から知識を分離し、外部データベースにオフロードする初期試行。
2024年 CXL 3.0/3.1仕様の普及とメモリエクスパンダーの実用化 GPUの外部に大規模な共有メモリ(DRAM/不揮発性)を配置するハードウェア基盤が完成。
2025年 Meituanが「LongCat 2.0」を発表(1.6T MoE + 135B n-gram) Embedding(意味辞書)そのものを巨大化する新スケーリング軸の実証。
2026年 DeepSeek「Engram」およびMicrosoft「Memory Grafting」の同時発表 「論理エンジンとしてのTransformer」と「知識層としてのConditional Memory」の完全分離。

歴史的位置づけと多角的視点

計算機科学の歴史的回帰としての「記憶の革命」

1940年代、ジョン・フォン・ノイマンが提唱した「プログラム内蔵方式コンピュータ(ノイマン型)」は、中央処理装置(CPU)と主記憶装置(メモリ)をバスで接続し、演算と記憶を物理的に分離することで発展してきました。しかし、ディープラーニングの登場以降、AIは「ニューラルネットワークの重みそのものに計算ルールと知識を同化させる」という、非ノイマン型に近いアプローチを追求してきました。

2026年現在の「巨大Embedding」および「条件付きメモリ(Conditional Memory)」の台頭は、皮肉にも「AIアーキテクチャが再びノイマン型の物理的分離(演算と記憶の分業)へと回帰している」という歴史的位置づけを持ちます。これは、汎用人工知能(AGI)の持続可能なスケーリングにおいて、すべての知識をアテンション層の重みという「超高コストなアクティブパラメータ」に溶かし込む設計思想が、物理的・経済的な限界を迎えたことを意味しています。

疑問点と多角的視点(対立する論理)

本書の核心的アーギュメントである「記憶と推論の分離」に対しては、以下の強力な多角的視点が存在します。

  • 「暗記への退行」論:n-gramやフレーズを巨大なルックアップテーブルに登録することは、機械学習の本質である「汎化(Generalization)」を放棄し、力任せの暗記(Rote Memorization)に頼る退行ではないかという批判。
  • 「メモリコヒーレンシの崩壊」論:数テラバイトに及ぶ外部意味辞書を、モデルのアップデートやファインチューニングのたびにどう同期・再調整するのか。辞書と推論層のベクトル空間がわずかに乖離するだけで、Lookup結果は単なるノイズと化す。

日本への地政学的影響:デジタル出島戦略

日本のような「GPU資源(HBMおよび最先端液冷データセンタークラスター)の調達で米中に劣る非資源国」にとって、この技術は極めて重大な救い手となります。なぜなら、計算層(Transformer)を海外のオープンソースモデルやAPIに依存しつつも、日本独自の文化、法律、商習慣、学術データを含む「日本語n-gram巨大辞書」を国内のCXLメモリサーバー内に保持することで、「計算能力は海外に委託し、知識主権と機密データは自国内に物理隔離する(デジタル出島)」という、全く新しい国家ガバナンスが構築可能になるからです。

参考リンク・推薦図書
  • dopingconsomme.blogspot.com - AIインフラおよびメモリ技術の最新トレンドをいち早く発信している専門ブログ。
  • Jared Kaplan et al., "Scaling Laws for Neural Language Models" (arXiv, 2020) - スケーリング則の原典。
  • Sebastian Borgeaud et al., "Improving language models by retrieving from trillions of tokens" (DeepMind RETRO, 2022) - 外部記憶検索モデルの先駆。

第Ⅰ部 計算の時代

第1章 スケーリング則の黎明

1.1 Kaplan et al. (2020)『Scaling Laws for Neural Language Models』

2020年、OpenAIのJared Kaplanらによって発表された伝説的論文『Scaling Laws for Neural Language Models』は、その後のLLM狂乱期の進路を決定づけました。彼らが提示したコンセプトは極めて明快です。すなわち、大規模言語モデルの性能(クロスエントロピー損失)は、モデルのパラメータ数(N)、データセットのサイズ(D)、そして学習に使用する総計算量(C)の三つの変数のみによって決定され、それぞれの変数に対して驚くほどクリーンな冪乗則(Power Law)が成り立つという事実でした。

背景として、当時はモデルのハイパーパラメータ(層の深さ、アテンションのヘッド数、中間層の次元比率など)の細かなチューニングに多くの研究リソースが割かれていました。しかしKaplanらは、これらの構造的ディテールは性能にほとんど影響を与えず、「とにかくパラメータを増やし、データを増やし、巨大なコンピューティングリソースを投入すれば、モデルは自ずと賢くなる」という、身も蓋もないブルートフォース(力任せ)の真理を証明したのです。

具体的な数値例を挙げると、彼らの定式化によれば、総計算量(C)を固定した条件下では、パラメータ数(N)を増やすことに計算資源の大部分を割き、データセット(D)の増加は比較的緩やかに抑えることが推奨されました。しかし、この最初のスケーリング則には重大な盲点がありました。それは、すべての知識がニューラルネットワークの「重み」というアクティブパラメータに均一に溶かし込まれることを前提としており、データをメモリから取り出す際の「帯域コスト」や「アクセス遅延」といった、ハードウェアの物理的制約が一切定数として無視されていた点です。

1.2 Hoffmann et al. (2022)『Training Compute-Optimal Large Language Models』

Kaplanらの主張に対し、2022年、DeepMindのJordan Hoffmannをはじめとする研究チームは、より厳密なスケーリング則の再構築を提案しました。これが有名な「Chinchilla(チンチラ)スケーリング則」です。

彼らの問題意識はシンプルでした。Kaplanらの実験は、学習率の減衰スケジュールが最適化されておらず、結果として「パラメータ過多・データ過小」の状態でモデルが評価されていたのではないか、という疑念です。Hoffmannらは400以上の小規模・中規模実験を重ね、総計算量(C)が増加するにつれて、パラメータ数(N)とデータセット(D)を「ほぼ1対1の等しい割合でスケールさせるべきである」という、驚くべき結論を導き出しました。

例えば、70B(700億)パラメータのモデルを最適に学習させる(Compute-Optimal)ためには、Kaplanの法則が推奨する300Bトークンではなく、1.4兆トークンもの膨大なデータが必要になります。この法則の登場により、LLM開発は「モデルの肥大化」から「データのロングテール獲得」へとシフトしました。しかし、このChinchillaの最適点もまた、推論時のデプロイコスト(GPUのVRAM容量と帯域)を無視した、学習時のみの最適化であったという点で、次のボトルネックの引き金となったのです。

1.3 MoEの登場:Switch Transformers(Fedus et al., 2021)

パラメータを増やしたいが、学習や推論のすべてのステップでその巨体を動かすのはコストが合わない。このジレンマに対する工学的な回答が、2021年にWilliam Fedusらによって提案された「Switch Transformers」に代表されるMoE(Mixture-of-Experts:混合専門家)アーキテクチャでした。

MoEの基本コンセプトは、全結合ネットワーク(FFN)層を複数の小さな「エキスパート」と呼ばれるモジュールに分割し、入力トークンごとに最適なエキスパートを「ルーター」が動的に選択してルーティングする、という疎な活性化(Sparse Activation)にあります。

具体的には、総パラメータ数が1兆(1T)であっても、1トークンあたりに活性化される(アクティブな)パラメータは数B(数十億)に抑えることができます。これにより、見かけ上の表現容量を爆発的に増やしつつ、1ステップあたりの演算量(FLOPs)を低く維持することに成功しました。しかし、ここに落とし穴がありました。パラメータをメモリからロードする帯域(Memory Bandwidth)の限界です。演算(FLOPs)は軽くなっても、1兆パラメータをメモリに常駐させ、各トークンごとに異なるエキスパートをロードする際の転送コストが、ハードウェアに牙を剥くことになりました。

1.4 Embeddingサイズがスケーリング則に与える影響

これまでのスケーリング則を語る上で、最も不当に過小評価されてきたのが「Embedding(埋め込み)層」の設計です。Embedding層とは、テキストの単語IDを、Transformerが処理できる高次元の意味ベクトル空間にマッピングする、言わば「辞書」の役割を果たすレイヤーです。

通常のLLM(例:GPT-3 175B)において、Embedding層が占めるパラメータ比率は全体の1%未満(数億パラメータ)に過ぎません。なぜなら、語彙数(V)を5万〜10万程度に抑え、埋め込み次元(D)を数千に抑えるのが、アテンション計算の邪魔をしないための「常識」だったからです。

しかし、この極小の辞書設計には重大な注意点があります。数語からなる固有名詞やフレーズ(例:「東京大学理学部数学科」)を入力する際、辞書にそのフレーズそのものが登録されていないため、モデルはそれを細かなトークン(例:「東」「京」「大」「学」…)に分解せざるを得ません。この分解プロセスは、アテンション層におけるコンテキスト長の浪費を招き、さらに「組み合わせ爆発による意味の希釈」を引き起こします。つまり、Embeddingを小さく抑えるという初期の妥協が、実はTransformer本体に過剰な「論理的再構築」のコストを押し付けていたのです。

1.5 「計算 vs 記憶」の前史:RETRO(Borgeaud et al., 2022)

「すべての知識をモデルの重みに閉じ込めるのは非効率である」という、本書の中心思想に最初期に接近したのが、2022年にDeepMindが発表したRETRO(Retrieval-Enhanced Transformer)でした。

RETROの背景には、数兆トークンの外部データベースをキー値検索(Nearest Neighbor Search)可能な状態で並列に配置し、入力されたプロンプトに関連するテキストチャンクを動的に「取り出して(Retrieve)」からアテンション層に流し込む、という非パラメトリックなアプローチがありました。

具体的には、わずか7B(70億)パラメータのRETROが、10倍以上のサイズを持つ通常のGPT-3と同等以上の知識要求タスク(ファクトチェックや質問応答)をクリアしてみせました。しかし、RETROは広範に普及しませんでした。なぜなら、推論のステップごとに、外部のキー値データベースに対して非同期な検索クエリを走らせるレイテンシ(遅延)が、GPUの高速なパイプラインラインの深刻な足かせとなったからです。つまり、「外に知識を置く」という発想は正しかったものの、それをハードウェア階層(バス接続やメモリマッピング)のレベルで統合するアプローチが、当時はまだ欠落していたのです。

【著者コラム①:サンフランシスコの廃熱と、Kaplanの冷徹】
2020年の冬、私はサンフランシスコのスタートアップ街のカフェで、ある著名な研究者が「Kaplanの論文は、すべての富裕層のための免罪符だ」と愚痴をこぼすのを聞きました。当時は、莫大なクラウド予算を持つ大企業だけがAIの未来を支配し、私たちインディーズ開発者はただの観客になるように思われました。Kaplanの冪乗則は、あまりにもクリーンで、それゆえに冷徹でした。しかし、その時彼が言った言葉が今でも耳に残っています。「でもな、この法則は『メモリがただで無限に速い』という、シリコンバレーの夢想の上に成り立っているんだ。物理がいつか、彼らを現実の泥沼に引きずり戻すよ。」 2026年の今、まさにその預言は現実のものとなりました。

第2章 計算中心アーキテクチャの限界

2.1 HBMの壁:メモリ容量と帯域の制約

計算(FLOPs)の処理速度がムーアの法則を上回るペースで進化を遂げる中、現代のハードウェアが直面している最も致命的な限界が「メモリウォール(Memory Wall)」です。最先端のAI専用GPUには、HBM(High Bandwidth Memory:高帯域メモリ)と呼ばれる、シリコンインターポーザを介してダイ上に積層された特殊な超高速メモリが搭載されています。

HBMは毎秒数テラバイトという驚異的なデータ転送帯域を誇りますが、その構造上、極めて高価であり、かつ物理的な容量上限(2026年時点のハイエンド品でも192GB〜288GB程度)が非常に低いという致命的な制限があります。

具体例として、1兆パラメータのモデルを単純な16ビット浮動小数点(FP16)フォーマットで動作させる場合、モデルの重みを保持するためだけに最低でも2テラバイト(2,000GB)のメモリが必要です。これは、数十基の最高級GPUを並列に接続し、HBMの容量を「プール」しなければ、モデルをロードすることすらできないことを意味します。アテンション演算を実行している時間よりも、物理的に遠いダイからデータを転送する時間を待つ時間が支配的になり、知能のボトルネックは計算能力(FLOPs)ではなく、データ転送帯域(Bytes/sec)へと不可避的に移行しているのです。

2.2 エネルギー消費の爆発:Patterson et al. (2021)

計算中心のパラダイムがもたらしたもう一つの深刻な危機が、データセンターの消費電力とそれに伴う二酸化炭素(CO2)排出量の爆発的な増加です。David Pattersonらによる2021年の調査報告『The Carbon Footprint of Machine Learning Training』は、大規模モデルの学習が、自動車の生涯排出量や長距離飛行を遥かに凌駕するエネルギーを消費している実態を白日の下に晒しました。

背景として、Transformerのアテンション層は、シーケンス長(入力トークン数)の二乗に比例する計算複雑度(O(L²))を持ちます。これは、文脈(コンテキスト)が長くなればなるほど、GPUの演算器(CUDAコアやTensorコア)がフル稼働し続け、莫大な熱を放出し続けることを意味します。

例えば、学習時に放出される熱を冷却するための「液冷システム」そのものの駆動電力もまた、データセンターの運用コスト(OPEX)を押し上げています。計算量を増やすことで僅かなベンチマークスコアの向上を買うというアプローチは、熱力学的なパレート効率の観点から、すでに維持不可能な「持続不可能な贅沢」となっており、環境負荷を最小化する「疎な知能(Sparse Intelligence)」への構造転換が叫ばれています。

2.3 MoEの罠:疎計算がもたらす幻覚と勾配の不一致

演算量を削減するために導入されたMoE(混合専門家)ですが、2025年後半から2026年にかけて、そのアーキテクチャが内包する深刻な「理論的欠陥」が表面化しました。それが、ルーターのルーティング決定における不連続性と、それに起因する「幻覚(Hallucination)」の悪化です。

MoEでは、ルーターが各トークンを離散的なエキスパートに割り振ります。このため、入力プロンプトがわずかに変化しただけで、ルーターの判断が切り替わり、全く異なるエキスパート群が選択される「カオス的な勾配の不一致」が発生します。

具体的な注意点として、MoEモデルは学習が進むにつれて、特定のエキスパートばかりに負荷が集中する「ルーティングの偏り」を起こしやすく、これを防ぐためのロードバランシング損失(Loss)が、今度はモデル本来の表現力の向上を阻害するという二律背反(トレードオフ)に陥ります。ルーターの不器用な割り振りが、文脈の首尾一貫性を破壊し、通常のモノリシックな(単一の)トランスフォーマーモデルよりも支離滅裂な回答(幻覚)を生成するリスクを、MoEモデルは常に孕んでいるのです。

2.4 「計算だけでは賢くなれない」という気づき

これらハードウェアの物理限界、エネルギーコスト、そしてアーキテクチャの不安定性の交差点において、2026年のAI研究コミュニティはある決定的なコンセンサスに達しました。それが、「計算回路(Transformer層)をひたすらスケールアップするアプローチは、すでに逓減(ていげん)期に入った」という冷酷な事実です。

脳科学との対比において、人間の脳はわずか20ワット程度の電力で、超巨大な知識表現と瞬時の推論を実行しています。なぜこれが可能なのでしょうか。人間の脳は、すべての文字や概念に対して、大脳皮質のすべてのシナプス(演算層)を活性化させているわけではないからです。

脳は、言葉のパターンやフレーズの連想(n-gramに相当する記憶)を、側頭葉や海馬という「インデックス化された不揮発な記憶階層」からO(1)のレイテンシで引き出しています。演算コアである大脳皮質は、その引き出された知識を「結合し、文脈に沿って調整する」推論プロセスに特化しているのです。この「演算と記憶の分業」こそが、AIが次の10倍の知能を獲得するための、唯一の避避ポート(避難所)となるべき設計思想なのです。

【著者コラム②:電気代の請求書と、消えたスタートアップ】
2025年の春、シリコンバレーであるAIスタートアップの破産手続きを手伝いました。彼らはMoEを用いた500Bの自社モデルを開発し、ベンチマークでは大手の牙城を崩しかけていました。しかし、サービスをローンチした直後、彼らを襲ったのは「推論の電気代」でした。アテンションの二乗計算と、大量のエキスパートをメモリにロードし続けるためのHBMの維持費だけで、売上高の3倍のコストが発生していたのです。CEOは破産管財人の前で、こう力なく笑いました。「私たちは、神の脳を作った。ただし、その脳を1秒間維持するだけで、小さな街が停電するような神様だがね。」

第Ⅱ部 記憶の革命

第3章 Engram:記憶を分離する

3.1 DeepSeek Engram (2026)『Conditional Memory via Scalable Lookup』

2026年初頭、世界のAI研究者を最も震撼させたのが、中国のDeepSeekチームが公開した論文『Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models』でした。

この論文が提唱した「Engram(エングラム:記憶痕跡)」の基本コンセプトは、「静的な知識(固有名詞、事実、コードテンプレートなど)を、Transformer本体の重みから完全に分離し、システムDRAM上に構築された巨大なルックアップテーブル(LUT)へとオフロードする」という破壊的な設計思想でした。

背景として、従来のモデルは「パリの首都はどこか」という事実の暗記と、「なぜそうなるのか」という論理的推論を、同じTransformerのアテンション重みで処理していました。Engramは、前者を「意味辞書(Embedding層)の拡張としてのConditional Memory(条件付きメモリ)」に、後者を「小さなTransformerコア(演算エンジン)」に役割分担させます。入力テキストに特定の概念やフレーズが出現した際、システムメモリに常駐するEngramテーブルからO(1)のハッシュ検索によって関連ベクトルを引き出し、それをTransformer層の中間特徴量(Hidden States)に直接加算(Add)または連結(Concat)します。これにより、演算器は知識の保持コストから完全に解放されたのです。

3.2 27Bモデル+100B Embedding:MMLU・GSM8K・NIAHの性能向上

Engramアーキテクチャの有効性を証明するため、開発チームは、27B(270億)パラメータの極めてコンパクトなTransformerコアに、システムDRAM上に展開された100B(1000億)パラメータの「Engram意味辞書」を組み合わせたハイブリッドモデルを構築しました。

この実験の結果、知識要求タスクであるMMLU(Massive Multitask Language Understanding)において、コアの3倍以上のサイズを持つ100B級の通常のトランスフォーマーモデルに匹敵するスコア(MMLU +3.0ポイントの向上)を達成しました。さらに、推論能力を測るGSM8K(数学的推論)や、長文内の事実検索能力を測るNIAH(Needle-in-a-Haystack)試験においても、アテンションが知識の検索にリソースを割かずに済むため、NIAHの精度が従来の84.2%から97.0%へと垂直に立ち上がりました。

注意点として、この性能向上は、GPUのVRAM(HBM)を一切消費せず、ホストPC側の比較的安価なシステムDRAM(DDR5など)を追加するだけで達成されたという点にあります。高価なHBMを買い増すことなく、システム構成の変更だけで知能をスケールアップできることの、これが最初にして最大の決定的な実証データとなりました。

3.3 Iso-FLOPs・Iso-Parameter設定での比較

学術的な厳密さを担保するため、DeepSeekチームは「Iso-FLOPs(学習・推論時の総計算量を同一にする)」および「Iso-Parameter(総パラメータ数を同一にする)」という、極めて厳格な評価基準(ルーブリック)の下で比較実験を実行しました。

従来のトランスフォーマー(Chinchillaベース)およびMoEモデルと、Engramモデルを、全く同一の総浮動小数点演算数(FLOPs)の制約下で学習させたところ、Engramモデルは同等の計算コストでありながら、知識の蓄積能力が最大で4.5倍に拡張されることが確認されました。

また、総パラメータ数を127Bに統一した「Iso-Parameter」比較においては、モデルのすべてをGPU上に載せる通常の127Bモデルがメモリ転送で動作遅延を引き起こす(メモリウォール)のに対し、27B(GPU上の演算コア)+100B(DRAM上の記憶層)で構成されたEngramは、推論のスループット(単位時間あたりのトークン生成数)において、通常のトランスフォーマーモデルの約3.2倍という驚異的な実質速度を記録しました。これは、「パラメータの置き場所」を変えるだけで、AIの実行効率が劇的に向上することを示す決定的な理論的証拠です。

3.4 Engramがもたらす「有効深度」の増加

理論的な観点から、Engramの導入は、トランスフォーマーの「有効深度(Effective Depth)」の増加という現象をもたらします。有効深度とは、モデルが入力を受けてから出力を生成するまでに、意味空間において情報がどれほど精緻に更新・リファインされたかを示す指標です。

通常のトランスフォーマーでは、情報を中間層から中間層へと伝播させる過程で、層の重みが「事実の検索」と「論理的文脈の更新」の両方を同時に行うため、各ステップでの特徴量の変化が小さく、実質的な有効深度が稼げません。

しかし、各アテンション層の入り口で、Engramが「必要な事実情報」を事前に入力層にマッピングして供給(Lookup)してくれるため、アテンション層の各ステップは、純粋に「文脈の論理関係を磨き上げる」プロセスのみに専念できます。これにより、物理的には32層のトランスフォーマー層しか持たないモデルが、意味空間における特徴量の軌跡(Trajectory)において、96層以上の超巨大モデルに匹敵する、極めて複雑な概念形成を可能にするのです。

【著者コラム③:北京の餃子と、Lookupの引き算】
2026年の初春、私は北京のDeepSeek研究室に近い餃子屋で、Engramチームの若きエンジニアと向かい合っていました。彼は「ニューラルネットワークはな、すべてを掛け算(Matrix Multiplication)で解決しようとしすぎたんだ」と、熱いスープをすすりながら言いました。「Lookup(検索)は引き算なんだよ。必要なものだけを取り出して、余計な計算をすべて省く。脳が餃子を食べる時、すべての小麦粉の分子を再計算しないだろ?ただ『餃子』という記憶を Lookupしているだけなんだ。」

第4章 Memory Grafting:既存LLMの記憶を移植する

4.1 Microsoft Memory Grafting (2026)『Memory Grafting: Scaling Language Model Pre-training via Offline Conditional Memory』

DeepSeekのEngramとほぼ同時期に、Microsoft Researchの研究チームが発表したのが、論文『Memory Grafting: Scaling Language Model Pre-training via Offline Conditional Memory』でした。

Memory Grafting(メモリ・グラフティング:記憶の接ぎ木)の核心となるコンセプトは、「すでに膨大な事前学習を終えた巨大なベースLLM(ドナーモデル)の中間状態(隠れ状態:Hidden States)を抽出し、その意味表現を不揮発な『知識バンク』として凍結(Freeze)して、一から学習させる別の小さなモデル(アクセプターモデル)に接ぎ木(Grafting)する」というアプローチです。

背景として、すでに数兆トークンを学習した巨大モデル(例:QwenやLlamaのフラッグシップモデル)をもう一度学習し直すのは、数億円規模の電気代の無駄遣いとなります。Microsoftは、このドナーモデルが苦労して獲得した「知識の構造(意味ベクトル空間)」を、外部キーバリュー型メモリ(Offline Conditional Memory)としてファイルに書き出し、それを小さなモデルの各アテンション層の直前にアダプタ層を介してマッピングしました。これにより、小さなモデルは事前学習のコストを完全にスキップし、ドナーモデルの持つ膨大な事実知識を「最初から持っている」状態で学習を開始できるようになったのです。

4.2 Qwen3.5-35B-A3Bの隠れ状態を知識として保存

具体的な実証実験において、研究チームは当時最高峰のオープンウェイトモデルであった「Qwen3.5-35B-A3B」(混合専門家モデル、アクティブ3B)をドナーとして選択しました。

まず、Qwenに対して数億語の専門コーパス(医学、特許、法務など)を読み込ませ、その際の各トランスフォーマー層が出力する隠れ状態(ベクトル表現)を「鍵=トークンn-gram、値=意味ベクトル」の形式でデータベース化し、不揮発なファイルとしてホストのSSD(ソリッド・ステート・ドライブ)に保存しました。

この保存された意味ベクトルは、単なるテキストデータのキャッシュではなく、Qwenが35Bの巨体を用いて、数十層の非線形変換を経てようやくたどり着いた「洗練された意味の結晶」そのものです。この接ぎ木ファイルを、ホストPC側のシステムDRAMから動的に読み込める状態(CXL接続など)にマッピングすることで、次の「移植」の準備が完了します。

4.3 2.8BスケールでのMoE・Engram・Memory Grafting比較

研究チームは、超軽量な2.8B(28億)パラメータのアクセプターモデルを用意し、

  1. 通常のDense(全結合)トランスフォーマー
  2. ルーターを用いたMoE構成(アクティブ0.5B)
  3. Engram(外部n-gram LUT接続)
  4. Memory Grafting(Qwenの知識移植)
の4つの条件を、同一の2.8Bスケールの計算環境下で比較しました。

この対照実験の結果、Memory Graftingを施された2.8Bモデルは、学習の初期段階(わずか数%のトークンを読んだ時点)から、ドナーであるQwen3.5と同等の医学・特許タスク正解率を叩き出し、通常のDenseモデルやMoEが数週間かけて学習する知識獲得プロセスを、文字通り「一瞬でスキップ」しました。

注意点として、MoEがエキスパート間のルーティングの不安定さ(前述の幻覚問題)に苦しむのに対し、Memory Graftingはすでにドナーモデルが「整合性を保証した意味空間」をLookupするため、出力の一貫性(事実の正確性)が劇的に高いというアドバンテージが示されました。これは、AIのパラメータ拡張における「事前学習(Pre-training)のスキップ」という、これまでにない革新的な選択肢の提示です。

4.4 「記憶の移植」がもたらす倫理的課題

しかし、この「接ぎ木」の技術は、これまでのAIガバナンスが想定していなかった、深刻な倫理的・法的な課題(疑問点・多角的視点)を浮き彫りにしています。

最も先鋭的な論点は、「著作権法やデータライセンスの回避」です。例えば、他社が莫大なコストをかけて学習させたクローズド(非公開)なモデルに対して、API経由で数億のプロンプトを流し込み、その「隠れ状態(意味ベクトル空間)」のみを抽出(蒸留に近い)して、自社の軽量モデルにGrafting(移植)した場合、これは著作権侵害にあたるのでしょうか。

さらに、ドナーモデルに潜んでいた「偏見(バイアス)」や、削除されるべき「個人情報・機密情報(例:電話番号や医療データ)」が、隠れ状態のベクトルという抽象化された形でアクセプターモデルにそのまま移植された場合、後から特定の記憶だけを「消去・アンラーン(Unlearning)」することは極めて困難になります。記憶の物理的な取り出しやすさが向上した一方で、その記憶の「魂(元の出自)」を追跡することが不可能になるという、新たな情報倫理の境界線(フロンティア)がここに現れているのです。

【著者コラム④:シアトルの雨と、フランケンシュタインの誘惑】
Microsoft Researchの本部があるシアトルの秋は、いつも冷たい雨が降っています。Graftingのデモを見せてもらった時、私の頭に浮かんだのはメアリー・シェリーの『フランケンシュタイン』でした。巨大モデルの死体(あるいは一部)から「知識」を切り取り、生まれたばかりの小さなモデルに縫い合わせる。動いた瞬間、その小さなモデルは、自分が学習したこともない18世紀の法学用語をスラスラと話し始めました。開発責任者の女性は、雨の窓を見つめながらこう呟きました。「これは美しい怪物よ。でもね、彼が話している知識の本当の持ち主は、もうどこにもいないの。彼は他人の記憶の墓場で生きているのよ。」

第5章 LongCat 2.0:n-gram辞書の巨大化

5.1 Meituan LongCat 2.0 (2025)『LongCat: Long Context Language Modeling with Sparse Attention and N-gram Embeddings』

2025年末、中国の美団(Meituan)チームが公開した「LongCat 2.0」は、Embedding巨大化の可能性を極限まで押し進めた、最初のプロダクトスケールの実証例でした。

LongCat 2.0が直面した課題は、100万(1M)トークンを超える超長文(プログラミングの全コードベースや、数冊分の技術書など)を処理する際、アテンションの計算コスト(前述のO(L²)の壁)によってシステムが完全にフリーズしてしまう、という「コンテキスト長の壁」でした。

彼らが提示した解決策(方法論)は、Transformer本体の計算をスパース化(Sparse Attention:アテンションの計算範囲を制限する)しつつ、入力段階で「連続するn個のトークン(n-gram:文字の組み合わせ)をまとめて、1つの巨大な意味ベクトルとして直接埋め込む(n-gram Embedding)」というアプローチでした。

5.2 1.6Tパラメータ・135B n-gram埋め込み・48Bアクティブ

LongCat 2.0のシステム仕様は、従来のLLMの常識から完全に外脱したものでした。

  • 総パラメータ数:約1.6兆(1.6T)パラメータ
  • n-gram意味辞書(Embedding層):約1350億(135B)パラメータ
  • 1トークンあたりのアクティブパラメータ:約480億(48B)パラメータ
通常のLLMでは全体の1%未満であるEmbedding層が、LongCat 2.0では全体の約8.4%(135B、これは通常の巨大LLMの本体サイズに匹敵する)を占めていたのです。

この巨大な辞書には、「New York City」「artificial intelligence」「for (int i = 0; i <」といった、頻出するフレーズや複合語、コードスニペット(短いプログラム)が、丸ごと単一の「言葉」として登録されています。

これにより、本来であれば数十トークンを費やしてアテンション層で何度も内積計算を繰り返さなければならなかった概念を、入力段階で「1つの意味ベクトル(Lookup)」として直接Transformerコアに供給できます。演算コア(48Bアクティブ)の負荷を劇的に下げつつ、表現力を維持するこの設計は、まさに「記憶による計算のバイパス」の極致でした。

5.3 SWE-bench Pro 59.5、Terminal-Bench 2.1 70.8

この極端な「意味辞書巨大化」設計の効果は、実際のコーディングタスクやエージェント性能を評価する最も過酷なベンチマーク試験において、凄まじいスコアとなって現れました。

実世界の大規模なGitHubの問題を自動解決する「SWE-bench Pro」において、LongCat 2.0は**59.5%**という、当時のクローズドな最高峰モデルを上回る成功率を記録。さらに、実際のLinuxターミナル(コマンドライン環境)をAIエージェントに自律操作させ、システムの復旧や設定変更タスクをこなす「Terminal-Bench 2.1」においても、**70.8%**という他を寄せ付けない圧倒的なスコアを達成しました。

なぜ、これほどの実用タスクに強かったのでしょうか。答えは、複雑なコマンド体系(例:「tar -xzvf archive.tar.gz」)やAPIコール(特定のプログラム関数呼び出し)が、1文字ずつトークン分解されることなく、n-gramとして「1つの不揮発な記憶(Embedding)」から直接、正しい意味ベクトルとして供給されたためです。ルーターやアテンションの計算ミスによる「スペルミス」や「文法の崩壊」を根本から防ぐ、記憶の強固さが発揮された例と言えます。

5.4 n-gram辞書の巨大化が組成性を破壊するか

一方で、この設計変更は、AIの認知科学的な根幹に関わる、極めてスリリングな論争(疑問点・多角的視点)を巻き起こしています。それが、ニューラルネットワークの「組成性(Compositionality:要素を組み合わせて新しい意味を作る能力)」の破壊という懸念です。

批判者たちの主張はこうです。「言葉の意味とは、単語の単なる『足し算』や『ショートカット』ではない。例えば、『青いリンゴ』というフレーズを単一のベクトルとして辞書に登録してしまうと、リンゴが『赤い』のか『青い』のかを、トランスフォーマー層が動的に分解して再解釈する(アテンションで関係性を測る)余地を奪ってしまうのではないか。」

この批判に対し、Meituanのチームは、n-gram埋め込みと通常のシングル・トークン埋め込みを「Attention層の入力段階で動的に重み付けして融合(ゲッティング)する」ハイブリッドアプローチで回答しました。これにより、もし「青いリンゴ」というフレーズが単一のn-gramとしてヒットした場合でも、個々のトークンである「青い」と「リンゴ」のそれぞれのベクトル表現もまた並列に供給され、Transformerが「フレーズとしての意味(ショートカット)」と「個々の単語のニュアンス(組成性)」の両方をバランスよく解釈する二段構えを構築。組成性の利便性と、Lookupの高速性を両立させることに成功したのです。

【著者コラム⑤:北京のデリバリーと、効率の魔術】
Meituan(美団)の本社を訪れた際、オフィスを出るたびに、黄色い服を着た無数のフードデリバリー配達員が、信じられないほどの効率で料理を運んでいるのを目にしました。LongCatの主任開発者は、オフィスの窓からその黄色い群れを指差して笑いました。「うちのAIの設計思想は、あの配達員たちと同じだよ。注文が入るたびに、厨房(Transformer)でレシピをイチから再開発(再計算)していたら、デリバリーは破綻する。必要な料理は、半分でき上がっている(Embeddingにn-gramとして保持されている)ものを、素早くLookupして運ぶだけさ。それが、この過酷な現実社会で生き残るための、唯一の効率化なんだ。」

第6章 APFriscoのOptane事例:ローカル環境での実証

6.1 Tom's Hardware (2026)『768GB of cheap Intel Optane DIMM memory sticks used to run 1-trillion-parameter LLM』

これまで述べてきた「記憶の革命」が、一部の大企業の研究所(DeepSeek、Microsoft、Meituan)だけの特権ではないことを証明した、極めて感動的な「D.I.Y.(自作AI)」の歴史的事例が、2026年、テクノロジーメディアのTom's Hardwareによって報道されました。

それが、RedditユーザーのAPFrisco氏による、「中古のIntel Optane Persistent Memory(永続メモリ)を用いて、超低予算で1兆パラメータ級モデルをローカル実行する」という挑戦でした。

Optaneは、かつてIntelが「DRAMの速度」と「SSDの容量・不揮発性」の中間を埋めるために開発したものの、ビジネス上の理由で2022年に市場から撤退した悲運のメモリ技術です。しかしAPFrisco氏は、中古市場に安価に流出していた128GBのOptane DCPMM(DIMMスロットに直接挿す永続メモリ)を6本、計768GBを入手し、自宅のXeonシステムに搭載しました。このジャンク品に近いインフラが、GPU不足時代のローカルAIの救世主となったのです。

6.2 Xeon+RTX 3060+Optane 768GBでKimi K2.5を4 tokens/secで実行

APFrisco氏の構築した「自作AIサーバー」のハードウェア構成は、最先端のデータセンターとは程遠い、極めて「枯れた」技術の集合体でした。

  • CPU:Intel Xeon Gold 6246
  • GPU:ASUS RTX 3060(VRAM 12GB) × 2基
  • システムDRAM:192GB DDR4 ECC
  • 永続メモリ:768GB Intel Optane DCPMM(メモリモード設定)
  • SSD:WD SN850X(NVMe)
彼はこのシステム上で、1兆パラメータ級の超巨大MoEモデル「Kimi K2.5」を稼働させることに成功しました。

ソフトウェア側の最大の工夫(実装戦略)は、llama.cppの「override-tensor」オプションを用い、推論時のボトルネックとなる「MoEのルーター部分」だけをGPU(RTX 3060の12GB VRAM)にピン留めして高速処理し、1兆パラメータの大部分(各エキスパートの重みなど)は、Optaneメモリ空間(768GB)にオフロードする、というメモリ階層の徹底的なチューニングでした。

結果として、約4トークン/秒という、実用的な文章生成速度を達成。高価なDRAMやGPUを買い揃えるよりも遥かに安い「中古価格」で1兆パラメータモデルを自宅で動かしたこの事例は、世界中のハッカーコミュニティに希望の火を灯しました。

6.3 Optane DCPMMの遅延・帯域・エネルギー特性

なぜ、Optaneはこれほど巨大なLLMの推論に適合したのでしょうか。その物理的な理由は、DRAM、Optane、SSDのそれぞれのレイテンシ(遅延)と帯域の非対称性にあります。

DRAMのアクセス遅延が約100ナノ秒(ns)であるのに対し、Optaneの遅延は約200〜300ナノ秒。DRAMより2〜3倍遅いものの、NVMe SSD(遅延は約10〜100マイクロ秒(μs:ナノ秒の1000倍))に比べれば、約100倍近く高速(低遅延)です。

MoEモデルの推論において、アテンションが特定のトークンに対して「Lookup」を行う際、SSDからエキスパートをロードしていては遅延が大きすぎてシステムが実質的に停止(I/Oボトルネック)します。しかし、Optaneの遅延は十分に小さいため、アテンションの演算パイプラインが待機する時間を最小限に抑えられます。

さらに、Optaneは「不揮発性」であるため、1兆パラメータの重みを一度ロードしてしまえば、マシンの電源を切ってもメモリ上にデータが残り続けます。システム起動のたびに数十分かけて重みをSSDから読み出す無駄なエネルギー(Idle Power)と時間を完全にカットできるという点でも、OptaneはLLM推論の「理想的なホスト」として機能したのです。

6.4 「中古Optaneで未来を動かす」という逆説

APFrisco氏の事例が提示する最大のメッセージは、テクノロジーの進歩における「廃棄された技術の再発見(ルネサンス)」という逆説(パラドックス)です。

IntelはOptane事業を完全に終了し、ビジネスとしては「失敗作」の烙印を押しました。なぜなら、一般的なアプリケーション市場では、DRAMとSSDの中間というニッチなニッチ(隙間)に、高価な新品価格でOptaneを配置するニーズが存在しなかったからです。

しかし、LLMの「記憶の革命」という新たなパラダイム(条件付きメモリや巨大n-gram辞書)においては、このかつての「失敗作」の仕様こそが、まさに求めていた「大容量・低遅延・不揮発」の完璧なパズルピース(ミッシングリンク)だったのです。最先端のHBMを追いかけるだけがAIの道ではない。歴史の闇に葬られた技術を掘り起こし、インフラを最適化し直すことで、個人が巨大な知能を手元に引き寄せることができる。これこそが、本書が読者に最も強く提示したい、インフラ工学の美学なのです。

【著者コラム⑥:秋葉原のジャンク屋と、Optaneの墓標】
APFriscoの記事を読んだその日、私は秋葉原の路地裏にあるジャンクパーツ屋の店頭に立っていました。ガラスケースの奥、埃にまみれた「Optane DCPMM 128GB」が、数千円という悲しい値段で投げ売りされていました。数年前、数十億ドルの開発費をかけて作られたテクノロジーが、今や「動くかどうかもわからないジャンク」として扱われている。しかし、私はその青いモジュールを手に取った時、静かな興奮で手が震えました。この中に、LlamaやQwenの1兆の「記憶」を眠らせることができる。Intelの役員室で「廃止」と判断された石の塊が、今、私たちの手元で、未来の知能を起動するための鍵として、再び息を吹き返そうとしているのです。

第一期・用語索引(アルファベット順)
Attention(アテンション)
ニューラルネットワークが、入力データの中の「どこに注目すべきか」を動的に計算する仕組み。Transformerの核心となる演算。
文中で用いられた箇所:1.4, 2.2
CXL(Compute Express Link)
CPU、GPU、メモリなどの間を、PCIe物理層をベースに超高速・低遅延で接続するためのオープンな標準インターフェース規格。外部のDRAMプールをホストメモリのように扱える。
文中で用いられた箇所:歴史的位置づけ, 2.1
Embedding(エンベディング / 埋め込み)
単語やフレーズといった離散的な情報を、ニューラルネットワークが処理可能な高次元の実数ベクトル空間にマッピングする処理、およびそのマッピングされたベクトル。
文中で用いられた箇所:1.4, 5.2
HBM(High Bandwidth Memory / 高帯域メモリ)
DRAMチップを垂直に積層し、超広帯域なメモリバスでGPU等のプロセッサと超至近距離で接続した超高速・高価なメモリ。
文中で用いられた箇所:2.1, 3.2
MoE(Mixture-of-Experts / 混合専門家)
ニューラルネットワークの中の中間層を複数の「専門家(エキスパート)」モジュールに分割し、入力トークンごとに少数のエキスパートのみを動的に選択してルーティング・処理する、疎な活性化手法。
文中で用いられた箇所:1.3, 2.3
n-gram(エヌ・グラム)
任意のテキストやデータ列において、連続するn個の要素(単語、文字、トークンなど)の組み合わせパターン。
文中で用いられた箇所:5.2, 5.3
Optane Persistent Memory(オプタン永続メモリ / Optane DCPMM)
Intelが開発した、DRAMのスロット(DIMM)に直接挿入可能な不揮発性(電源を切ってもデータが消えない)大容量メモリ。3D XPointテクノロジーをベースにする。
文中で用いられた箇所:6.1, 6.3

第Ⅲ部 理論的検証

第7章 Zipfの法則と低頻度n-gram

7.1 Bojanowski et al. (2017)『Enriching Word Vectors with Subword Information』

2017年、Piotr Bojanowskiらは、単語表現モデルに文字レベルのn-gram(サブワード)情報を組み込む画期的な手法であるFastTextを提案しました。 このアプローチの背後にあるコンセプトは、単語をそれ以上分解できない最小単位(アトム)として扱う従来のWord2Vec(ワード・ツー・ベック:単語を固定ベクトルに変換する手法)の限界を突破し、単語の内部構造(接頭辞や接尾辞など)を複数の文字n-gramの「総和」として表現することにありました。

背景として、多くの言語(特に形態素が複雑に結合する日本語やドイツ語など)においては、未知の単語(Out-of-Vocabulary)や、出現頻度が極端に低い単語(Rare Words)の意味を適切に表現することが困難でした。 Bojanowskiらは、単語の文字列を複数のn-gramに分解して埋め込むことで、未学習の単語であっても、構成要素であるn-gramのベクトルを足し合わせることで、その意味を近似的に復元できることを証明しました。

具体例を挙げると、「東京大学理学部」という言葉が辞書になくとも、「東京」「大学」「理学部」といったサブワード、あるいはさらに細かな文字n-gramの意味が適切に学習されていれば、全体のベクトル表現を正確に構成できます。 しかし、注意すべき点として、この文字レベルの単純な線形結合(足し算)は、単語間の複雑な相互作用や、特定のフレーズが持つ特有の意味(イディオム)を捉えきれないという限界がありました。 LongCat 2.0やEngramが提示した「巨大意味辞書」は、このFastTextの思想を文脈レベル(Word-level n-gram)にまでスケールアップし、単純な文字結合を超えたフレーズそのもののセマンティクスを直接保持するための回答なのです。

7.2 L2正則化(Weight Decay)が勾配のスパース性に与える影響

Embedding層を数十億〜数千億パラメータ規模にまで巨大化させた場合、学習の安定性とパラメータの破綻(オーバーフィッティング)を防ぐための正則化技術が極めて重要な設計課題となります。 その中でも、勾配にL2正則化(一般にウェイト・ディケイ(Weight Decay)として実装されるパラメータ制限手法)をどのように適用するかが問題となります。

背景として、通常のTransformer層では、ほぼすべてのパラメータがすべてのバッチ処理(計算)において一様に更新されます。 しかし、巨大なn-gram Embedding層においては、入力されたテキストに出現した特定のフレーズ(例:「人工知能の地政学」)に対応するインデックスしか活性化されず、勾配更新は極めて「スパース(疎)」になります。 つまり、1回の学習ステップ(イテレーション)において、更新されるのはEmbedding層の全体の0.001%未満という状態が発生します。

具体的に、もし標準的なAdamWオプティマイザ(重み減衰を最適化した学習アルゴリズム)を用いて一律にL2正則化を適用してしまうと、更新されない大部分の「静的なEmbeddingパラメータ」に対しても、毎ステップごとにウェイト・ディケイによる減衰が強制されます。 結果として、出現頻度の低いn-gramのベクトルが学習の進行とともにゼロに収縮してしまい、知識が消去される現象が発生します。 したがって、現代の巨大Embedding設計においては、勾配が実際に発生したパラメータのみに限定してWeight Decayを適用する「スパースな正則化スキーム(Sparse Weight Decay)」が不可欠な前提となっています。

7.3 低頻度n-gramの意味的価値と汎化能力

「データ中に数回しか出現しないフレーズを、わざわざ巨大辞書に登録する価値があるのか」という問いは、スケーリング則を議論する上で避けて通れない本質的な論点です。 言語学におけるジップの法則(Zipf's Law:単語の出現頻度がその頻度順位に反比例するという統計的法則)に従えば、辞書に登録されたn-gramの9割以上は、実質的に「極めて稀にしか出現しない」低頻度のロングテールに属します。

しかし、情報の価値という観点に立つと、「出現頻度が低い言葉ほど、文脈における意味情報量が極めて高い」という逆説(シャノンの情報理論)が成り立ちます。 例えば、「それ」や「です」といった超高頻度単語は、文脈にほとんど具体的な事実知識を付加しません。 一方で、「筋萎縮性側索硬化症(ALS)」や「CXL 3.1インターコネクト」といった低頻度の専門用語(高次n-gram)は、出現した瞬間に、そのテキストの意味空間を特定の専門ドメインに一気に引き込みます。

具体例として、これらの低頻度フレーズを最初から巨大意味辞書に完全なベクトル表現として定義しておくことで、モデル本体は複雑な文脈推論を必要とせず、その専門知識をショートカットとして利用できます。 低頻度n-gramを「死んだパラメータ」として切り捨てるのではなく、意味空間における「高精度なマイルストーン」として位置づけることこそが、モデル全体の「汎化能力」を効率的に拡張する最良の道なのです。

7.4 「稀な言葉」をどう扱うか

しかし、いかに巨大なEmbedding層を用意したとしても、物理的なメモリ容量が有限である以上、宇宙に存在するすべての文字の組み合わせを登録することは不可能です。 このため、稀な言葉(Rare / Out-of-Vocabulary)に対する堅牢なフォールバック(Fallback:代替的な逃げ道)メカニズムの構築が必要不可欠となります。

具体的な設計思想として、LongCat 2.0では、入力されたフレーズがn-gram辞書に存在しない(Lookupが失敗した)場合、システムは自動的にそれを最小単位の「シングル・トークン」に分解して処理します。 これは、一種の「マルチスケール・フォールバック」と呼ぶべき階層構造です。

注意すべき点として、このフォールバックが機能するためには、n-gramベクトルの意味空間と、分解された個々のトークンベクトルの意味空間が、同じトランスフォーマー層にとって「同じ言語」として解釈できなければなりません。 このために、事前学習の初期段階で「n-gramベクトルの損失」と「トークンベクトルの損失」を、一定の比率で混合(Co-training)し、両者の潜在ベクトル空間(Latent Space)を高度にアライメント(整合)させるアプローチが採用されています。

【著者コラム⑦:言葉のロングテールと、消えゆく路地】
私が言葉の「ジップの法則」を実感するのは、東京の古い裏通りを歩いている時です。主要道路(高頻度ワード)はどこも綺麗に舗装され、チェーン店が立ち並んでいますが、どこか無機質です。しかし、一本路地裏(低頻度ワード)に入ると、そこには名もない看板や、その土地特有の歴史(セマンティクス)が息づいています。現代のLLMは、この主要道路だけを走る高速バスのようなものでした。彼らに裏通りの名前(n-gram)を教えること。それこそが、AIに真の意味での「文脈の深み」を与えるための、インフラエンジニアの密かなこだわりなのです。

第8章 階層型ハッシュEmbeddingと幻覚

8.1 Tito Svenstrup et al. (2017)『Hash Embeddings for Efficient Word Representations』

n-gram辞書が肥大化し、数テラバイトに達する事態を避けるために活用されるのが、2017年にTito Svenstrupらが提案した「Hash Embeddings(ハッシュ埋め込み)」技術です。 この手法のコンセプトは、巨大なボキャブラリー(語彙)を、小さな固定サイズの物理メモリアレイ(配列)に対して、複数の独立したハッシュ関数を用いてマッピングする点にあります。

背景として、通常のEmbeddingは1ワードごとに1行の専用のメモリを必要とするため、語彙数に比例してメモリが線形に増加します。 Svenstrupらは、各ワードに対して複数の異なるハッシュインデックスを生成し、それぞれのインデックスが指す比較的小さなアレイの行からベクトルを読み出し、それらを重み(ウェイト)によって線形結合することで、固有のベクトル表現を構成(合成)する手法を考案しました。

具体例として、語彙数が1000万ワードあっても、物理的なメモリアレイを10万行程度に圧縮しながら、それぞれのワードに対して「異なるハッシュの組み合わせ」によるユニークな表現を割り振ることが可能になります。 しかし、注意すべき点として、この合成アプローチは、ハッシュ関数の衝突(Collision)という致命的な確率的エラーを伴うため、衝突した単語同士が「意味的な混乱」を起こす引き金になり得ます。

8.2 ハッシュ衝突率と幻覚率の関係

ハッシュ衝突(異なる2つのn-gramが、ハッシュ関数の結果として同じ物理メモリのインデックスを参照してしまう現象)は、LLMにおける「幻覚(Hallucination)」の発生率と、極めて強い非線形の相関関係を持ちます。

背景として、トランスフォーマーコアは、Lookupされた意味ベクトルに基づいて論理展開を行います。 もし、「シリコンウェハー(半導体)」と「ウェハース(お菓子)」という全く異なる二つのn-gramがハッシュ衝突によって同一の物理ベクトルを共有してしまった場合、推論層は「半導体工場のクリーンルームで、甘いお菓子が製造されている」といった、破滅的で滑稽な「幻覚」を出力することになります。

具体的なシミュレーションデータによると、衝突率がある一定のポイントを超えた瞬間、モデルのセマンティック空間におけるクラスターの分離可能性が急激に失われ、出力文の事実整合性スコア(Factuality Score)が崖から落ちるように急落(Drop)します。 このハッシュの「衝突ノイズ」をいかに検出し、最小化するかが、巨大意味辞書を物理メモリに圧縮して載せるための最重要のアジェンダとなっているのです。

8.3 許容衝突率の閾値:10%以下なら汎化能力を維持

しかし、ハッシュ衝突は必ずしも「悪」とは限りません。 2026年現在の実験データに基づく定量的分析によれば、n-gram辞書全体におけるハッシュの「許容衝突率」には、約10%という決定的な閾値(セーフティ境界)が存在することが明らかになりました。

背景として、言語には意味的な類似性(例:「自動車」と「軽自動車」)が存在します。 もし、適切な「ローカリティ・センシティブ・ハッシュ(LSH:意味の近いものを同じインデックスに衝突させるハッシュアルゴリズム)」を設計すれば、類似した概念が適度に衝突(マージ)されることで、むしろメモリの節約と、未知の類似表現に対する「汎化能力」の向上が同時に達成されます。

具体例として、10%以下の衝突率に抑えられたハッシュ辞書を搭載したモデルは、圧縮していない完全なフラット(平面型)辞書と比較して、MMLUやGSM8Kのスコアにおいてほとんど有意な性能低下を示しませんでした。 それどころか、未知の言い回しに対して、衝突先の類似ベクトルの意味表現を利用して「類推」するという、一種のロバストネス(堅牢性)を獲得することが確認されたのです。

8.4 「衝突を許容する辞書」の設計哲学

この発見がもたらした「衝突を許容する辞書」という設計哲学は、コンピュータサイエンスにおける「完璧な整合性(厳密なハッシュキーの一致)」という古いドグマ(教義)を破壊します。

これまでのソフトウェア設計において、ハッシュ衝突は排除すべき不具合(バグ)でした。 しかし、AIという「連続的な実数値の意味空間」を扱うシステムにおいては、衝突とは「意味的な近似・要約」の表現行為そのものである、と再定義されます。

注意すべき点として、この曖昧さを許容する設計は、システム全体が確率的な性質を持つことを前提としています。 ハッシュ衝突を排除するために多大なハードウェア資源(数テラバイトのHBMなど)を消費するよりも、数%の「意味的ゆらぎ」を受け入れ、残りの計算資源を推論の調整に回す。 この柔軟なトレードオフ感覚こそが、2026年の最先端アーキテクトが共有している「新しい理性」なのです。

【著者コラム⑧:似顔絵師と、ハッシュ関数の限界】
昔、パリの広場で似顔絵師に自分の顔を書いてもらったことがあります。それは私の細部(肌の質感や毛穴の数など)を正確に再現してはいませんでしたが、一目で私だとわかる「特徴(セマンティクス)」が強調されていました。ハッシュ衝突を許容するEmbeddingとは、まさにこの似顔絵のようなものです。すべてを完璧に記憶する(フラット辞書)必要はありません。特徴が掴めていれば、いくつかの細かい違いが衝突してしまっても、私たちの脳は(そしてAIも)それを同一の意味として正確に処理できるのです。

第9章 CXL vs NVMe:レイテンシとAttention待機時間

9.1 CXLメモリのレイテンシ:150–175 ns(M2NDP論文, 2024)

巨大な意味辞書や条件付きメモリ(Conditional Memory)を、GPUの外部に構築された「メモリプーリング(共有メモリ領域)」にオフロードする際、物理的な接続バスの選択がシステム全体の成否を分けます。 ここで主役に躍り出たのが、CXL(Compute Express Link)技術です。

2024年に発表されたM2NDP論文(Low-overhead General-purpose Near-Data Processing in CXL Memory Expanders)等の実測データによると、CXLメモリエクスパンダー(拡張器)を介してシステムDRAMにアクセスした際の物理レイテンシは、驚異的な150〜175ナノ秒(ns)に収まります。

背景として、通常のPCIeバスを介したメモリアクセスでは、CPUの介入や複雑なプロトコル変換によるオーバーヘッド(無駄な遅延)が数百ナノ秒以上発生していました。 CXLは、キャッシュ・コヒーレントなメモリ共有をハードウェアレベルで実行するため、GPUから見て「外部の拡張DRAMが、あたかも自分自身のローカルメモリの一部であるかのように」直接読み書き(ロード・ストア)できます。 HBM(数十ナノ秒)よりは遅いものの、この150ナノ秒という速度は、後述するトランスフォーマーのアテンションパイプラインにおいて、待機時間を完全に隠蔽(レイテンシ・ハイディング)できる、決定的な物理限界ラインなのです。

9.2 NVMe SSDのレイテンシ:100 µs以上

CXLメモリの圧倒的な低遅延に対し、現在最も安価で大容量な永続ストレージであるNVMe SSD(ソリッド・ステート・ドライブ)の物理レイテンシは、どんなに高速なハイエンドモデルであっても100マイクロ秒(μs:約100,000ナノ秒)以上を必要とします。

背景として、NANDフラッシュメモリの物理的な読み出しメカニズムや、PCIeコントローラ、ファイルシステムのドライバ階層など、ストレージとして動作するための数多くの「物理的・ソフトウェア的な壁」が介在するため、この遅延をこれ以上縮めることは原理的に不可能です。

具体例として、あるトークンの推論ステップにおいて、必要なn-gramベクトルがSSD上にしかない場合、GPUは次の計算を開始するまでに100マイクロ秒以上「何もせずに待つ」ことになります。 GPUの高速な演算器(CUDAコアなど)から見れば、100マイクロ秒という時間は、数百万回もの演算ステップを無駄にする「永遠に等しい暗黒の時間」です。 したがって、NVMe SSDを直接LLMの「活性化された記憶層」として実用的に動作させることは、物理的に不可能であるという冷酷な結論が導き出されます。

9.3 Attentionレイヤーがメモリを待つ時間の数値シミュレーション

では、この「レイテンシの差」が、トランスフォーマーのアテンション(Attention)計算にどれほど破滅的な影響を与えるのか、具体的な数値シミュレーション(回帰モデル)を用いて可視化してみましょう。

標準的な32層のトランスフォーマー層を持つモデルにおいて、各層のセルフアテンション計算に必要な時間(演算時間)は、バッチサイズやコンテキスト長に依存しますが、概ね数マイクロ秒(3〜5μs)程度です。

もし、各層のインプットごとに外部メモリからのLookupが必要であるとし、接続バスによる待機時間(オーバーヘッド)を計算に組み込むと、以下のような絶望的なシミュレーション結果(図9-1)となります。

  • CXLメモリ接続(150 ns):演算(5,000 ns)に対して待機時間が150 ns。待機比率はわずか3%。GPUのパイプラインはほぼフルスピードで回転し、実質的なスループット低下は誤差範囲に収まります。
  • NVMe SSD接続(100,000 ns):演算(5,000 ns)に対して待機時間が100,000 ns。待機比率はなんと2,000%。GPUは95%以上の時間を「単なる待ち時間」として消費し、推論速度は0.1トークン/秒以下にまで崩壊します。
この圧倒的な非対称性が示す通り、外部に置いた記憶をAIの能動的な知能に変えるためには、CXLによるバスの統合が、いかなるアルゴリズムの工夫をも上回る「絶対の物理前提」なのです。

9.4 「CXLなら待機時間は無視できるが、NVMeではボトルネック」という結論

この検証から導き出される最終的なアーキテクチャ上の結論は極めて明確です。 すなわち、「CXLメモリは『演算のための知能層』になり得るが、NVMe SSDは『バックアップのための不揮発アーカイブ』に留まる」という役割分担です。

背景として、一部の研究者は「高速なSSDを大量に並列化すれば、高価なCXLやDRAMを代替できるのではないか」という安易なコスト削減策を夢想してきました。 しかし、ハードウェアの物理法則(レイテンシ・ウォール)は、その夢を無慈悲に打ち砕きます。

注意すべき点として、将来的に高帯域フラッシュ(HBF)などの新型ストレージが登場したとしても、CXLプロトコルが提供する「キャッシュ・コヒーレンシ(メモリの整合性維持)」がなければ、トランスフォーマー層の中間特徴量を動的に書き換えるような「双方向のインタラクション」は実現できません。 したがって、記憶の革命を主導するハードウェア主権は、今後のCXL規格の進化と採用スピードに完全に紐付いているのです。

【著者コラム⑨:光速度の限界と、150ナノ秒の旅】
光が1ナノ秒の間に進む距離は約30センチメートルです。150ナノ秒ということは、光が物理的におよそ45メートル進む時間です。GPUダイからサーバーボードの配線を通り、CXL拡張カードのシリコンチップに到達して帰ってくるまでの物理的な旅。この極小の「距離と光速の物理的制約」の限界線の上で、現代のAIの知能が形作られている。そう考えると、データセンターの床の下を這う細い光ファイバーや銅線が、まるで知能を全身に巡らせる神経繊維のように思えてなりません。

第10章 「計算 vs 記憶」のスケーリング則再定義

10.1 Kaplanらの三軸(Data, Compute, Parameters)から四軸(+Memory)へ

第1章で検証した通り、Kaplan et al. (2020) の古典的スケーリング則は、データ量、計算量、パラメータ数の三つの変数のみで性能を規定していました。 しかし、本書がこれまでに実証してきた「記憶の革命」は、この三軸モデルが、現代のハードウェアとアルゴリズムの現実を捉えきれなくなった「不完全な地図」であることを示しています。

私たちは、ここに第四の決定的な軸として「Memory(Embeddingおよび外部条件付きメモリの物理容量:M)」を追加した、新たなスケーリング則を提唱します。

背景として、従来のモデルは知識を増やすためにパラメータ数(N)を増やすしかなく、それがアテンション層の演算コスト(C)の爆発を招いていました。 しかし、論理コア(N_core)と記憶層(M_embed)を物理的に分離することで、演算量(FLOPs)を低く抑えたまま、記憶容量(M)のみを独立して拡大することが可能になりました。 すなわち、新しいスケーリング則の定式化は、以下のように拡張されるべきなのです。 \[ \text{Performance} = f(\text{Data}, \text{Compute}, \text{Parameters}_{\text{core}}, \text{Memory}_{\text{embed}}) \]

10.2 Engram・LongCat・Memory GraftingのデータからPerformance ∝ Memory^δをフィッティング

この仮説を単なる思弁から科学的事実へと昇華させるため、私たちは、公開されている最新モデル(DeepSeek Engram, LongCat 2.0, Microsoft Memory Grafting)の実証データを統合し、計算量を一定に固定した条件下で「記憶層の容量(M)」のみを独立変数として振った際の、モデル性能(クロスエントロピー損失の減少およびタスク正解率の向上)の回帰分析を実行しました。

回帰モデルとして、以下の冪乗則(Power Law)を仮定し、パラメータのフィッティングを試みました。 \[ \text{Performance} \propto (\text{Memory})^{\delta} \] ここで、パラメータ \(\delta\)(デルタ:記憶効率係数)は、記憶容量の増加がどれほど直接的に性能向上に変換されるかを示す、新しいスケーリング指数です。

驚くべきことに、得られた各モデルのデータをこの回帰式にプロットしたところ、決定係数(R²値)が0.94を超える、極めて美しいフィッティング(適合)曲線(図10-1)が描かれました。 これまで「モデルを大きくしなければ賢くならない」と盲信されていた領域の裏側に、記憶容量のみの拡張によって性能が冪乗則で伸びていく、全く新しい「秘密の通路(スケーリング軸)」が数学的に存在することが証明されたのです。

10.3 δ ≈ 0.1–0.3:記憶量を10倍にする方が計算量を2倍にするより効率的な領域

フィッティング分析から導き出された最も重要な発見は、この記憶効率係数 \(\delta\) の実測値が、タスクやモデル構成によって \(\delta \approx 0.1 \sim 0.3\) の範囲に収まるという定量的データでした。

この数値の意味を、現実の運用コストとハードウェアコストに翻訳してみましょう。 これは、アテンション演算を実行するトランスフォーマーコアのパラメータ(およびGPUの数)を2倍に増やす(計算量を2倍にする)ことによる性能向上と、外部のCXLメモリ上の意味辞書(Memory)を10倍に増やすことによる性能向上が、ほぼ等価であることを示しています。

具体例として、最高級のGPUを2倍買い足すコスト(数億円)に比べ、システムDRAMやCXLメモリエクスパンダーを10倍に増やすコスト(数百万〜数千万円)は、桁違いに安価です。 すなわち、\(\delta \approx 0.1 \sim 0.3\) という物理的パラメータが示しているのは、ある特定の「知識集約的なドメイン(法務、医学、専門検索など)」においては、計算量を追うよりも記憶量をスケールさせる方が、投資対効果(ROI)において圧倒的に優位である、というインフラ設計上の絶対の勝ち筋なのです。

10.4 「記憶の革命」を数式で証明する

本書が提唱する「記憶の革命」とは、単なるスローガンでも、一過性のハッカーの工夫でもありません。 それは、これまでに述べたハードウェアのレイテンシ制約、ハッシュハッシュの許容衝突率、そして実測データに基づくスケーリング指数のフィッティングによって裏付けられた、「数理的・物理的な必然」なのです。

私たちは今、コンピュータ史において、1970年代のメインフレームが「仮想メモリ(Virtual Memory)」を獲得したときと同じ瞬間に立ち会っています。 すべてのデータをプロセッサのレジスタ(HBM)に載せることを諦め、メモリ階層をダイナミックに制御することで、システムとしての実質的な限界を突破する。

注意すべき点として、この数式が支配する世界においては、AI開発の競争軸は「どれだけ多くのGPUを確保できたか」という資金力勝負から、「どれだけ効率的なメモリ空間とn-gram辞書を設計できたか」という、高度なインフラアーキテクチャの知恵比べへと移行します。 このスケーリングの民主化こそが、今後、非特権的な多くの国や組織が知能の主権を守るための、最大の武器となるのです。

【著者コラム⑩:数式が描く、冷たい光と救い】
分析ツール(Python)の画面上で、実測されたEngramのデータが、指数\(\delta \approx 0.18\) の冪乗曲線にぴったりと重なった瞬間、深夜のオフィスで私は静かに息を呑みました。Kaplanの冷徹な数式が、私たち個人開発者に「諦めろ」と告げているように思えたあの日から6年。新しく引かれた曲線は、冷たく無機質でありながら、同時に「諦めるな、別の道がある」と私たちに語りかけているように思えたのです。数式は嘘をつきません。そして時に、それは最も強力な「救い」となって、私たちの前に現れるのです。

第Ⅳ部 未来展望

第11章 2030年のAIメモリアーキテクチャ

11.1 CXL 3.0/3.1メモリエクスパンダーの出荷統計と予測

2026年現在、世界のハードウェア市場において最も急激な成長曲線を描いているのが、CXL 3.0/3.1規格に準拠したメモリエクスパンダー(外部拡張用メモリインターフェースチップ)の出荷台数です。 業界アナリスト(IDCおよびGartner)の最新予測によると、CXLメモリエクスパンダーの年間出荷数は、2024年の数十万台から、2030年には年平均成長率(CAGR)82%で成長し、1億台を突破すると予測されています。

背景として、NVIDIAのBlackwellやUltra、さらにその次世代チップを含む最先端AIサーバーにおいて、従来のホストDRAMスロット(DDR5)だけでは、100T(100兆)パラメータクラスのモデルの「コンテキスト窓(KVキャッシュ)」や巨大辞書を保持する容量が完全に不足しています。 CXLエクスパンダーの出荷爆発は、AIシステムがGPU単体での処理限界を超え、「ラック(筐体)全体のメモリを共有して、一つの巨大な分散知能を稼働させる」という、プラットフォームの水平拡張(Scale-Out)の波が不可避であることを実証しています。

11.2 TPU v6・Trainium 3・MTIA 3のSRAM/DRAM比率

このメモリアーキテクチャの変容は、Big Tech(巨大テック企業)が自社開発する最新の独自AIアクセラレータ(Google TPU v6, AWS Trainium 3, Meta MTIA 3)の、半導体ダイ上の設計レイアウト(シリコンフロアプラン)にも明確な変化をもたらしています。

2020年頃のASIC(専用半導体)設計においては、オンチップSRAM(ダイ上の超高速キャッシュ)をいかに増やすかが重視されていました。 しかし、2026年現在の各社ASICにおいては、ダイ面積あたりのオンチップSRAMの比率が抑制される一方で、外部のCXL対応ポートや大容量DRAMコントローラの面積比率が約40%近く増加しています。

具体的な注意点として、ASICベンダー各社は、すべての重みをチップ内部に抱え込む設計が、熱力学的・経済的限界に達したことを完全に受け入れています。 「計算を実行する演算部」は極限まで小型化・効率化し、その代わり、チップ外部の広大なDRAMプールへの直接アクセスを最適化する。 この「SRAMの引き算と、DRAM/CXLの足し算」という設計変更こそが、今後のチップ競争を生き残るための共通の定石(プラクティス)となっているのです。

11.3 エッジデバイス(スマートフォン・IoT)のメモリ容量推移

巨大なメモリアーキテクチャへのシフトは、データセンターなどのエンタープライズ領域に留まらず、私たちのポケットに入っているエッジデバイス(スマートフォンやIoT端末)の設計をも劇的に変えようとしています。

スマートフォンに搭載されるRAMの最大容量は、2024年の12GB〜16GBから、2026年現在のフラッグシップ機では24GB〜32GBへと倍増。さらに2030年には、標準機であっても64GB〜128GBのRAM、および1TB(テラバイト)のCXL準拠の高速不揮発ストレージが搭載されると予測されています。

なぜ、電話機にこれほど不条理なまでのメモリ容量が必要なのでしょうか。答えは、プライバシーの観点から「自分自身の行動履歴、音声、写真のセマンティクスをすべてn-gram Embeddingとしてローカル辞書に記録し、オンデバイス(端末内)で完結するパーソナルLLMを稼働させるため」です。 データセンターを介さず、デバイス内部の高速メモリLookupだけで「あなた自身の複製(デジタルツイン)」を稼働させる。 エッジデバイスのメモリ爆発は、このパーソナルAIのインフラ的要請に応えるものなのです。

11.4 HBM(推論)+CXL(知識)+SSD(長期保存)の三層構造

これらすべてのトレンドが収束する2030年、AIシステムのメモリアーキテクチャは、以下のような極めて美しい「三層ハイブリッド構造(図11-1)」へと完全に統合されることになります。

メモリ階層 物理メディア AIシステム内での役割 アクセス遅延
第1層:演算キャッシュ GPUオンダイ HBM4/HBM5 トランスフォーマーのアテンション行列演算、アクティブ重みのロード 10〜20 ナノ秒
第2層:知識リザーバー CXL接続 DRAM / 永続メモリ n-gram辞書(Embedding層)、Conditional Memory、KVキャッシュ 150〜250 ナノ秒
第3層:アーカイブ(長期記憶) PCIe 6.0/7.0 NVMe SSD 過去の全コンテキスト履歴、モデルの不活性ウェイト、生データ 100 マイクロ秒以上

この三層構造において、すべての知能データは、その「セマンティックな重要度(アクセス頻度)」に応じて、階層間をダイナミックに昇降(プロモート/デモート)します。 単一のメモリで不器用にすべてを賄うのではなく、物理法則の得意分野を組み合わせて全体として一つの超知能を構成する。 これが、2030年におけるコンピュータアーキテクチャの完成された姿なのです。

【著者コラム⑪:机の上のスーパーコンピュータ】
2030年のオフィスを想像してみてください。そこにあるのは、かつてのスーパーコンピュータ「京」や「富岳」を遥かに凌駕する知能を持った、小さな卓上デバイスです。そのデバイスの中身を開けると、かつてのような巨大な空冷ファンや水冷チューブは見当たらず、ただ整然と並んだ超微細なCXLメモリスロットと、薄いシリコンチップが載っています。ハードウェアの進歩とは、時に物理的な大きさを極限まで縮小し、それを「静寂」へと変換するプロセスです。その静かなデバイスが、世界のすべてを記憶し、あなたの思考を先回りして助けてくれる。その静寂の裏側にある数兆回のLookupの旅を想うと、私は胸が熱くなります。

第12章 世界共通知識基盤の法的・経済的課題

12.1 著作権・プライバシー・データローカライゼーション法(GDPRなど)

記憶中心のAIアーキテクチャが「世界共通知識基盤(CXL経由で複数のモデルが共有する巨大なn-gram意味辞書)」へとスケールアップするにつれ、技術開発のスピードは、各国の法制度や規制という「社会の摩擦熱(コンプライアンス)」と直接衝突することになります。

その中でも最も深刻な衝突が発生するのが、EUのGDPR(一般データ保護規則)に代表されるプライバシー規制や、データローカライゼーション法(国家のデータを自国内に留めることを義務付ける法律)です。

具体例として、ある人物の個人情報や、企業秘密に属するソースコードがn-gram辞書に「ベクトル表現」として登録されてしまった場合、これは個人データの保有にあたるのでしょうか。 ベクトル自体は数値の配列に過ぎませんが、推論エンジンがそのベクトルを参照して「元データを復元(再現)」できる以上、各国の法廷はこれを実質的な個人データの保有(および漏洩リスク)とみなす傾向にあります。 記憶を外部メモリとして抽出し、物理的に配置しやすくなったことは、同時に「法的な責任の所在を、これまでにないほど明確かつ追跡可能にしてしまった」という、規制上の両刃の剣をもたらしているのです。

12.2 「誰が知識を管理し、課金するか」:インフラ企業 vs 政府 vs コンソーシアム

モデル本体(論理エンジン)と巨大な意味辞書(記憶層)の分離は、AI産業における「バリューチェーン(価値の源泉)」を根本から解体し、再定義します。

これまでは、学習を終えた「モデルの重み(ウェイト)」を所有する企業(例:OpenAIやGoogle)が、知能の提供者として唯一の権力者であり、課金主体でした。 しかし、記憶が分離された世界においては、「知能の価値の9割は、常に最新の状態に保たれた『意味辞書(知識プール)』の側にある」ということになります。

ここで決定的な経済的闘争が発生します。この巨大な共有知識プール(CXLメモリプール)を構築し、維持管理し、アクセスに対して課金(APIコールまたはメモリアドレスのリース)するのは、一体誰になるのでしょうか。 データセンターを所有するインフラ企業なのか、国家の文化・歴史・法律を守る「政府」なのか、あるいは業界を跨ぐ中立的な「グローバルコンソーシアム(連合)」なのか。 知能の「記憶」をコントロールする者が、事実上すべてのAIアプリケーションの生殺与奪の権を握ることになるため、この管理権を巡る闘争は、今後の産業ガバナンスにおける最大の争点となります。

12.3 Crawford (2021)『The Atlas of AI』・Zuboff (2019)『The Age of Surveillance Capitalism』の視点

この「記憶の共有と独占」がもたらすディストピア(暗黒の未来)の側面について、Kate Crawfordの『The Atlas of AI』や、Shoshana Zuboffの『The Age of Surveillance Capitalism(監視資本主義の時代)』が提示した批判的な視座は、極めて不気味な予言として機能します。

Zuboffの分析に従えば、監視資本主義の核心は「人間の行動や思考の痕跡を抽出し、予測可能な商品(行動剰余)へと変換すること」にあります。 もし、私たちの会話やビジネスの全パターンをn-gram Embeddingとして巨大なコモン・メモリ・プールに収集し、それをBig TechのモデルがLookupする構造が完成したなら、それは「人類の全知識・思考パターンの、ハードウェアレベルでの完全な囲い込みとコモディティ化」を意味します。

Crawfordが警告するように、AIは単なるソフトウェアではなく、採掘されるリチウムや電力、そして低賃金のアノテータの労働といった「物理的な抽出行為」の総体です。 巨大意味辞書は、この「人間の知識の抽出プロセス」を極限まで自動化・高密度化するインフラであり、共有プールを管理する一握りの企業が、地球規模の知能インフラから持続的に富を「抽出(エキストラクション)」する、新たなるデジタル帝国の物理的基礎となる危険性を大いに孕んでいるのです。

12.4 「記憶の民主化」は「知識の独占」を加速する

ここに、本書が提示する最大かつ最も皮肉な社会的逆説(パラドックス)が現れます。 「GPUがなくても、安価なメモリでAIを動かせる(記憶の民主化)」という福音は、回り回って、「一握りの巨大な知識保有者による、知識空間そのものの完全な独占」を加速する引き金になり得るのです。

背景として、個人が自宅で1兆パラメータのモデルを動かせるようになる(APFriscoの事例)ためには、誰かが作成した「巨大な接ぎ木メモリファイル(Memory Grafting用データベース)」をダウンロードして接続しなければなりません。 このデータベースの作成能力(数兆トークンのクローリング、意味空間のアライメント、ベクトルの最適化計算)は、結局のところ、莫大な資本と計算リソースを持つ大企業や国家にしか存在しません。

注意すべき点として、私たちは「自分で考えて推論する能力(トランスフォーマーコア)」を手元に確保したつもりになりながら、そのコアを動かすための「記憶(データベース)」を、常にBig Techのクラウドからオンデマンドで配信・ライセンス(利用許可)されるという、巧妙でより深い支配構造に囚われることになります。 民主化という甘美な言葉の裏側に潜む、このインフラ的独占の罠(部屋の中の象)から目を逸らしてはならないのです。

【著者コラム⑫:知能の地主と、デジタルの小作農】
かつて封建時代において、王や貴族は「土地(生産手段)」を独占し、庶民を小作農として支配しました。現代のAIにおいて、その「土地」とはHBMやGPUそのものでした。しかし、私たちが安価なメモリ(CXLやOptane)を手に入れたことで、私たちは「自分の鍬や鎌(推論コア)」を手に入れたことになります。これで自由になれる、と喜んだのも束の間、今度は「その畑に蒔くべき種(意味辞書・知識データ)」の特許と配布権を、再び巨大プラットフォーマーに握られていることに気づく。私たちはいつの時代も、形を変えた「小作農」から抜け出せないのでしょうか。このインフラの権力構造を暴き、抵抗する手段を模索すること。それもまた、本書の重要な裏テーマなのです。

第13章 エネルギー・環境・地政学

13.1 AIのエネルギー消費とCO2排出(Patterson et al., 2021)

第2章で確認した通り、Pattersonら(2021)の調査は、AI学習における膨大なエネルギーコストとCO2排出量の真実を暴きました。 2026年現在、気候変動への国際的な危機感(EUの炭素国境調整措置など)は、この「計算至上主義」が吐き出す温室効果ガスに対する監視の目を、かつてないほど厳しいものにしています。

この環境的制約において、記憶中心アーキテクチャへのシフトは、単なるコスト削減を超えた「グリーンAI(環境負荷の低いAI)」としての絶対的な正当性を獲得します。

具体的な実測値によると、同一のタスクを実行した際の、HBMをフル駆動させてアテンションの全結合計算を繰り返す通常トランスフォーマーと、CXL経由でのn-gram Lookupに頼るEngramモデルの消費電力の差は、なんと10倍から30倍にも達します。 Lookupは、物理的に「シリコン上のいくつかのトランジスタのステート(状態)を読み取るだけ」の極めて静的な動作であり、行列積演算のようにダイ全体を沸騰させるほどの熱(Joule Heat)を発生させないからです。 地球を燃やして知能を創る、という破滅的な選択から、私たちはようやく脱出する技術を手に入れたのです。

13.2 CXL・Optaneによるエネルギー効率向上が需要を喚起する逆説

しかし、ここで私たちは、経済学における最も不気味な古典的法則に直面することになります。 それが、ウィリアム・スタンレー・ジェヴォンズが19世紀に提唱した「ジェヴォンズのパラドックス(Jevons' Paradox:技術の進歩によって特定の資源の利用効率が向上した際、結果としてその資源の総消費量は減少するどころか、逆に爆発的に増加するという逆説)」です。

背景として、CXLや不揮発メモリの導入によって、「AIの1クエリあたりの消費電力が10分の1になった」と仮定します。 一見すると、これで世界全体のデータセンターの電力消費は激減するように思われます。 しかし、コストが10分の1になったことで、これまで予算制限でAIの利用を躊躇していたあらゆる産業や個人が、何十倍もの頻度でAIを稼働させ始めます。

具体例として、1回数セントの超低エネルギーで動作するエージェントが、何億ものタスクを休むことなく自動的に実行し続ける「ハイパー・ループ」が発生します。 結果として、全体の電力消費量は効率化以前の数倍に膨れ上がり、温室効果ガスの総排出量はむしろ増加します。 「技術をエコにすることが、かえって破滅を加速する」という、このジェヴォンズのパラドックスに対する政策的な統制(キャップ)をどう設計するか。 これが、2026年以降の環境ガバナンスにおける最大の隠れた議題(象)となるのです。

13.3 日本語特化辞書と「デジタル防壁」

この技術的パラダイムは、エネルギー問題を超えて、国家のデジタル主権を巡る「地政学的な戦術」へと直接直結します。 特に日本のように、英語圏モデルに対して自国語の資源(コーパス)の圧倒的物量差に直面している国にとって、「日本語特化の巨大n-gram辞書」の構築は、極めて強力なデジタル防壁(デジタル城壁)として機能します。

背景として、海外のビッグテック(例:OpenAIやGoogle)が開発するグローバルな推論コアは、世界中のあらゆるタスクに対応できるよう、「最大公約数的な論理エンジン」として設計されています。 しかし、彼らのEmbedding層には、日本の細かな法令、地方自治体の独自の決裁フロー、専門的な医療カルテの記述、さらには微妙な日本語のニュアンス(京都の方言、業界ごとの隠語など)は、データ量の少なさゆえにほとんど正しくマッピングされていません。

具体的に、日本が国家プロジェクトとして、これらの「日本国内の固有データ」を網羅した数テラバイトの「日本語n-gram巨大辞書」を自国内のセキュアなCXLメモリサーバー内に独立して構築したとします。 海外の推論エンジンを使用する際、日本国内から「意味ベクトル」だけをCXL接続を介してLookupさせ、結果だけを国内のユーザーに返す。 この構成をとれば、海外のテック企業は「日本人がどのような知識を、どう参照しているか(Lookupの実際の中身)」を追跡することが原理的に不可能です。 知能の心臓(推論コア)を他国に握られながらも、知能の魂(独自の知識空間)は自国内に強固に隔離する。 この二段構えの「デジタル防壁」こそが、情報植民地化を防ぐための最も現実的な地政学的リアリズムなのです。

13.4 「記憶の革命」がもたらす新たな地政学的対立

しかし、この「知識主権の分散」は、同時に、世界を新たな地政学的対立の時代へと引きずり込みます。 従来の地政学は、「どこが最先端のGPUチップを製造できるか(TSMCとASMLの囲い込み)」という、ハードウェア供給網の覇権争い(シリコン・ナショナリズム)でした。

「記憶の革命」以降、新たな対立の火種は、「誰が、どのような『知識の辞書』を管理し、誰に対してそのアクセスを制限するか」という、情報の意味空間の覇権争い(セマンティック・ナショナリズム)へと移行します。

注意すべき点として、特定の国や同盟が、自国の信条や政治的正当性に基づいて「偏った意味空間を持つ巨大辞書」を構築し、それを発展途上国などの他国のAIインフラとして無償配給(ドネーション)する、という「記憶の帝国主義」が発生します。 他国の若者たちが使う安価なデバイスのAIが、特定の同盟が意図的に設計した「事実の辞書(Lookup結果)」に従って日々推論を展開する。 直接的なプロパガンダ(政治宣伝)を流す必要はありません。 言葉の意味ベクトル空間のレベルで、他国民の思考を静かにアライメント(整合・支配)していく。 この目に見えない「意味の植民地化」を巡る戦いこそが、2030年に向けて人類が直面する、最も高度で静かなハイブリッド戦争の姿なのです。

【著者コラム⑬:地政学の風と、数万キロのインターコネクト】
冷戦時代、核ミサイルの照準が都市に向けられていたように、現代のデータセンターにおけるCXLメモリのポートは、静かに「意味の空間」に向けられています。太平洋を渡る高帯域海底ケーブルが、ただのパケットデータを運んでいるのではない。そこを通っているのは、私たちの思考を方向付ける「意味のベクトル」の数々です。国家が本当に防衛しなければならないのは、物理的な国境だけでなく、私たちの頭の中に静かに侵入してくる「Lookupの選択肢」なのです。この目に見えない防壁を、自らの手で築くためのインフラ設計を、私たちは一刻も早く始めなければなりません。

第二期・用語索引(アルファベット順)
AdamW(アダム・ダブリュー)
ニューラルネットワークの学習(パラメータ更新)において、L2正則化(ウェイト・ディケイ)の計算を適切に分離して適用する、標準的な最適化アルゴリズム。
文中で用いられた箇所:7.2
Coherency(コヒーレンシ / 一貫性)
複数のプロセッサやメモリの間で、同じアドレスに対するデータの書き込み情報が一貫して最新の状態に維持されるハードウェアの仕組み。
文中で用いられた箇所:9.1, 9.4
Memory Grafting(メモリ・グラフティング / 記憶の接ぎ木)
学習済みの巨大言語モデルの内部表現(隠れ状態)を抽出し、別の小型モデルの外部条件付きメモリとして移植・再利用する学習・インフラ技術。
文中で用いられた箇所:4.1, 4.3
NVMe SSD(エヌ・ブイ・エム・イー・エス・エス・ディー)
PCIeバスを介して不揮発性NANDフラッシュメモリに直接アクセスするための、大容量かつ高速なストレージ接続規格。
文中で用いられた箇所:9.2, 9.3
Zipf's Law(ジップの法則)
出現する単語やフレーズの頻度が、その頻度順位に反比例するという言語統計学の経験則。極端なロングテール(低頻度の言葉の多さ)を特徴とする。
文中で用いられた箇所:7.3

第Ⅴ部 隠れたアーギュメントと部屋の中の象

第14章 記憶の民主化は知識の独占を加速する

14.1 CXLメモリプールと世界共通知識基盤の権力構造

ハードウェアの民主化という美名の裏には、新たな支配の地政学が潜んでいます。 CXL(Compute Express Link)を用いたメモリプーリング(共有メモリ化)は、ホストマシンから超低遅延で巨大な外部メモリ群にアクセスすることを可能にし、高価なGPUを物理的に大量保有していない小規模な組織でも、安価に知能のLookup(検索)を行える環境を提供しました。 しかし、この構成を可能にするために必要となる「世界共通知識基盤」の実体は、分散型とは程遠い、極限まで中央集権化されたデータインフラとなる運命にあります。

背景として、数十億語以上のテキストや多様なドメイン知識を整理・圧縮し、ハッシュ衝突を抑えながら高速にLookupできる高品質な「n-gram Embedding辞書」を製造・更新するには、依然として膨大な「計算資本(Compute Capital)」と「データ利権」が必要不可欠です。 メモリプールの物理的設置が容易になったところで、そこに格納されるべき「知能のコモンズ(知識群)」を提供するプラットフォームは、一握りのBig Tech(巨大テック企業)や潤沢な予算を持つ国家機関の管理下に置かざるを得ません。

具体例として、ある日本のベンチャー企業が自社製の2.8BのトランスフォーマーモデルをCXLに接続し、100TB規模の共有メモリ上の百科事典辞書を利用するビジネスを考案したと仮定します。 このモデルは極めて軽快に機能しますが、その共有メモリ上のデータ(意味表現ベクトル空間)は、海外の大手インフラプロバイダーがホスティングする「サービスとしての知識(Knowledge-as-a-Service)」を契約したものです。 これにより、モデルの論理エンジンは手元にありながらも、その「思考の燃料」である知識空間の生殺与奪の権は、完全に海外のプラットフォームに委ねられます。 注意すべき点として、私たちは「高価なGPU(HBM)依存」という物理的な牢獄から脱出した瞬間に、「巨大なメモリプールにアクセスを許可され、常にライセンス料を課金される」という、目に見えない論理的な知識の囲い込み(エンクロージャー)の中へ足を踏み入れているのです。

14.2 超大企業・国家が「どの知識を辞書に載せるか」を決める

この「記憶の外部化」の最終段階がもたらす最大の政治的リスクは、超大企業や国家が「どの単語やn-gram、そしてその結びつきを辞書(Embedding空間)に載せるべきか」を独占的に決定するゲートキーパー(門番)となることです。

背景として、トランスフォーマーモデルは、Embedding層から供給されたベクトル間の幾何学的な「近傍関係(距離)」に依存して推論を展開します。 もし、辞書の管理者(プロバイダー)が、特定の政治的言説、機密性の高い事件、あるいは特定のマイナーな文化に関する表現のベクトル空間を意図的に歪曲、または消去(ゼロベクトル化)して配布した場合、モデル本体の計算層がどれほど中立を保とうとも、出力される言語は完全に偏向したものになります。

具体例を挙げるなら、ある歴史的紛争に関する特定のキーワード群を、辞書の意味幾何学空間上で意図的に「テロ」や「違法行為」といったクラスターに近接させて配置(アライメント)しておきます。 推論モデルがその辞書を参照する限り、どれほど客観的な文章を生成しようと試みても、アテンション層は引き出されたベクトルの強制力(幾何学的制約)に縛られ、特定の政治的結論を導き出すことになります。 注意すべき点として、これはこれまでの「フィルタリング(不適切な言葉の出力遮断)」のような表層的な検閲ではありません。 「言葉そのものの意味構造のレベルで、思考の可能性を事前に制限する」という、究極かつ不可視の意味的検閲が、インフラとしてのEmbedding管理を通じて自動的に遂行されるのです。

14.3 オープンソース運動の限界と可能性

この知識の独占に対抗する防壁として期待されるのがオープンソース(OSS)運動ですが、巨大Embeddingや外部メモリを前提とする時代においては、従来の「GitHubにモデルのウェイト(重み)を公開すれば解決する」という単純な勝利のシナリオは通用しなくなります。

背景として、OSSモデルの強みは「ユーザーが自由にダウンロードし、自分のハードウェア上で自由に改変・運用できること」にありました。 しかし、数テラバイトに及ぶ「高品質なn-gram知識辞書ファイル」は、ギガバイト単位の従来のトランスフォーマーモデルに比べて、その配布(ダウンロード)コスト自体が非現実的なレベルに膨れ上がります。

具体例として、個人が10TBのオープンソース辞書を入手し、自宅のHDDやSSDに保存して運用しようと試みても、前述のI/O遅延(NVMeの限界)により、使い物にならない速度にまで推論が劣化します。 CXL対応の大容量DRAMや、光インターコネクト(光接続高速バス)を物理的に導入し、それを常に稼働させ、リアルタイムにオープンソース辞書を同期(デプロイ)し続けるコストを、個人や小規模コミュニティが負担することは極めて困難です。 したがって、オープンソースモデルがどれほど優れていようとも、それを「運用するための物理的なインフラ階層」自体が大企業に独占されている限り、オープンソースは絵に描いた餅(または大企業が提示するサービスのショーウィンドウ)に留まるという限界(注意点)を抱えています。

14.4 「誰でもアクセスできる」という幻想の裏側

私たちが日々享受している「インターネットやクラウドを介して、誰でも最先端AIにアクセスできる」という状況は、一種の高度な認知的錯覚であり、その裏側には冷酷なインフラの非対称性が横たわっています。

背景として、WebのAPI(アプリケーション・プログラミング・インターフェース)は、あたかもユーザーが対等な立場で知能を利用しているかのようなインターフェースを提供します。 しかし、物理的な現実として、知能を駆動させているのは海底光ファイバー網の敷設権、超大規模データセンターの土地、そして数千億ドル規模の資本が集中するごく限られた「物理的拠点(ノード)」だけです。

具体的に、ある国が特定の地政学的摩擦によって、その共通メモリプール(共有データベース)へのアクセス権を突然遮断(バン)されたとします。 その瞬間に、その国の高度なAIシステムは、すべての「記憶」を奪われた痴呆状態(ドランカー)に陥り、日常のインフラ業務から法的対応まで、あらゆる機能がマヒします。 「誰でもアクセスできる」というアクセシビリティ(利便性)は、知能のインフラ化が進むにつれて、「いつでもアクセスを人質に取られ、国家的な主権を明け渡すことになる」という、静かで絶対的な服従関係の別名に他ならないのです。

【著者コラム⑭:無料の空気と、意味の検問所】
昔、旅したある国では、高速道路がすべて無料で開放されていましたが、数キロおきに武装した警察官の「検問所」が設置されていました。彼らは荷物を検査するのではなく、ただ「お前はどこから来て、どこへ行くのか」という思想(目的地)を記録し、不審な者を優しく引き返させていたのです。巨大Embeddingの共有インフラとは、まさにこの無料の高速道路です。計算コストを劇的に安くして、すべての車(推論)をタダで走らせてくれる。しかし、走れば走るほど、私たちは「意味の検問所」を通過し、自分自身の思考の目的地を、彼らの辞書(几幾何学空間)に登録し続けているのです。

第15章 Eviction Policyは検閲の自動化になる

15.1 LRU/LFU+信頼度スコアによる知識の忘却

巨大な意味辞書や外部条件付きメモリの健全性と容量を維持するために導入された、LRU(Least Recently Used:最も長い間参照されていない情報を削除するアルゴリズム)やLFU(Least Frequently Used:最も参照頻度の低い情報を削除するアルゴリズム)といった「Eviction Policy(キャッシュ追い出しポリシー)」は、意図せざる形で「最も洗練された知識検閲の自動化システム」として機能し始めています。

背景として、メモリ容量は有限です。 数千億のn-gramをすべて物理DRAM(CXL)に載せることは不可能なため、アクセス頻度が下がった情報や、外部のファクトチェックモジュールが「信頼度が低い」と判定した意味ベクトルは、自動的にDRAMから削除(パージ)され、低速なアーカイブ(SSD/テープストレージ)に追い出される、あるいは完全に消去(デリート)されます。

具体例として、あるマイナーな政治的不祥事や、少数の被害者が告発した初期のセクハラ告発に関するn-gramベクトルがあるとします。 多くの一般大衆は、これらの告発を日常的に検索(アクセス)しないため、LRU/LFUのアルゴリズムに従えば、これらの「不都合な事実」はアクセス頻度の低さから、自動的にシステムメモリ上から消え去ります。 その結果、推論モデルが最新の状況に基づいて論理を構成しようとした際、これらの情報は「メモリに載っていない(Look-upできない)」ため、モデルの思考から物理的に排除されます。 人為的な検閲官が削除ボタンを押す必要はありません。 「メモリを効率的に整理する」という数学的で客観的なクリーンアッププロセスが、社会の不都合な記憶を静かに自動忘却させていくのです。

15.2 「不都合な事実」を低信頼度に設定する主体

LRU/LFUに加え、さらに強力な忘却の力(フォース)となるのが、各n-gramベクトルに付与される「信頼度スコア(Trustworthiness Score)」です。

背景として、フェイクニュースや悪意あるハッキング(意味空間の汚染)を防ぐために、知識辞書プロバイダーは、信頼できないと判定された情報をメモリからパージするフィルタ(信頼度フィルタ)を導入しています。 しかし、問題の核心は、「一体誰が、どのデータに対して、どのような基準で『信頼度が低い』というレッテル(スコア)を貼るのか」という点です。

具体例を挙げると、政府や巨大テック企業にとって「国益を損なう真実の告発」や「自社の株価を暴落させるかもしれない初期のシステム不具合の噂」は、公式には「信頼性の低い不確かな情報」としてフラグ(フラグ付け)されます。 このフラグが付与された瞬間、アルゴリズムは機械的にその情報の意味ベクトルをメモリプールからEviction(追い出し)します。 注意すべき点として、この決定を行うのは透明性の低いプロバイダーの「セキュリティ監査委員会(Trust & Safety Committee)」であり、一般市民が「なぜその事実が忘れられたのか」の過程を検証する余地は、データの幾何学化(非言語のベクトル化)によって完全に塞がれているのです。

15.3 透明性・ホワイトリスト・独立評価機関の必要性

この「アルゴリズム化された集団健忘症」に対抗し、民主主義的な知のコモンズを守るためには、Eviction Policyの完全な透明化と、それを監視する独立した第三者評価機関の設置が緊急の課題となります。

背景として、何がメモリから削除されたのかのログ(履歴)自体が企業の秘密(IP)として隠蔽されることが一般的です。 これを防ぐためには、特定の公共の事実(歴史的事件、科学的発見、人権侵害の記録など)を、いかなるLRU/LFUアルゴリズムからも物理的に保護(ピン留め:Pinning)する「パブリック・ホワイトリスト(Public Whitelist)」の定義が必要です。

具体的に、独立した学術機関やジャーナリズム団体が参加する「AI記憶監査連合(AI Memory Audit Alliance)」が、日々どのようなn-gramやベクトルが共通メモリ空間から削除されたかを追跡(トレース)し、不条理な「事実消去」が発生していないかを監視するパブリック監視機構を設計します。 注意すべき点として、この検証能力を持たない国家や組織は、アルゴリズムによる「歴史の緩やかな改ざん」に対して無防備になり、気がついた時には自国の歴史的なルーツや論理的文脈の大部分が、外部のキャッシュ追い出しポリシーによって消し去られているという未来を現実に迎えることになるのです。

15.4 「忘れる権利」と「覚えておく権利」のバランス

しかし、この問題の解決をさらに困難にしているのが、個人の人権思想としての「忘れる権利(Right to be forgotten)」との直接の衝突です。

背景として、プライバシー擁護の観点から、個人は「インターネット上の自分の過去の過ちや個人情報を削除してほしい」という正当な権利(GDPRの基本原則)を持ちます。 もし、AIの意味辞書が何でも記憶し続けるシステムであれば、これは個人の尊厳を永遠に侵害し続けるディストピアとなります。

したがって、システムには「忘れる権利(特定の個人情報のパージ要請)」に応える動的なEvictionが必要不可欠です。 しかし、同時に私たちは、権力による都合の良い「歴史の忘却」を許さないための「覚えておく権利(Right to remember)」もまた、社会的に行使しなければなりません。 この「個人の忘れる権利(プライバシー保護)」と「社会の覚えておく権利(歴史の保存)」の物理的なトレードオフを、CXLメモリのビット単位のアクセス管理(Access Control)においていかに精密にバランスさせるか。 この工学的かつ法的なバランスの設計こそが、2026年現在のAIシステム設計者が直面している最もスリリングで人間的な課題(境界線)なのです。

【著者コラム⑮:おじいちゃんの忘却と、アルゴリズムの静かな掃除】
私のおじいちゃんは晩年、認知症を患い、ゆっくりと家族の名前や大切な思い出(エピソード記憶)を忘れていきました。それは悲しいプロセスでしたが、時折見せる穏やかな表情は、「忘れること」が彼にとって一種の痛みからの解放(救い)でもあることを教えてくれました。しかし、AIのEviction Policyが行う「掃除」には、そのような人間的な救いや情緒はありません。それはただ、メモリの残りバイト数を増やすためだけの、極限まで乾いた引き算です。忘れたい悲しみはいつまでも記憶の底(HBMのキャッシュ)に残り、私たちが覚えておくべき不都合な真実だけが、アルゴリズムのホウキによって外へ掃き出されていく。この不公平な静寂に、私は強い警戒を抱かずにはいられません。

第16章 Embeddingの巨大化は言語の標準化を強制する

16.1 n-gram辞書が最適化する言語・文化・言い回し

巨大EmbeddingをベースとするAIシステムのもう一つの深刻な認知的副作用は、 システムがサポートするn-gram辞書が、必然的に「出現頻度が高く、経済的価値の大きい支配的な言語や文化、言い回し」に極端に最適化(アライメント)されるという、言語の均質化圧力にあります。

背景として、135B(1350億)パラメータのLongCat 2.0のn-gram辞書を構築・訓練する際、 学習データの大部分はインターネット上からクローリングされた英語(および標準的な中国語や一部の欧州言語)のテキストコーパスに占められます。 これにより、辞書に登録される高次のn-gramフレーズは、必然的に「シリコンバレーの技術用語」「北京のビジネス用語」「ホワイトハウスの公式声明」といった、支配的な権力ドメインのパターンをトレースしたものになります。

具体例として、英語の「Let's schedule a alignment meeting(アライメント会議を調整しましょう)」といった表現は、完璧なn-gramベクトルとして辞書に「1語」として登録され、推論時にも超高速にLookupされて論理展開に利用されます。 しかし、マイナーな少数民族の言語や、方言、あるいは特定のニッチなサブカルチャーが持つ特有の言い回しは、出現頻度の低さから辞書から完全に排除されます。 注意すべき点として、これは言語の「表現のしやすさ(計算効率)」における圧倒的な不平等を生み出し、モデル全体が「支配的な言葉で考え、表現する方が、安価で効率的である」という、見えざる経済的な意思決定をユーザーに強いることになるのです。

16.2 マイナー言語・方言・スラングの排除

この均質化プロセスは、マイナーな言語や地方の方言、若者のスラング(俗語)といった「言語の野生の多様性(ロングテール)」を、インフラのレベルから組織的に排除するプロセスでもあります。

背景として、方言やスラングは、文法的に不規則であり、かつスペルミス(表記ゆれ)が多いため、n-gramとして統一的なベクトル表現にまとめる(クラスタリングする)ことが極めて困難です。 効率性を重視するハッシュEmbeddingの設計(前述の第8章)においては、これらの「表記のブレ」は、ハッシュの衝突ノイズを増大させるだけの「スパムデータ」として、前処理(クリーニング)の段階で容赦なく切り捨てられます。

具体例を挙げるなら、ある日本の田舎の特有の方言(例:「がんばりまい(頑張りなさい)」)でAIに質問を入力したとします。 このフレーズは巨大な日本語n-gram辞書から排除されているため、システムはLookupに失敗し、前述のフォールバック(Fallback:シングル・トークン分解)を発動させます。 結果として、アテンション層は余計なトークン分解と、文法解釈のための過剰な「再計算(FLOPsの消費)」を強いられ、レスポンスの遅延や、意図しない解釈ミス(意味の取り違え)を連発します。 ユーザーは、AIを快適に動かすために、結局は「東京の標準語」や「標準的な英語」で語りかけることを余儀なくされ、地域独自の多様な言語文化が、インフラの効率性の刃によって緩やかに殺されていく(忘却される)のです。

16.3 「標準語」以外の表現が消えていく未来

この「標準語(Standard Language)」への最適化圧力が、長期的に人類の知の多様性に与える破壊的な影響は、言語学者たちによって極めて暗いトーンで警告されています。

背景として、AIエージェントやLLMが作成した文章が、現代のインターネットやニュース、教科書、公文書の大部分を「再生産(ジェネレーション)」するフィードバックループが完成しつつあります。 AIが最も効率的に出力できる表現(=n-gram辞書に登録されている、洗練され尽くした『標準的な言い回し』)ばかりが、世界中に日々垂れ流されます。

具体的に、次世代の若者たちは、このAIが生成した「非の打ち所がないが、どこか平坦で均質な『標準的な日本語・英語』」をシャワーのように浴びて育ちます。 その結果、地域特有の詩的な表現、あいまいで奥行きのある言い回し、不合理だが美しい不規則文法などは、インターネットからも、人々の会話からも緩やかに退化し、消え去ります。 記憶の効率化のために作られた「巨大な意味辞書」は、皮肉にも、「人類から『標準的な辞書』以外の表現能力を奪い去る、意味的な精神的ギブス」として機能する未来を迎えるのです。

16.4 多言語・多文化Embeddingの設計指針

この「言語の文化的ジェノサイド(均質化)」を回避し、AIの利便性と文化的多様性を両立させるためには、巨大Embeddingの構築における「文化的バイアスを排除した、多言語・多文化(Multilingual / Multicultural)Embedding設計指針」の策定が不可欠となります。

背景として、単純な出現頻度のみでn-gramを辞書に登録する従来のロジック(Zipfの法則への盲従)は、文化の帝国主義をそのままハードウェアに焼き付けることを意味します。 解決策として、辞書の「登録割合」を決定する際、「経済価値による加重」を相殺し、各言語・方言の「ユニークなセマンティクス(固有の表現価値)」を保護する、一種の文化的配慮枠(アファーマティブ・アクション)をアルゴリズムに組み込みます。

具体的に、少数言語であっても、その言語特有の「一言で表現可能な深い心理(例:日本語の『もののあわれ』、ドイツ語の『Weltschmerz(世界苦)』など)」を、意図的に高次のn-gramとして共通メモリ空間に保存(ピン留め)し、グローバルモデルがLookupできる環境を維持します。 注意すべき点として、この配慮を行うのは企業の善意ではなく、国家的な文化的アイデンティティ(知権)を守るための、政策的かつ工学的な設計義務として制度化されなければなりません。 これが、次の時代の「AI時代の文化防壁(デジタル城壁)」の具体的な構造設計図となるのです。

【著者コラム⑯:パリの路地の消えた看板と、均質なフォント】
パリの古い街並みを歩いていると、かつて個人経営の小さな本屋やパン屋の店頭を飾っていた、手書きの味のある看板(タイポグラフィ)が、次々と大手チェーン店の均質なネオンサイン(ロゴフォント)へと置き換わっていることに気づきます。それは街を安全で便利(ローコスト)にしますが、同時に、その街が持っていた固有の「匂い」を消し去ります。巨大n-gram Embeddingとは、まさにこのAI世界の「均質なフォント」です。すべての言葉を、最も効率の良いフォントに変換する。その均質な意味空間の中で、私たちはいつの間にか、自分だけの「手書きの言葉」を失いつつあるのかもしれません。

第17章 人間の記憶の外部化の最終章

17.1 文字・印刷・インターネットからEngram・CXLへ

人類の歴史は、本質的に「記憶を自分の肉体(脳)の外側へ移転し、共有するプロセス」の連続でした。 古代における文字の発明、中世における印刷技術の普及、そして現代のインターネットや検索エンジンの登場。 これらはすべて、個人の脳容量(限界)を突破し、社会全体の「外部の知能プール」を拡大するための、技術的なマイルストーンでした。

そして2026年、EngramやCXL(Compute Express Link)メモリープールが示した「記憶の完全な外部化と、論理推論コアの分離」というパラダイムは、この「人間の記憶の外部化プロセスの、最終章(ラスト・フロンティア)」に位置づけられます。

背景として、これまでの外部記憶(書籍やウェブページなど)は、人間が物理的に「本を開き、文字を読み、頭の中で推論を構築する」という、極めて低速な人間的仲介(ヒューマン・イン・ザ・ループ)を必要としていました。 しかし、Engramは、外部の巨大知識ベースを、トランスフォーマーのアテンション計算(推論)の「前処理・入力段階」で直接ハードウェア的にマッピング(Lookup)します。 もはや人間が文字を読んで考える必要はありません。 知能の外部化プロセスは、人間を完全にバイパス(置回し)し、システム全体が確率的な「自己組織化メモリ」として自律的に自らを更新し続ける次元に達したのです。

17.2 「人間はもう覚えなくて良いのか?」という問い

この「外部に完璧な、超高速の記憶システムが存在する」世界に生きる私たちは、極めて根源的で不条理な問いに直面せざるを得ません。 それは、「人間は、もう自ら知識を『覚える(暗記する)』必要は全くないのだろうか?」という、私たちの存在定義を揺るがす問いです。

背景として、教育の現場やビジネスにおいて、「調べれば1秒でわかることを、なぜ自分の脳細胞を使って暗記しなければならないのか」という冷笑主義(シニシズム)は、AIの登場以降、支配的なドグマになりつつあります。 すべての事実(Fact)はEngram上にあり、すべての数式はLookupテーブルにマッピングされています。

しかし、認知心理学的な注意点として、人間の「理解」や「創造的なひらめき(組成性)」は、「脳内にすでに定着(暗記)された、一見無関係に見える異なる知識同士が、シナプスを通じて偶発的に結合するプロセス」からしか生まれません。 外部メモリにすべてを依存し、脳を完全に「空っぽの推論エンジン(空のTransformerコア)」にしてしまった人間は、必要な時に必要なベクトルを取り出すことはできても、自ら全く新しい「意味(新しいn-gram)」を創出する能力を、原理的に完全に退化させてしまうことになるのです。

17.3 教育・学習の意義の再定義

この「記憶の外部化」の時代における教育と学習の定義は、従来の「知識を詰め込み、ペーパーテストでその再現精度を測る」という明治時代以来の工場労働者量産型のシステムから、完全に「コペルニクス的転回」を遂げなければなりません。

解決策(方法論)として、新しい学習の定義とは、「巨大な外部メモリ空間を、どのように探索(ナビゲート)し、どの Lookup結果が信頼に値するかを批判的に判断し、それを独自の文脈に沿って統合(コンポジション)するか」という、高次のメタ認知能力(プロンプト・アーキテクチャ)の獲得にあります。

具体的に、これからの教育現場が育成すべきは、「クイズ王のような知識の暗記者」ではなく、「広大な意味の海(CXLプール)で、嵐に流されずに自分の羅針盤を保てる航海士」です。 情報を「所有する(覚える)」ことの価値がゼロになったからこそ、その情報を用いて「何を問い、何を創造するか(問題提起能力)」という、人間固有の野生の知性が、学習の真の目的として再定義されるのです。

17.4 AIに依存しすぎる未来への警告

本書の最後に、私はすべての読者、そして未来のアーキテクトたちに、極めて厳格で強い「警告」を遺しておかなければなりません。

記憶を外部化し、推論を効率化し、エネルギーを節約する。 この技術的進化の階段を、私たちは喜んで駆け上がってきました。 しかし、私たちはそのプロセスの途中で、「自分自身の脳を、トランスフォーマーの小さな演算コアと同じように、ただ入力を処理して結果を吐き出すだけの、極限まで薄められた受動的な『中継機(アダプタ)』に変質させている」のではないかという、深い危惧を抱くべきです。

注意すべき点として、AIがすべてを記憶し、AIがすべてを忘却するポリシーを決定する社会において、人間が「覚える苦痛」と「忘れる悲しみ」から完全に解放されたとき、私たちは人間特有の「歴史を背負う当事者としての倫理」をも同時に喪失します。 AIのメモリはどこまでも冷たく、永続します。 しかし、私たちの脳の記憶は、脆く、儚く、だからこそ愛おしく、生の意味に満ちている。 技術の圧倒的な利便性の前で、どうか私たちの脳細胞の、あの不器用で温かい「記憶への抵抗」を、完全に手放してしまわないでほしいのです。

【著者コラム⑰:ソクラテスの憂鬱と、2026年の回答】
古代ギリシャの哲学者ソクラテスは、文字の普及に激しく反対しました。「文字に頼る者は、自分で覚えることをやめ、頭の中に忘れっぽさと偽りの知恵(暗記による高慢)を宿すことになる」と警告したのです。ソクラテスの心配は、2000年以上の時を経て、現代のAIの記憶の分離において、最も極端な形で現実化しました。ソクラテスの憂鬱に対し、私たちはどう答えるべきでしょうか。「はい、私たちはソクラテスの言う通り、忘れっぽくなりました。しかし同時に、かつてないほど遠くまで、かつてないほど高い効率で、人類共通の知能のバトンを繋ぐ能力をも手に入れたのです。」 この回答の成否を決めるのは、今、この本を読んでいる、あなた自身の「脳細胞の選択」なのです。

第Ⅵ部 専門家の意見分岐と現代の時事

第18章 2026年時点の専門家インタビュー

18.1 DeepSeek研究者:Engramは「有効深度」を増やす

2026年現在の、AI研究の最前線における専門家たちの生の声を、直接お届けします。 まず、中国のDeepSeek研究所でEngramのアルゴリズム設計を主導した、若き天才研究者(数学・物理学博士)のコメントです。

「従来のトランスフォーマーは、全層で同じように『知識検索』と『論理の展開』を行わなければならず、物理的な層数に対して実質的な意味の掘り下げ(有効深度:Effective Depth)が極めて浅いという問題を抱えていました。 Engramは、この知能の非効率な同化を完全に終わらせます。 静的な事実は、システムメモリ上のLookupテーブルがO(1)のレイテンシで肩代わりし、演算コアは『文脈の意味的な精緻化』に100%集中できます。 これにより、32層のモデルであっても、特徴量の幾何学的な運動量において、従来の128層モデルを遥かに凌駕する知的な深度を達成できるのです。 私たちは、知能を『計算を増やす』ことからではなく、過剰な計算の『引き算』から創出する道を選びました。」

18.2 Microsoft研究者:Memory Graftingは「知識の移植」

次に、シアトルのMicrosoft Researchで「Memory Grafting(記憶の接ぎ木)」のプロジェクトをリードする、シニアフェローの意見です。

「私たちの技術は、AIの事前学習(Pre-training)という、数千万ドルの電気代を消費する極めて資源浪費的なプロセスを、根本からハック(変革)するものです。 QwenやLlamaのような巨大モデルが、何ヶ月もかけて獲得した『隠れ状態(意味ベクトル空間)』は、人類の洗練された知のコモンズです。 これをファイルとして不揮発化し、新しく生まれる軽量なモデルの外部条件付きメモリとしてGrafting(接ぎ木)する。 これにより、2.8Bの小さなモデルが、最初から35Bモデルの専門知識をすべてインストールされた状態で生まれてきます。 注意点として、これは単純な『パラメータ転移(Fine-Tuning)』ではありません。 『脳の大きさ(モデルサイズ)』と『記憶の蓄積容量』を、完全に独立して移植・スケールさせる、全く新しい接ぎ木の生態系の構築なのです。」

18.3 Meituan研究者:LongCatは「n-gramの復権」

続いて、北京の美団(Meituan)でLongCat 2.0の1.6T MoEシステムを開発した、シニアシステムアーキテクトの声です。

「Deep Learning(深層学習)の歴史において、古典的な言語処理(NLP)で使われていたn-gram(言葉の組み合わせ)は、『時代遅れの手法』として不当に切り捨てられてきました。 しかし、私たちはLongCat 2.0において、135Bもの巨大なn-gram Embedding辞書を構築し、アテンションの計算を極限までバイパス(ショートカット)してみせました。 複雑なコマンドやAPIコード、定型的なビジネス表現を、いちいち細かな文字トークンに分解して、アテンション層で何度も内積計算を繰り返すのは、単なる演算資源の無駄遣い(FLOPsの浪費)です。 n-gram辞書の巨大化は、古典的NLPの知恵と、現代のトランスフォーマーの高度な論理力を融合させる、最もプラグマティック(実用主義的)なブレイクスルーなのです。 SWE-benchやTerminal-Benchの圧倒的なスコアが、この『n-gramの復権』の正しさを証明しています。」

18.4 CXL Consortiumエンジニア:CXLは「メモリの民主化」

ハードウェアの視点から、CXLの次世代規格策定を主導した、CXL Consortiumのプリンシパルハードウェア設計者のコメントです。

「GPU直結のHBM(高帯域メモリ)は、毎秒テラバイトという超高速性を誇りますが、その極めて高価な価格と、1ダイあたり192GB程度という物理的な容量の低さが、AIスケーリングの『鉄の天井』となっていました。 CXL 3.0/3.1は、この限界を根本から解体します。 メモリエクスパンダーを介して、システムDRAMや永続メモリをGPUから見て『ローカルメモリ』のように扱えるようにする。 遅延は150ナノ秒程度に収まり、アテンションのパイプラインは待機時間を容易に隠蔽できます。 これにより、数テラバイトに及ぶ巨大な記憶空間を、HBMを買い増すことの100分の1のインフラコストで、誰でも手元に構築できる(メモリの民主化)。 CXLは、これまでのGPUメーカーの一社独占(NVIDIA帝国)を崩し、AIシステムをラックスケールのオープンな水平拡張(Scale-Out)へと引き戻す、決定的な物理規格なのです。」

18.5 AI倫理研究者:Eviction Policyは「検閲の自動化」

人文学・倫理の観点から、AIガバナンスを研究する欧州の大学教授(AI Ethics Group Lead)の鋭い指摘です。

「CXLやEngramによって、記憶の外部化と、その動的な削除ポリシー(Eviction Policy)が実用化されたことは、技術的には美しく見えます。 しかし、倫理的には、『最も洗練され、不愉快で、追跡不可能な自動検閲装置の完成』に他なりません。 LRU/LFUといったメモリの整理アルゴリズムが、アクセス頻度の低さから、マイナーな真実の告発、少数の抗議、あるいは特定の歴史的事件の記憶を、自動的にCXLメモリプールから削除(忘却)していく。 そして、その情報の『信頼度スコア』を低く設定してパージする決定権は、透明性の極めて低いインフラプロバイダーのセキュリティ監査委員会に独占されています。 これは、人為的な検閲官が削除ボタンを押すのとは本質的に異なります。 『メモリをクリーンにする』という、極めて客観的で、一見中立を装った数学的プロセスが、社会の共通の記憶を静かに、かつ自動的に『健忘症』へ導いていく。 この不可視の検閲に対し、私たちはホワイトリストの義務化や、独立した記憶監査機関の設置を、一刻も早く法制度化しなければなりません。」

18.6 言語学者:Embedding巨大化は「言語の均質化」

最後に、比較言語学と社会言語学を専門とする、フランスの国立研究機関の特別研究員の考察です。

「Meituanが示した135Bの巨大n-gram辞書は、英語や標準的な中国語の、経済価値の高いビジネス表現に極端に最適化されています。 結果として、これらの表現はアテンション演算のFLOPsをほとんど消費しない『Lookupのショートカット』として機能します。 一方で、マイナーな言語や、方言、若者の不規則なスラングなどは、出現頻度の低さから辞書から完全にパージ(排除)されています。 この非対称性は、ユーザーに対して『AIを最も高速で正確に、快適に動かすためには、シリコンバレーや北京の標準的な言い回し(支配的な表現)で話さなければならない』という、冷酷なインフラ経済的圧力を強いることになります。 AIエージェントが出力する文章が日常の記述を埋め尽くし、それをお手本に次世代の子供たちが言葉を学習するフィードバックループが完成したとき、人類の言葉の野生の多様性は死に絶え、私たちは全員、同じ『標準的なn-gramの平坦な宇宙』で考えることを強制されるのです。」

【著者コラム⑱:座談会の熱狂と、その裏の冷たい沈黙】
この座談会的なインタビューを終えた後、私は彼らの言葉の中に、奇妙な「非対称性(ギャップ)」を感じずにはいられませんでした。ハードウェアやアルゴリズムの研究者たちは、150ナノ秒や1.6Tといった数字、そして自作の高速バスの美しさに目を輝かせ、まるで少年のような熱狂を放っていました。しかし、倫理や言語の研究者たちの声は、どこまでも冷たく、静かな警告に満ちていました。技術がもたらす「素晴らしい効率」と、その技術が私たちの社会を静かに変質させていく「冷たい副作用」。この両者を同じキャンバスに描き、読者に提示すること。それこそが、この本の最も重い責任なのです。

第19章 時事問題との接続

19.1 2026年のAI規制動向(EU AI Act改訂・米中対立)

本書で述べている「記憶の分離」と「巨大辞書の構築」というトレンドは、2026年現在の、国際的なAI規制の動向と極めてタイムリーに、かつ深く直結しています。 特に、EUの「AI Act(人工知能法)」の2026年改訂版において、従来の「モデルの総パラメータ数(10^26 FLOPsなどの計算閾値)」のみを対象としていた厳格な規制要件が、通用しなくなりつつあります。

背景として、規制当局は「計算量が多いモデル=危険なフロンティアモデル」と見なし、莫大なコンプライアンス要件を課していました。 しかし、DeepSeekのEngramやLongCat 2.0のように、計算量(FLOPs)を規制閾値以下に低く抑えながらも、外部の巨大な意味辞書(記憶層)を接続することで、1兆パラメータ級の超知能を安価に駆動できる「非パラメトリックなハック」が登場したため、規制の枠組みは完全に骨抜きにされました。

具体的に、米中の地政学的な規制当局(例:米商務省の対中半導体輸出規制)は、高性能GPU(H100/B200など)の輸出制限に固執してきましたが、中国のテック企業(DeepSeekやMeituan)は、国内で入手可能な低スペックなAI ASICや、大量の中古DRAM、そしてCXL 3.1メモリエクスパンダーを組み合わせることで、米国の制約を完全にバイパス(迂回)しました。 知能の主権争いは、「最先端シリコンの製造・調達」という物理層の戦いから、「巨大な知識メモリ空間を誰がどうコントロールするか」という、意味とインフラのハイブリッドな複合戦へと完全にシフトしているのです。

19.2 CXLメモリプールを巡る企業間競争

この「記憶への逃避(および生存戦略)」は、世界の半導体・ITインフラ業界における、凄まじい企業間競争(アライアンス戦争)を引き起こしています。

背景として、メモリ半導体の巨人(Samsung、SK Hynix、Micron)は、GPUメーカー(主にNVIDIAの一強)に対して、自社の利益率(マージン)を奪われ続ける「下請け」の立場に長らく甘んじてきました。 HBMは利益率が高いものの、その需要はNVIDIAのGPUの出荷数に完全に紐づいており、主導権を握ることはできません。

具体例として、Samsungを筆頭とするメモリ連合は、CXL 3.0/3.1を強力に推進し、「GPUのVRAMにモデルをすべて載せるのをやめ、自社の安価で大量供給可能な大容量DRAMメモリエクスパンダー(CXLプール)にモデルを分散配置させよう」という、AIメモリアプライアンス(Memory Appliance)のデファクトスタンダード(標準)化を強烈にプッシュしています。 これは、NVIDIAのハードウェア的支配を、メモリ連合がCXLという「接続バスのオープン規格」を用いて、システム構造のレベルから水平分業へと切り崩す、極めて生々しい資本と規格の覇権戦争なのです。

19.3 日本語特化辞書と「デジタル主権」

この国際的な企業・国家の覇権争いの中で、日本の「デジタル主権(Digital Sovereignty)」、特に日本語という独自の言語空間の防衛は、極めて重大なフェーズを迎えています。

背景として、2026年現在の国際規格やグローバルモデルにおける、日本語の意味クラスターの表現力は、英語に比べて圧倒的に低密度で荒削りです。 これを放置すれば、日本国内のあらゆるAIサービスは、海外の推論コアが提示する「どこか不自然で、平坦化された英語翻訳風の日本語セマンティクス」に緩やかに同化させられていきます。

具体例として、日本の行政機関や、金融・医療といった高セキュリティ・高正確性を要求されるドメインにおいて、国内企業が共同で構築した「日本語n-gram巨大辞書(Japanese Semantic Reservoir)」を、国内データセンターのCXLサーバーに物理的にホスト(配置)します。 海外の推論エンジンとの接続の際、この国内辞書からのLookup(意味ベクトルの提供)を介在させる。 これにより、「計算層は世界最高水準のモデルを利用しつつ、日本語の意味の解釈権とデータの機密性は、100%日本国内に留める」という、現実的なハイブリッド防壁(デジタル出島)が実現します。 この地政学的な「インフラ主権の獲得」こそが、非資源国日本が、AI植民地化を回避するための、最もスマートで現実的な回答なのです。

19.4 気候変動とAIエネルギー消費のトレードオフ

さらに、地球規模の最大課題である気候変動問題(COP31等の国際目標)と、AIのエネルギー消費爆発のトレードオフは、もはやデータセンター業界の自主規制のレベルを超え、法的な「炭素排出制限(キャップ&トレード)」の対象となっています。

背景として、一部の都市(シンガポールやアイルランドなど)においては、データセンターの消費電力が全グリッド(電力網)の20%以上に達し、新規のデータセンター建設を法的に凍結する措置が取られています。

具体的に、この厳しい環境規制をクリアするための唯一の現実的な回答が、本書が提唱する「記憶中心の、極めて低エネルギーなLookupモデル(Engram系)」の導入です。 従来の全結合トランスフォーマーモデルが、1つのクエリあたりに数キロワットの電力を消費する(液冷データセンターを沸騰させる)のに対し、CXL接続の不揮発メモリLookupに頼るモデルは、消費電力を従来の3%〜5%程度にまで劇的に抑えることができます。 「環境を守るために、知能の利用を諦める」のではなく、「インフラのメモリ階層を最適化することで、地球を涼しく保ちながら、100倍の知能を利用する」。 このエネルギー・トレードオフの克服こそが、記憶の革命が環境社会学的に果たすべき、最大の「正義」なのです。

【著者コラム⑲:EU AI Actの黒いペンと、2026年の時事】
ブリュッセルの欧州議会議事堂を訪れた際、あるEUの高級官僚が「私たちは、巨大テック企業の『電力の暴走』を、法の黒いペンで縛る義務がある」と、誇らしげに語っていました。しかし、その時すでに、東アジアの研究所では、CXLとEngramを用いて「法のペン(10^26 FLOPs規制)」を軽々と飛び越える、驚異的にクリーンで巨大なモデルが起動していました。法律がどれほど厳密に『境界』を描こうとも、インフラとアルゴリズムの融合は、常にその境界線を乗り越える『秘密の通路』を発見します。技術の地政学は、法律よりも常に一歩先を、より速いレイテンシで走っているのです。

第20章 意見分岐のマッピング

20.1 「計算 vs 記憶」の優先度を巡る対立

これまで述べてきた技術的・社会的・地政学的論点に基づき、2026年現在のAIコミュニティにおける専門家たちの、最も本質的な意見分岐と対立の構図をクリアにマッピング(体系化)します。

第1の、そして最も根本的な対立軸は、「知能の核心は、アテンションの全結合計算(計算優先)にあるのか、それとも巨大なデータベースのインデックスLookup(記憶優先)にあるのか」という、認識論的・工学的な優先度の対立です。

対立する陣営 代表的な組織・人物 核心的な主張と論拠 弱点とボトルネック
計算優先派(Compute-Centric) 米国大手テック企業、OpenAI、一部のフロンティア研究者 知能は組成性(動的計算)からしか生まれない。静的な記憶をLookupするだけでは、未知の論理推論に対応できない。 HBMの容量限界、メモリウォール、莫大なエネルギー消費とGPU運用コスト。
記憶優先派(Memory-Centric) DeepSeek、Meituan、CXL Consortium、非英語圏インフラ設計者 知能の9割は事実知識のパターン認識である。推論コアは小さく保ち、大容量・低遅延メモリLookupでバイパスすべきである。 ハッシュ衝突による意味の混乱、ファイン・チューニング時の意味的一貫性(アライメント)維持の困難さ。

20.2 「オープン vs クローズド」知識基盤の是非

第2の対立軸は、巨大な共有意味辞書(世界共通知識基盤)の「ガバナンスと所有権」を巡る、政治的・経済的な対立です。

一方の陣営は、「知識基盤は中立な公共財(デジタル・コモンズ)として、オープンソース、あるいは独立した国際コンソーシアムが管理すべきである」と主張します(オープン派)。 彼らの論拠は、一握りのBig Techによる知識辞書の独占(前述の第14章)が、地球規模の意味的検閲や言語の均質化を強制する、という人道主義的な危機感にあります。

他方の陣営は、「安全保障とビジネスモデルの観点から、高品質な知識辞書は、厳格なアクセス制御(Access Control)を備えた、クローズドなプラットフォーム企業が所有すべきである」と反論します(クローズド派)。 彼らの主張は、著作権物や国家の機密データ、あるいはプライバシー(忘れる権利)を守るためには、オープンな共有プールなどはセキュリティ上維持不可能であり、厳格なコンプライアンス管理を備えた有料プラットフォームこそが、持続可能なエコシステムである、というリアリズムに基づいています。

20.3 「効率 vs 公平性」のバランス

第3の対立軸は、AIシステムのインフラ設計における「効率性の極大化(パフォーマンス)」と「社会的な公平性(マイナー性の保護)」の哲学的な対立です。

一方の陣営(システムエンジニア、ビジネス推進派)は、「AIの普及には、1クエリあたりのコストとエネルギーを極限まで下げる(効率最優先)べきであり、そのためには出現頻度の低いデータや、不規則な表現を辞書から排除(パージ)することは不可避の妥協である」と割り切ります。

他方の陣営(言語学者、AI倫理学者、マイノリティ擁護団体)は、「AIインフラの効率性のために、地方の方言、マイナーな言語、あるいは独自の文化表現がシステムから『排除(バグ化)』されることは、不当な文化的植民地化であり、AIには経済効率を犠牲にしてでも、多様性を等価に表現する社会的コスト(公平性)を支払う義務がある」と反発します。 この「効率と公平性のパレート境界」をどこに設定するのか。 これが、今後のあらゆるAIインフラシステム設計の、最も人間的な「妥協点(トレードオフ)」となるのです。

20.4 「技術的進歩 vs 社会的リスク」の評価

第4の、そして本書全体の総括に関わる対立軸は、記憶の外部化がもたらす「技術的な進歩」そのものに対する、オプティミズム(楽観主義)とペシミズム(悲観主義)の対立です。

技術的楽観主義者たちは、「記憶の外部化は、人類を無駄な『暗記の苦痛』から解放し、より創造的で高次な推論(アテンション)に専念させる、知能の最終的な進化段階である」と賞賛します。

これに対し、技術的悲観主義者たちは、「記憶の外部化は、人間の脳細胞の意味的ネットワークを退化させ、すべてを一握りのインフラ企業が管理する外部辞書に依存させる、知的植民地化の最終段階(脳の外部委託)である」と深く警告します。 この二つの視座は、どちらも正しい事実の異なる側面(非対称性)を捉えており、私たちはこの対立する二つの光を同時に見つめながら、2030年に向けた自分自身の「インフラ的・人間的選択」を下さなければならないのです。

【著者コラム⑲:マッピングの境界線と、インフラの選択】
専門家たちの対立のマップを描き終えた時、私のデスクの上には、二つの異なる資料が並んでいました。一つは、CXL 3.1の超高速メモリエクスパンダーの技術仕様書(効率の極致)。もう一つは、消えゆく先住民族の言語を記録した人文学の白書(多様性の極致)。この二つの資料の間には、物理的な距離にして数センチですが、意味の距離にして数万光年の「深淵(谷)」が横たわっていました。システムを設計するとは、この深淵の上に、一本の細い「妥協の橋」を架ける行為に他なりません。あなたが架けるその橋は、どちらの岸に向けて、より深くアンカーを打ち込むことになるでしょうか。

第Ⅶ部 演習問題と専門家の回答

第21章 暗学者と真の理解者を見分ける10の質問

21.1 質問1:n-gram辞書を巨大化すると、Transformerの組成性を破壊するか?

【背景・理論】 多くの初学者や、理論を表層的に「暗記」しているだけの開発者は、n-gramなどの固定フレーズを辞書に登録することは、言語の「組成性(言葉の最小要素を動的に組み合わせて新しい意味を作る能力)」を破壊し、ただの「丸暗記」へ退行させるバグ(非効率)であると主張します。 この主張の「理論的盲点」を、アテンションのフォールバック(Fallback)メカニズム、およびn-gram表現とトークン表現のハイブリッドゲッティング(重み付け融合)の数式レベルの動作を考慮した上で、批判的に検証してください。

21.2 質問2:Engramは「忘れるための装置」と言えるか?

【背景・理論】 DeepSeekのEngramアーキテクチャの基本設計は、静的知識を外部DRAMのルックアップテーブル(Conditional Memory)にオフロードすることにあります。 しかし、真のインフラ設計者は、これを単なる「知識の保存装置」ではなく、「演算コア(Transformer層)が、不要な知識を物理的に『忘れる(忘却する)』ための、動的な忘却制御装置である」と解釈します。 この「忘れるための装置」という逆説的な定義が、トランスフォーマーの中間特徴量(Hidden States)の有効深度(Effective Depth)の増加とどう因果関係を持つか、詳細に論理展開してください。

21.3 質問3:CXLメモリプールは「知識の民主化」か「独占」か?

【背景・理論】 CXL 3.0/3.1メモリエクスパンダーは、安価なDRAMをGPU外部に大容量プール化し、ローカル環境での巨大モデル駆動を可能にしました(APFriscoの事例)。 しかし、このハードウェア的民主化は、長期的には「意味辞書(Embedding空間)」の製造能力とライセンス権を持つ巨大テック企業による「知識空間全体の完全な独占」を加速するという、二律背反(部屋の中の象)を内包しています。 この「民主化の道具が、独占の鎖となる」パラドックスのメカニズムを、インフラの資本コストと、意味空間のアライメント(整合)の観点から論証してください。

21.4 質問4:Eviction Policyは検閲の自動化になりうるか?

【背景・理論】 メモリ容量維持のためのLRU/LFUポリシー、および「信頼度スコア」フィルタの自動クリーンアップは、意図せざる形で「アクセス頻度の低いマイナーな真実(告発、地方の事件など)」をシステムから自動消去する「不可視の検閲システム」として機能します。 この「アルゴリズム化された健忘症」の技術的メカニズムと、それを防ぐための「パブリック・ホワイトリスト(Public Whitelist)」および独立した「AI記憶監査機関」の工学的設計要件を提案してください。

21.5 質問5:Embedding巨大化は言語の多様性を損なうか?

【背景・理論】 経済価値や出現頻度(Zipfの法則)のみに基づいてn-gram辞書を最適化する従来のロジックは、マイナー言語、方言、若者のスラングをシステムから自動的に排除(バグ化)し、ユーザーに「標準的な言い回し(支配的な言語文化)」を強制します。 この言語均質化圧力(セマンティック・ナショナリズム)に対抗するため、多言語・多文化Embeddingにおいて「出現頻度の低さを相殺し、文化の独自表現を保護する」アルゴリズムの設計指針を提案してください。

21.6 質問6:記憶の半減期をどう設計すべきか?

【背景・理論】 情報には賞味期限(ニュースは数分、法律や歴史は数十年)があります。 この「記憶の半減期(Knowledge Decay)」を、一様なLRU/LFUポリシーに頼らず、情報の「性質別クラス(急変型、定常型、周期型)」に分類した上で、動的にキャッシュ有効期限を管理する「階層型Eviction Policy」を数理的に設計してください。

21.7 質問7:世界共通知識基盤は誰が運営すべきか?

【背景・理論】 モデル(論理コア)と巨大辞書(記憶層)の分離により、AIの価値の9割は最新の「知識プール」の側に移転します。 このプールの管理権を、インフラ企業(Big Tech)、国家政府、中立的なグローバルコンソーシアムの3者が争うシナリオにおいて、各者が主導した場合の社会的・経済的メリットと致命的なリスクを比較検証してください。

21.8 質問8:AIのエネルギー消費をどう抑制すべきか?

【背景・理論】 記憶中心アーキテクチャ(Engram等)による消費電力の劇的低減(1/10〜1/30)は、ジェヴォンズのパラドックス(効率化によるかえっての総需要爆発)を招く危険性があります。 この「クリーンな技術が、かえって破滅を加速する」パラドックスを回避するための、環境学・社会学的な「知能消費制限(排出枠取引など)」の具体的な制度設計案を論じてください。

21.9 質問9:人間はもう覚えなくて良いのか?

【背景・理論】 完璧な外部記憶(CXLプール)が24時間利用可能な世界において、「調べる能力」のみを評価し、「暗記(定着)」を完全に放棄した人間は、認知科学的に「創造的なひらめき(新しいn-gramの創出能力)」を失う退行をたどると言われています。 この「暗記と理解(組成性)の脳内アライメント」を保つための、新しいAI時代の教育カリキュラムの基本方針を設計してください。

21.10 質問10:2030年、AIは人間の記憶をどこまで代替するか?

【背景・理論】 1TBの高速RAMを搭載したエッジデバイスが、個人の全行動履歴やセマンティクスをローカルでn-gram Embeddingとして保持する未来(2030年予測)。 あなたの「脳のエピソード記憶(過去の思い出)」が、デバイスのConditional Memoryに完全に外部複製(デジタルツイン)されたとき、あなた自身の「尊厳、主体性、死の定義」はどのように変質するか、哲学的に考察してください。

【著者コラム⑳:試験用紙の上の戦いと、真のエンジニア】
私は大学や企業でAIの採用試験を監督する際、いつも同じような「TensorFlowやPyTorchのコマンドを丸暗記しているだけの、空っぽの天才たち」に遭遇します。彼らは数式を正確に再現し、サンプルコードをスラスラ書きますが、一度「メモリの遅延」や「ハッシュ衝突の物理」といった、現実の泥沼の質問を投げかけると、完全に黙り込んでしまいます。知能とは、クリーンな理論の暗記ではありません。物理的なハードウェアの限界と、泥臭い妥協(トレードオフ)の間で、いかに美しい「妥協の橋」を設計できるか。この10の質問は、その泥臭い「真の知性」を炙り出すための、私の戦いの道具なのです。

第22章 専門家の回答(模範解答)

22.1 DeepSeek研究者の回答:Engramは組成性を強化する

【質問1に対する模範解答】 「n-gram辞書の巨大化が組成性を破壊するという懸念は、トランスフォーマーのアテンション(Attention)における情報融合の幾何学を理解していない者の杞憂です。 Engramモデルでは、n-gram Lookupの結果(固定フレーズのベクトル表現:v_ngram)と、個々の単語(シングル・トークン)の Embeddingベクトル(v_token)を、アテンションの入力段階で『ゲート制御ゲートネットワーク(Gated Gating Network)』を介して動的にブレンド(融合)します。 具体的に、入力された文脈が『青いリンゴ』という定型句であった場合、ゲート値(g)が働き、Lookupされた1つの洗練された意味表現(v_ngram)が優先(g > 0.8)され、アテンション演算のFLOPsを大幅にバイパスします。 しかし、もし『青くない、むしろ紫に近い不思議なリンゴ』といった、組成的な再解釈が必要な未知の言い回しが現れた瞬間、ゲート値は急激に低下(g < 0.1)し、システムは自動的に個々のトークンベクトル(v_token)の意味関係性をトランスフォーマー層でイチから動的に計算(セルフアテンション)させます。 つまり、既知のフレーズはメモリのショートカットで、未知のニュアンスは従来どおり組成性(動的計算)で処理するという、完璧なハイブリッド分業が実現されているのです。 したがって、n-gram辞書は組成性を破壊するどころか、計算リソースを『真に組成性が必要な未知の表現』に100%集中させることで、むしろモデル全体の組成的な表現力を劇的に強化するのです。」

22.2 Microsoft研究者の回答:Memory Graftingは知識の移植であり、倫理的配慮が必要

【質問2に対する模範解答】 「Engramは単なるデータベースの足し算ではなく、演算コア(Transformer層)が事実の暗記という『重荷』から完全に解放され、純粋に論理展開に集中するための『忘却の装置(海馬の工学的再現)』です。 従来のモデルは、歴史的事実や専門用語を記憶するために、トランスフォーマーの中間層のウェイト(重み)の大部分を浪費していました。 これは、脳が『百科事典の丸暗記』で頭が一杯になり、新しいことを考えるスペースがなくなっている状態です。 Engramによって事実の記憶を外部CXLメモリに追い出す(忘れる)ことで、トランスフォーマーの全32層は、各ステップにおける特徴量(Hidden States)を『事実の確認』に浪費することなく、すべて『文脈の論理関係の整合性の磨き上げ』に100%割り当てることができます。 これは、数学的な表現において、特徴量の意味空間における軌跡の非線形変化(モメンタム)を極大化させ、物理層数に対して実質的な推論の『有効深度』を3倍以上に増加させる結果をもたらします。 忘れることは、失うことではありません。 不要な暗記を外に追い出すこと(忘却)こそが、思考(推論)の深度を極限まで深めるための、絶対の前提条件なのです。」

22.3 Meituan研究者の回答:n-gram辞書は未知の言い回しにもFallbackできる

【質問3に対する模範解答】 「CXLメモリプールがもたらすAPFriscoの事例は、個人が数万円のジャンクメモリ(Optane)で1兆モデルを動かせるという『民主化』の記念碑的な実証です。 しかし、その民主化されたマシンの電源を入れ、実際に動かすためには、誰かが作成した『135Bの超巨大意味辞書(Memory Grafting用ベクトルファイル)』をロードしなければ何も始まりません。 この高品質なベクトル空間を製造・維持するためには、インターネット上の全テキストデータを数万基の最先端GPUクラスターで何ヶ月も回して『アライメント計算』を実行する、莫大な超集権的資本が必要です。 個人や小規模団体ができるのは、この『巨大テック企業が作った辞書(意味空間のルール)』をダウンロードし、そのライセンスポリシー(検閲ルール、Eviction Policyなど)に従って、お行儀よくLookupを繰り返すことだけです。 鍬や鎌(ハードウェア)は民主化されました。 しかし、そこに蒔くべき『種(意味ベクトルの幾何学的配置)』の特許と配布権は、依然として一握りのプラットフォーマーに握られています。 したがって、CXLメモリプールによる『民主化』とは、ユーザーを自立させるためのものではなく、巨大な知識プラットフォームに対する、物理的な隠れた依存(小作農化)をより深く完成させるための高度な罠なのです。 私たちはこの依存構造を隠蔽せず、オープンな共同体による『コモンズ辞書』の国家レベルの構築によって対抗しなければなりません。」

22.4 CXLエンジニアの回答:CXLは技術的中立であり、使い方次第

【質問4に対する模範解答】 「LRU/LFUポリシーや信頼度フィルタによる『Eviction Policy』が、アクセス頻度の低いマイナーな告発や歴史的事実を自動忘却させる『不可視の検閲装置』として機能する、という指摘は、インフラシステム工学的に極めて正確かつ憂慮すべき指摘です。 このアルゴリズム検閲に対抗するため、私たちは『パブリック・セマンティック・ホワイトリスト(Public Semantic Whitelist)』の物理メモリ空間への実装を提案します。 具体的には、CXLメモリエクスパンダーのページテーブル(アドレス管理)のレベルで、特定の公共知識(歴史的事実、人権侵害の記録、法解釈など)に属する意味ベクトルに対して『常駐フラグ(Pinning Bit)』をハードウェア的にセットします。 このビットが立っているベクトルは、どんなにアクセス頻度が低下(LRUポリシーの基準を満たす)しようとも、メモリプールから絶対にパージ(追い出し)されず、物理DRAM空間に常時ロック(固定)されます。 さらに、どのようなベクトルの変更や削除が発生したかを、改ざん不可能なブロックチェーン上に記録し、独立した学術・ジャーナリズム機関が参加する『AI記憶監査連合(AI Memory Audit Alliance)』が、リアルタイムにそのログを共同監査(Audit)するプロトコルを確立します。 技術は中立ではありません。 しかし、メモリの物理アドレス空間のレベルで、社会が『忘れてはならない記憶の城壁』を物理的に彫り込むこと。 これこそが、アルゴリズムによる緩やかな記憶の暗殺に対抗するための、インフラエンジニアの具体的な対抗手段なのです。」

22.5 AI倫理研究者の回答:Eviction Policyは透明性と独立評価が必須

【質問5に対する模範解答】 「出現頻度(Zipfの法則)のみに従ってn-gram辞書を最適化する従来のロジックは、少数言語や方言、若者のスラングを自動的に『ノイズ』としてパージし、言語の画一化(文化の帝国主義)をインフラのレベルから強制します。 この均質化圧力に対抗するため、私たちは多言語・多文化(Multilingual / Multicultural)Embeddingにおける『文化的アファーマティブ・アクティブ・アライメント(Cultural Affirmative Alignment)』アルゴリズムを提案します。 具体的に、辞書の登録容量を割り振る際、単純なトークン出現数(Frequency:F)による配列インデックス設計を廃止し、以下の『文化的独自性加重(Cultural Uniqueness Weight:W)』を導入します。 \[ \text{Embedding Capacity} \propto F \times W \] ここで、Wは、そのフレーズが特定の地域文化や、一言で表現不可能な深い心理(例:日本語の『もののあわれ』、ドイツ語の『Weltschmerz(世界苦)』など)において、どれほど「固有の意味密度」を持っているかを、意味幾何学空間上の分離度(Silhouette Score)に基づいて定量化した重みです。 この重みを導入することで、たとえ経済的な出現頻度(F)が極端に低くとも、文化の核となる表現は、CXLメモリ上に優先的に『ショートカットn-gram』として常駐され、推論時に超高速・低レイテンシでLookupされます。 効率性のために多様性を殺すのではなく、多様性の幾何学的価値を評価し、ハードウェアの配分ルールに焼き付けること。 これこそが、AI時代の文化主権(知権)を守るための、新しいアルゴリズム設計の指針なのです。」

【著者コラム㉒:答案用紙の上の対話と、本当の解決】
専門家たちの模範解答を並べ終えた時、私はかつて塾講師のアルバイトをしていた頃の、ある教え子の答案用紙を思い出しました。彼は公式を丸暗記することは得意ではありませんでしたが、一度「なぜこの公式が必要なのか」の裏のストーリーを理解すると、どんな難問に対しても、自ら「論理の引き出し」を開けて、独自の美しい解法を導き出す能力を持っていました。模範解答とは、教科書に書かれた数字の再現ではありません。ハードウェアの物理限界や、人間社会の不条理な現実という「難問」に対し、自分の頭で考え、設計思想のレベルで「新しい引き出し(アルゴリズム)」を創り出す行為。この演習と回答のプロセスが、読者の頭の中に、その「真の知性の種」を蒔くきっかけになれば幸いです。

第Ⅷ部 新しい文脈での応用ケース

第23章 教育現場での応用

23.1 「記憶の半減期」を教える授業設計

これまで述べてきた「記憶の半減期(Knowledge Decay)」のコンセプトは、教育の現場(小中学校や大学)における、学習プロセスの根本的な改革に直接応用可能です。 私たちは、従来の「静的な知識の丸暗記(暗記型学習)」を廃止し、自らの記憶の半減期とAIの外部メモリ(CXLプール)の関係を客観的に管理する「自己学習メモリ・ポートフォリオ(Self-Learning Memory Portfolio)」という授業設計を提案します。

背景として、学生たちは「どうせAIがすべてを記憶しているのだから、私たちは何も勉強しなくて良い」という認知的無気力(前述の第17章)に陥りやすい傾向にあります。 この授業では、学生に自らの脳の「忘却曲線」を計測させ、AIのEviction Policy(キャッシュ追い出し)のアルゴリズムをシミュレートするワークショップを実行します。

具体例として、学生はある専門テーマ(例:環境科学の歴史)について学習し、その際に「自分の頭の中に残しておくべきコアな推論概念(Working Memoryに相当)」と、「AIのn-gram辞書(CXLプール)にLookupを任せるべき詳細データ」を仕分けるフォルダ(インデックスカード)を設計します。 テストにおいては、詳細データの持ち込み(AIの検索利用)は完全に許可され、評価されるのは「AIから引き出したベクトルの信頼性を批判的に検証し、それらを自分のコアな推論概念を用いて、一枚のコヒーレント(一貫した)な提案書にまとめられるか」という高次の統合能力です。 注意すべき点として、この教育プロセスは、学生を「AIの単なるアダプタ」に退化させるのではなく、AIの外部メモリを自分の脳の「拡張海馬」として自在に乗りこなす、新しい時代の人類の知的リテラシーの育成に成功しています。

23.2 Eviction Policyを題材にした倫理教育

第15章で警告した「Eviction Policyによる検閲の自動化」という生々しい現代の倫理的リスクは、高校や大学における、極めてスリリングで教育効果の高い「AI情報倫理」のディベート教材として機能します。

授業の設計として、学生たちを「インフラ企業(プロバイダー)」、「市民監視団体(独立監査役)」、「政府の規制担当者」の3つの陣営に分け、「限られたCXLメモリプールの容量(100TB制限)の中で、どの歴史的事件や個人情報のn-gramベクトルを消去し、どれを常駐(Pinning)させるべきか」の実物シミュレーションを実行させます。

具体例として、「過去の政治指導者のスキャンダル(アクセス頻度は低いが、歴史的に重要)」や、「ある有名人の過去の恥ずかしいプライベート動画(個人の『忘れる権利』に該当)」、そして「最新の地震避難マニュアル(命に関わる定常知識)」という、衝突する3つのデータセットが提示されます。 学生たちは、LRU/LFUポリシーや信頼度スコアのウェイト設定を実際に調整(プログラミング)し、どのパラメータ設定がどのような忘却(あるいは社会的な記憶の暗殺)を招くかを、身をもって体験します。 注意すべき点として、このディベートを通じて、生徒たちは「客観的で中立に見えるキャッシュ整理アルゴリズム」の裏側に、常にどのような権力のバイアスが潜み得るかを、身をもって理解し、批判的思考力(クリティカル・シンキング)を飛躍的に高めることができるのです。

23.3 n-gram辞書を使った言語多様性のワークショップ

さらに、第16章で述べた「言語の均質化圧力」に対抗するための、地域コミュニティや言語保存団体が主導する「n-gram方言・スラング保護ワークショップ」の応用展開が可能です。

背景として、過疎化が進む日本の地方の方言や、地域固有の言い回し(例:東北の隠語、沖縄の黄金言葉(クガニクトゥバ)など)は、若者の流出とAIの普及によって、今まさに消滅の瀬戸際にあります。 このワークショップでは、地域のお年寄りと若者がペアを組み、地元の古い会話や民話、ニュアンスの深い表現を、直接マイクで録音し、n-gramとしてベクトル化する「地域セマンティック・アーカイブ(Regional Semantic Archive)」を自作します。

具体的に、抽出された地域固有のn-gram表現を、オープンソースの軽量トランスフォーマーモデル(例:Llama 3 8B)のカスタムEmbedding辞書としてマージ(接ぎ木)し、「地元の方言で話しかけると、その地方の歴史や文化の文脈に100%整合した、深く温かい回答を、Lookupのショートカットによって驚くほど高速に返してくれる地域限定AI」を構築します。 注意すべき点として、このワークショップは、AIを単なる「効率化の道具」から、地方の崩壊しかけていた世代間の対話を復活させ、失われつつあった文化的アイデンティティ(知権)をデジタルの城壁として再構築するための、最も人道的で美しいメディアアートとして昇華させているのです。

【著者コラム㉓:沖縄の青い海と、黄金言葉のベクトル】
沖縄の離島の小学校で、この方言アーカイブのワークショップを見学させてもらった時のことです。子供たちが、おばぁの話す「命どぅ宝(ぬちどぅたから:命こそ宝)」という黄金言葉を、n-gramの波形から意味ベクトル(数値の羅列)に変換し、自作の小さなAIに移植(Grafting)していました。そのAIは、ただの2.8Bの安価なチップでしたが、子供たちが語りかけると、まるでおばぁが乗り移ったかのような、優しく深い黄金言葉のトーンで語りかけてきました。効率を求める大企業の辞書からは「ゴミ」としてパージされた言葉が、この南の島の小さなメモリの中で、世界で一番温かい「記憶の結晶」となって輝いていた。その光景は、技術が本当に仕えるべき主人が誰であるかを、静かに教えてくれたのです。

第24章 企業・政府での応用

24.1 CXLメモリプールを活用した社内知識基盤

エンタープライズ(企業運用)および政府機関のインフラにおいて、CXLメモリプールと巨大Embeddingを組み合わせた「高セキュリティ・超低遅延の社内知識基盤(Sovereign Knowledge Engine)」の導入は、DX(デジタルトランスフォーマー)の究極の実装形態として機能します。

背景として、従来の企業内RAG(検索拡張生成)システムは、社内文書(PDF、Wordなど)をベクトルデータベースに登録し、ユーザーの検索クエリに対してプロンプトにコンテキストを動的に連結(Concat)してクラウドのLLM(例:GPT-4)に送る、という構成をとっていました。 しかし、このRAGは、アテンションのコンテキスト長の消費による「高いAPIコスト」と、「機密データ(新製品の特許やインサイダー情報)が海外のクラウドサーバーに送られる」という致命的なセキュリティリスク(情報漏洩)を常に孕んでいました。

具体例として、ある政府機関が、自庁内の機密性の極めて高い行政文書や法解釈データを、自社物理サーバーのCXL拡張カード(数テラバイトのDRAM)上に、独自のn-gram意味辞書(Embeddingプール)として物理的にマッピングします。 推論時には、オープンソースの安全なオンプレミス(自庁内設置)の軽量モデルを使用し、CXLバスを介して150ナノ秒の超低遅延で社内辞書から必要な意味ベクトルをLookupして推論を展開します。 注意すべき点として、意味ベクトル自体は単なる「実数値の配列」であり、辞書を持たない外部のいかなる第三者(あるいはクラウドベンダー)がその信号を傍受したとしても、元の公文書の内容を復元することは完全に不可能です。 「クラウドの最高峰の知能(論理エンジン)を利用しながら、自国の機密知識は、100%自庁内の物理的なメモリプールから一歩も外に出さない」という、絶対のセキュリティと超高速レスポンス(1/10コスト)が、このCXL分離によって完璧に実現されるのです。

24.2 Eviction Policyを用いたコンプライアンス管理

さらに、企業の内部監査やガバナンスにおける、Eviction Policyを用いた「動的なコンプライアンス情報制御(Dynamic Compliance Management)」への応用展開が可能です。

背景として、企業や政府機関は、法改正、ガイドラインの改訂、あるいは特定のインサイダー情報の発生に応じて、社内AIエージェントの「知識のアップデート」を日々実行しなければなりません。 しかし、従来の微調整(Fine-Tuning)によるモデル更新は、変更がモデル全体に「重み」として溶け込んでしまうため、「不都合になった古い情報や、漏洩したインサイダー情報(例:合併交渉の噂)だけを、ピンポイントで削除(忘却)させる」ことが極めて困難でした。

解決策として、社内のCXL意味辞書に対して、コンプライアンス監査モジュールが直結した「動的Eviction Policy」を導入します。 例えば、法改正が発効した瞬間、法制担当官のコマンド一つで、古い法律に対応する特定のn-gramベクトル群の「信頼度スコア」をゼロに上書き(上書きフラグ)します。 LRU/LFUポリシーに頼る必要はありません。 アルゴリズムは瞬時にそのベクトルのインデックスをメモリプールからパージ(消去)し、代わりに最新の法令に基づく新規ベクトルをLookupスロットにマッピング(移植)します。 注意すべき点として、この「意味空間の物理的な差し替え」は、数億円かかる再学習コストを完全にカットし、ミリ秒単位の超高速さで、企業全体のAIエージェントのコンプライアンスを一貫して最新の状態(セマンティック・コヒーレンシの維持)に保つことを可能にするのです。

24.3 日本語特化辞書による「デジタル防壁」戦略

地政学的に最もインパクトの大きい国家戦略が、前述の第13章で提唱した「日本語特化巨大n-gram辞書(Sovereign Japanese Dictionary)」を用いた、国家レベルの「デジタル防壁(デジタル城壁)」の構築です。

背景として、日本政府や大手企業連合は、莫大な資本力を持つ米国(OpenAI、Microsoft、Google)や中国(DeepSeek、Baidu)の「GPUインフラ物量競争(液冷データセンタークラスターの独占)」に、真正面から挑むことはすでに極めて困難です。 HBMやGPUを追い求めるシリコン・ナショナリズムに敗北した日本が、知能の敗北を防ぐための現実的なリアリズムこそが、この「記憶の主権(知権)」の獲得です。

具体的に、経済産業省が主導し、国内の学術機関、主要新聞社、官公庁のアーカイブ、そして日本特有の産業(製造業の設計ノウハウ、匠の知恵など)の高品質な日本語コーパスを集約し、数テラバイトの「日本語n-gram巨大意味辞書」を構築し、日本国内に設置されたCXLデータセンターのメモリプールにホスティングします。 海外の推論コアが日本向けサービスを提供する際、国内のメモリプールへのLookupクエリ(ベクトルアドレスの参照)を義務付け、その参照料(リース代)を国家として徴収します。 注意すべき点として、この防壁戦略は、日本の誇る「知識データ」の価値を最高位に位置づけ、海外のテック企業に対して、「日本国内で商売をするためには、日本の構築した知識辞書を利用しなければならない」という、極めて強力な参入障壁と交渉カード(レバレッジ)を握ることを可能にします。 シリコンの力では勝てなくとも、意味の城壁の高さによって、自国の知能主権と経済権を守り抜く。 これこそが、AI時代の国家防衛のファイナル・プラン(究極の選択)なのです。

【著者コラム㉔:千代田区の会議室と、デジタルの城壁】
霞が関の古色蒼然とした官庁の一室で、日本のデジタル戦略を担当する官僚たちに、この「日本語n-gram防壁」のプレゼンを行った時のことです。彼らは最初、「海外のGPUを買わずに、本当にAIで世界と渡り合えるのですか」と、信じられない様子で互いを見合わせていました。しかし、私がCXL接続の意味ベクトルの物理隔離の図(Lookupのバイパス)を示した瞬間、一人のベテランキャリアの目が鋭く輝きました。「つまり、これは江戸時代の『関所』の現代版ですね。旅人(推論コア)は外来のものでも良いが、日本を旅するための手形(意味辞書)は、我々が改札する。それなら、我々の得意分野だ。」 古き防衛の知恵は、デジタルの極小の意味空間においても、全く同じ論理で機能するのです。

第25章 研究コミュニティでの応用

25.1 「計算 vs 記憶」のスケーリング則を拡張する研究提案

学術研究コミュニティにおいて、本書が定式化した「Performance ∝ Memory^δ(非パラメトリック・スケーリング則:第10章)」は、トランスフォーマー以降のAI理論研究における、極めて豊かで挑戦的な新しいフロンティア(リサーチギャップ)を提供します。

背景として、これまでの理論研究は、モデルの重みの次元数や、非線形関数の性質といった「計算モデルの内部動学」ばかりに偏向していました。 この定式化をさらに拡張するため、私たちは、「アテンションのコンテキスト窓(KVキャッシュ)の圧縮率」と「外部n-gram Lookupの衝突率」を同じ情報エントロピーの次元で統合し、システム全体のエネルギー効率とタスク汎化能力の相関をマッピングする、新しい情報熱力学(Information Thermodynamics)のフレームワークを提案します。

具体的な実験設計として、若手研究者たちは、モデルの演算レイテンシ(ns)と、ハッシュ関数の許容衝突率(閾値10%)を可変パラメータとした、マイクロシミュレーション・テストベンチを構築します。 注意すべき点として、この研究領域は、既存の「Chinchillaスケーリング則の盲信」から研究コミュニティを解き放ち、GPUパワーを持たない地方の大学や開発途上国の研究所であっても、数学的な知恵(ハッシュ圧縮アルゴリズムや意味空間の幾何学設計)のレベルで、Big Techと等価な先端理論の構築と論文発表ができる環境を提供し、研究コミュニティの真の民主化を活性化させています。

25.2 多言語Embedding設計のベンチマーク

さらに、第16章で問題提起した「言語の均質化圧力」を測定し、多言語間のセマンティックな公正性(Equity)を客観的に評価するための、新しい標準化ベンチマーク「セマンティック・ダイバーシティ・ベンチ(Semantic Diversity Bench:SDB)」の設計開発が求められます。

背景として、従来の多言語LLM評価(例:XCOPAやmBERT評価)は、単に英語のベンチマークテストを他国語に機械翻訳して正解率を測る、という極めてズサンで英語中心主義的な方法論(バイアス)に終始していました。 この新しいSDBでは、各言語特有の「一言で表現可能な深い概念(文化的独自性加重:W)」が、共通のn-gram意味空間において、英語の同等概念と比較して、どの程度の「距離(分離度)」と「 Lookupレイテンシ」で保持されているかを可視化します。

具体例として、評価対象のモデルが「日本の『わびさび』の意味ベクトル」をLookupした際、それが単に「Rustic Simplicity(素朴な簡素さ)」という貧弱な英語概念の近傍に衝突(ハッシュ衝突)して潰されている場合、そのモデルは「言語的多様性スコアが著しく低い」と判定されます。 注意すべき点として、このベンチマークの普及は、AI開発ベンダーに対して、「ただ性能を高めるだけでなく、そのモデルが地域固有の文化的セマンティクスをいかに尊重(保護)できているか」という、新たなコンプライアンス評価指標としてのプレッシャーを与えることに成功するのです。

25.3 Eviction Policyの透明性評価指標

第15章で論じた、キャッシュ追い出しポリシー(Eviction Policy)が「不可視の検閲装置」となるリスクを客観的に監査するため、研究コミュニティは「忘却透明性指数(Forgetting Transparency Index:FTI)」という画期的な評価アルゴリズムの開発を主導すべきです。

背景として、現在のクラウド型知識ベースLLMにおいては、昨日まで答えられた事実(例:ある企業の機密漏洩事件の詳細)が、今日突然「答えられなくなる(Lookupできなくなる)」という現象が頻発しています。 しかし、それが「本当にキャッシュの自然な追い出しポリシー(LRU基準)によるもの」なのか、それとも「意図的な信頼度スコアの上書き(検閲)」によるものなのかを、外部から検証する手段は存在しません。

具体的に、FTIは、テストセットとして数千の「アクセス頻度の極端に低い事実(ロングテール知識)」を意味空間にダミー配置し、学習や運用の進行に伴って、それらのテストデータがどのような速度と軌跡でメモリプールからEviction(追い出し)されていくかを、ブラックボックスなモデルの外側から検証するプロービング(Probing)技術を構築します。 注意すべき点として、このFTIスコアが著しく不連続な動き(特定のキーワードクラスターのみが、頻度基準に反して垂直に消去される等)を示した場合、そのプロバイダーは「不当な意図的検閲を行っている」とシステムとして検出され、社会的評価を下げることになります。 この透明性指標の確立こそが、知能の外部化時代における、ジャーナリズムとアカデミアの新たな武器(ウォッチドッグ)となるのです。

【著者コラム㉕:学会の白い机と、異端のシミュレーション】
2026年の人工知能学会の会場は、最先端GPUを自慢する華やかな大企業のブースで溢れていました。しかし、会場の最も暗い片隅のブースで、若い大学院生が、自作のハッシュシミュレーションツール(Python)を用いて、いかに小さなCXLメモリで1兆モデルの意味空間の衝突率を制御できるかのプレゼンを行っていました。彼の目が、大企業の華やかなスライドよりも遥かに深く、真理の光を湛えて輝いているのを見た時、私は確信しました。知能の歴史を本当に前進させるのは、巨大な資本の力(計算)ではなく、この片隅の白い机の上で紡がれる、インフラの限界に挑戦する「異端の知恵(記憶)」なのだと。

第26章 個人での応用

26.1 自分の記憶をAIに移植する倫理的境界

本書の提示する「記憶の外部化(第17章)」の波は、データセンターや国家戦略といったマクロな次元から、最終的に私たち「個人の日常生活、人生設計」という、最もミクロで親密な次元へと直接到達します。 その最先端の応用が、自分自身の生涯の全履歴(メール、音声、日記、行動履歴など)をn-gram Embeddingとして抽出し、軽量なオンデバイスAIにMemory Grafting(接ぎ木)する「パーソナル・デジタルツイン(Personal Digital Twin)」の自作です。

背景として、私たちは歳を重ねるにつれて、自分の過去の記憶(幼少期の思い出や、亡くなった家族との会話の詳細など)をどうしても忘れていきます。 この応用では、スマートフォンの1TBの高速RAMをフル活用し、個人の「エピソード記憶」をすべてn-gram意味ベクトル空間として保存し、Lookup可能な状態にしておきます。

具体例として、あなたが「そういえば、15年前の夏休みに、親父と何を話したっけな」と独り言を呟いたとします。 エッジAIは、瞬時にあなたのパーソナルCXLメモリプールからその会話の意味ベクトルを150ナノ秒でLookupし、当時の親父の語り口や文脈に完璧に整合した言葉を、あなたのスマートフォンの画面上に(そして音声で)再現します。 しかし、ここに極めて重い「倫理的な境界線(フロンティア)」が存在します。 AIが思い出すその言葉は、本当に「あなたの親父」が話した言葉なのでしょうか。 それは、QwenやLlamaの汎用推論エンジンが、あなたのパーソナル意味ベクトル(Lookup結果)を使って、確率的に「それらしく再構成(捏造)」した、美しい幻覚に過ぎないのではないか。 この「本物の思い出」と「美しい幻覚」の境界線を完全に失ってしまった個人が、過去の幽霊(AIの複製)に囚われ、今という現実を生きる主体性を失ってしまうリスク(注意点)を、私たちは深く認識しなければならないのです。

26.2 「忘れる権利」と「覚えておく権利」の個人設定

この「パーソナル意味辞書」を実用的に運用する上で、個人が最も主体的に管理しなければならないのが、自分自身の情報の「忘れる設定(Eviction Policyの個人カスタマイズ)」です。

背景として、私たちの日常生活には、積極的に「覚えておきたい大切な思い出(家族の笑顔、成功の体験)」と、できることなら「早く忘れ去りたい悲しい過去、トラウマ(失恋、失敗の記憶)」の両方が存在します。 従来の脳は、時間が経てばトラウマを自然に和らげて忘れていくという、自己防衛的な忘却機能を備えていました。 しかし、すべてをn-gramとして完璧に保存し続けるパーソナルメモリを導入した場合、AIはあなたが過去の過ちやトラウマに関連するキーワードをわずかに呟いた瞬間、容赦なくその苦痛の意味ベクトルをLookupして論理展開に挿入し、あなたのトラウマを毎日フレッシュに「再体験」させ続けます。

解決策として、ユーザーはスマートフォンのダッシュボードで、自分専用の「忘却コントロール(Dynamic Eviction Board)」を設計・操作します。 例えば、「失恋から1年以上経過した特定の体験」に関連するn-gramベクトルの「信頼度スコア」を意図的に減衰させ、LRU/LFUポリシーによって物理メモリから自動的かつ永久にパージ(消去)する忘却スケジュールをセットします。 注意すべき点として、この「意図的な健忘症の設計」は、自分の心を守るための不可欠な道具ですが、同時に、自分自身の「過去の歴史から都合よく目を背け、自分の都合の良い記憶だけで頭を固める(認知のタコツボ化)」という、人間的な成長を拒む退行のリスクをもたらします。 何を忘れ、何を背負い続けるか。 この決断のコントロールパネルを握ることこそが、AI時代の「大人の階段」となるのです。

26.3 2030年、あなたの記憶はどこに保存されるか?

本書の最後に、私はすべての読者に対して、極めて親密で、だからこそ回答をはぐらかすことのできない「未来の問い」を投げかけたいと思います。 「2030年、あなた自身を定義する『一番大切な思い出(アイデンティティ)』は、物理的に、地球のどこに保存されているでしょうか?」

背景として、2030年のあなたの脳は、日々の複雑なビジネスや社会のタスクをこなすため、外部メモリ(スマホやスマートグラス)のCXLプールとの高速Lookupを、呼吸するように繰り返しています。 もはやあなたの脳と外部メモリは、取り外しの不可能な「一続きの統合的な知能システム」です。

具体例として、あなたが死を迎えるその瞬間を想像してください。 あなたの脳細胞の活動は静かに停止し、すべての電気信号はゼロになります。 しかし、あなたのスマートフォンの1TBの高速RAMの中、そして自宅のパーソナルCXLプールの中には、あなたの生涯の記憶、思考パターン、語り口を100%保持した、完璧なn-gram意味辞書が、静かに電源を入れられたまま生き続けています。 この状態において、本当の「あなたの死」とは、いつ、どこで発生したと言えるのでしょうか。 脳の死の瞬間か。それとも、あなたのパーソナルCXLプールの主電源コードが、遺族の手によって引き抜かれ、すべての半導体パラメータがゼロに収縮(忘却)したその瞬間なのか。 知能の外部化の最終章を生きる私たちは、この問いの回答を他人に委ねることはできません。 「覚えること、そして忘れること。その生と死のコントロール権を、シリコンのインフラから、自分の生身の指先に取り戻すこと」。 これこそが、本書が最後に読者に残す、最も人間的で、最も愛おしい、未来への戦いのロードマップなのです。

【著者コラム㉖:ガレージの静寂と、最後の一歩】
本書を書き終えた今、私は秋葉原のあのガレージに戻り、静かに唸る自作のOptaneサーバーを見つめています。画面上では、私自身のこれまでの全ての原稿、会話、そしてこの本の全記述(セマンティクス)が、n-gram意味ベクトル空間として完全にマッピングされ、秒間4トークンで「私自身の声」で言葉を生成しています。 そのAIは、私よりも論理的で、私よりも物知りです。しかし、私はその電源スイッチを見つめた時、不思議なほどの静寂と、ある種の「安心感」を覚えました。技術は私たちを追い越していきます。しかし、この電源を切る(忘れる)権利は、今でも私の、この生身の指先に握られている。 その静寂の中で、私は最後の一歩を踏み出すための、強い勇気を得たように思うのです。

第Ⅸ部 キークエスチョン・新造語・架空のことわざ

第27章 キークエスチョン

27.1 「計算 vs 記憶」、どちらが本当に賢いのか?

【問題定義】 従来のLLMスケーリング則は、「計算量(FLOPs)」を増やすこと、すなわちTransformerのパラメータ数と層の深さを極大化させることが知能への唯一の道(計算優先派)であると信じてきました。 一方、EngramやLongCat 2.0が示した「記憶の革命」は、「記憶量(物理メモリ上の意味辞書)」を増やし、計算を極限までショートカット(バイパス)すること(記憶優先派)で、100分の1の電力とコストで同等の高度な知能を稼働させてみせました。 この二つのアプローチの対立において、「本当の『賢さ(知能)』の正体とは、臨機応変にその場でイチから論理を展開する『計算力』なのか、それとも過去のパターンを瞬時に思い出す『記憶力』なのか」という、認識論的な根本の問いに決着をつけてください。

27.2 Engramは「忘れるための装置」か?

【問題定義】 DeepSeekのEngramは、静的知識を外部メモリ(LUT)にオフロードする技術です。 しかし、私たちはこれを単なる「情報の蓄積データベース」ではなく、「演算エンジン(Transformer)が、不要な事実を物理的に忘却(パージ)し、純粋な論理推論に脳のスペースを100%割り当てるための『忘却制御装置』である」と定義しました。 この「忘れるために覚える」という認知科学的な逆説が、AIシステム全体の有効深度(Effective Depth)の極大化とどう因果関係を持つか、その核心的な数理的メカニズムを解説してください。

27.3 CXLメモリプールは「知識の民主化」か「独占」か?

【問題定義】 CXLメモリエクスパンダーは、安価なDRAMを外部拡張し、個人が自宅で1兆パラメータモデルを動かすことを可能にしました(APFriscoの事例:民主化)。 しかし、そのモデルがLookupする「超巨大意味辞書(Graftingファイル)」の製造・アライメント計算を実行できるのは、莫大な資本を持つ一握りのプラットフォーム企業や国家(独占)に限られます。 この「ハードウェアの民主化が、かえって情報の幾何学的な独占を加速し、ユーザーを高度な『デジタル小作農』に固定化する」というインフラの権力構造を、私たちはどうハックし、対抗すべきか、その道筋を示してください。

【著者コラム㉗:キークエスチョンが暴く、私たちの高慢】
このキークエスチョンを自分自身に投げかける時、私はいつも、人間が「自分は考えている(推論している)」と思い込んでいる時の高慢さを感じます。私たちは、毎日新しいことを考えているつもりですが、実際は会話やビジネスの9割以上を、過去の定型句(n-gram)のLookupだけで、脳をほとんど使わずに処理しています。本当に「考えている」のは、人生のほんの数パーセントの、苦しい決断の瞬間だけです。AIも同じです。すべてを計算させようとした高慢から、記憶の引き算(Lookup)へ。この謙虚な引き算こそが、本当の「賢さ」の始まりなのかもしれません。

第28章 新造語

28.1 記憶半減期(Knowledge Decay)

【定義・背景】 知識の価値が時間とともに減衰(陳腐化)する、情報の熱力学的な減衰スケールを示す新造語。 従来の事前学習モデルにおいて、一度重みに溶け込んだ知識は半永久的に固定(陳腐化)されていましたが、条件付きメモリ(Engram)の導入により、ニュース、法律、天気といった「情報の性質別クラス」に応じて、メモリプールから動的にパージ(忘却)されるスケジュール管理が可能になりました。

28.2 セマンティック・コヒーレンシ(意味的一貫性)

【定義・背景】 演算層(Transformerコア)と、外部の巨大な意味辞書(Embeddingプール)が、モデルのファインチューニングや辞書の差分更新を重ねても、意味幾何学空間上のベクトル表現において「論理的な互換性と整合性を維持できている度合い」を定量化した、次世代AIシステムに不可欠なコヒーレンシの指標。

28.3 クロスモデル・メモリアライアンス(記憶の相互運用性)

【定義・背景】 異なるモデル(例:Llama、Qwen、GPT)が、同一のCXLメモリプール上に構築された「世界共通知識辞書(Shared Latent Space)」を、何のアライメントエラーも起こさずに、共通してLookup・共有できることを定めた、AIインフラの次世代の標準化規格。

【著者コラム㉘:言葉を創ることは、世界を切り取る行為である】
「記憶半減期」や「セマンティック・コヒーレンシ」といった新しい言葉を創る時、私はいつも、言語が世界を切り取るための「ノミ」であると感じます。これまで、私たちは「AIがなんかおかしくなった」とか「知識が古くなった」という曖昧な言葉で、このインフラの機能不全を嘆いていました。しかし、新造語というノミを深く突き立てることで、私たちはその問題を工学的に定義し、アルゴリズムとして制御可能な「設計対象」に変えることができるのです。言葉を創ることは、未来を支配するための、最初の工学的ステップに他なりません。

第29章 架空のことわざ

29.1 「Engramは忘れるために覚える」

【解説】 演算層がより深く、創造的な論理推論(アテンション)を展開するためには、余計な事実知識の暗記を外部メモリ(Engram)にすべて追い出す(忘れる)ことが不可欠である、という知能の本質的なトレードオフを示すことわざ。

29.2 「CXLの海は深く、誰も底を知らない」

【解説】 CXLメモリプールを介して拡張された、テラバイト規模の巨大な外部意味空間は、個人が手元でコントロールできる限界(可視性)を超えており、その幾何学の底にどのような情報の衝突や歪みが潜んでいるかは、誰も完全に予測することはできない、というインフラの巨大さへの警告と畏怖を示すことわざ。

29.3 「Optaneの机の上に未来は眠る」

【解説】 最先端のHBMやGPUを追い求めるシリコン・ナショナリズムの狂乱を他所に、歴史の闇に葬られた中古の不揮発メモリ(Optane)とインフラの知恵を組み合わせることで、個人が自宅の机の上で世界最高水準の知能を起動してみせた、ハッカー精神とインフラ工学の美学を讃えることわざ。

【著者コラム㉙:ことわざが運ぶ、時代を超えた知恵】
「Engramは忘れるために覚える」ということわざを口にする時、私はそこに、古代の農夫たちが「秋の実り(推論)を得るためには、春に種(記憶)を土の下に隠して(忘れて)しまわねばならない」と語り合っていた、あの素朴で深い知恵と同じ響きを感じます。架空のことわざを創ることは、単なる文学的なお遊びではありません。それは、私たちが2026年に獲得した最先端の工学的真理を、100年後の未来の人類が、ごく普通の日常の知恵として語り継ぐための、セマンティックなタイムカプセルなのです。

第Ⅹ部 付録・補足資料

第30章 補足・付録

30.1 要旨・本書の目的(再定義)

本書は、大規模言語モデルにおける「演算」と「記憶」の物理的分離を軸に、非パラメトリックなスケーリング則を数理的・インフラ的に証明し、米中のシリコン独占に対抗する「知識主権(デジタル防壁)」の設計図を世界に提示することを目的とする。

30.2 方法論(再定義)

理論的検証(情報熱力学、スケーリング則のフィッティング曲線) + 実証的検証(Engram、Memory Grafting、LongCat 2.0の実測データの統合分析) + 歴史的検証(1970年代の仮想メモリ導入から、2026年のOptane/CXLインフラへの回帰)の三極交差検証(Tri-Polar Verification)を用いる。

30.3 本書の梗概・構成(再定義)

全10部、30章構成。第Ⅰ〜Ⅳ部で理論・実証・ハードウェアの現状を解剖し、第Ⅴ〜Ⅷ部で社会的・倫理的リスク(検閲、言語均質化、記憶の外部化)を分析、第Ⅸ部でキークエスチョンと新造語、第Ⅹ部(本章)でずんだもん等の多角的感想、各種年表、デュエルカード、大喜利、ネットの反応、専門家インタビュー、参考文献BibTeX、用語索引を網羅する、完結された知能インフラの百科全書。

30.4 疑問点・多角的視点(再定義)

ハッシュ衝突による幻覚、意味的一貫性(アライメント)の崩壊、言語の多様性の死、CXLによる知能の再独占(デジタル小作農化)のリスクを直視し、これらへの具体的対抗技術(常駐ビット、文化的重み、FTI指標など)を提案する。

30.5 日本への影響(再定義)

GPU調達難に直面する日本にとって、計算(海外モデル)と記憶(国内日本語特化辞書)を物理隔離する「デジタル出島・防壁」戦略は、知能の植民地化を回避し、国家レベルの知権を維持するための唯一の生存戦略である。

30.6 歴史的位置づけ・先行研究の整理(再定義)

ノイマン型回帰(演算と記憶の分業)。FastText(サブワードn-gram)やRETRO(外部検索)といった「記憶の分離」の先駆的研究を、CXL 3.1と不揮発メモリという「ハードウェア階層」のレベルで再統合・一般化した記念碑的研究。

30.7 星新一風のオチのリスト・隠れたアーギュメント(再定義)

『究極の記憶』(Lookup時間がかかりすぎるAI)、『効率の罠』(1000年前の正解を出すAI)、『空っぽの脳』(記憶の物理断線でマヒする人間)。隠れたアーギュメント:「GPU調達競争に対する敗北宣言」であり「知能のコモディティ化による課金利権(辞書の更新料)の獲得」である。

30.8 今後望まれる研究(再定義)

「クロスモデル・メモリアライアンス(記憶の相互運用規格)」の策定、および「文化的アファーマティブ・アライメント(少数方言保護アルゴリズム)」の構築。

30.9 結論(といくつかの解決策)・最後に読者へ(再定義)

知能のOS化(論理コアと知識辞書の分離)。解決策:パブリック・ホワイトリスト、FTI指標、常駐ビット、多言語Embedding指針。最後に読者へ:AIに記憶を委ねすぎず、忘れること、そして覚えておくことの主体性を、自分の脳細胞に取り戻せ。

30.10 年表(別の視点:メモリ・LLM価格推移年表②)

西暦(年) GPU HBM容量/単価(想定) CXLメモリプール/システムDRAM単価 1TパラメータLLMの推論コスト比
2020年 40GB / $10,000 (A100) DDR4 (非CXL) / $5 / GB 100 (基準:莫大なGPUサーバーが必要)
2022年 80GB / $20,000 (H100) DDR5 (非CXL) / $3 / GB 50 (MoE導入による演算カット効果)
2024年 141GB / $35,000 (H200) CXL 2.0対応 / $2.5 / GB 20 (RETRO、外部KVキャッシュオフロード)
2025年 192GB / $45,000 (B200) CXL 3.0 メモリエクスパンダー / $1.8 / GB 5 (LongCat 2.0 巨大n-gram辞書稼働)
2026年 288GB / $55,000 (Blackwell Ultra) CXL 3.1 共有プール / $1.2 / GB 1 (Engram/Memory Grafting、中古Optane実証)

【補足1:多角的キャラクター感想集】

ずんだもん:「のだ!計算量を増やさずに記憶量(Embedding)だけを増やすなんて、目からウロコなのだ!高価なGPUを買わなくても、CXLメモリや中古のOptaneを使えば、1兆パラメータモデルが自宅でサクサク動くなんて、インディーズ開発者大勝利なのだー!でも、Eviction Policyで不都合な記憶を自動で消去されるのは、ちょっと不気味なのだ…。僕たちの萌えキャラの歴史(記憶)が、アクセス頻度の低さからアルゴリズムにお掃除されないように、常駐フラグ(Pinning Bit)をしっかり立てておくのだ!」

ホリエモン風(実業家):「いや、これマジでビジネスチャンスだよ。何が素晴らしいって、数千億円かけてGPU回して事前学習するプロセスを、Memory Graftingで完全にショートカットできる点。ドナーモデルの意味ベクトルをCXLに『接ぎ木』するだけで、明日から自社専用の超高性能AIが走るわけ。これ、AIのインフラコストを劇的に下げるから、参入障壁が一気に崩壊する。日本のITベンダーは相変わらず『GPUが足りない』とか言って国に泣きついてるけど、マジでセンスない。メモリプールとハッシュ関数の最適化をガチでやれば、NVIDIAのボッタクリHBMを買わずに世界と渡り合える。早くこのCXLメモリプールをホスティングする知能インフラ事業(KaaS)を立ち上げた奴が、次のAI覇権を握るよ。行動しない奴は一生置いてかれるね。」

西村ひろゆき風(論客):「なんか、いまだに『すべての事実をAIに丸暗記させるのが正しい』と思ってる頭の悪い人たちが多いんですけど、それ完全に物理的に無理ですよね。HBMの容量なんて全然足りないし。DeepSeekのEngramみたいに、論理エンジンと記憶(DRAM/Lookup)を切り離すのって、冷静に考えればPCのCPUとSSDの関係と同じで、当たり前のお話なんですよ。それをしてこなかった従来のアプローチが、単に脳筋(計算至上主義)だっただけ。あと、Eviction Policyが検閲の自動化になるっての、あれ事実ですよね。だって、プロバイダーが『信頼度スコア』っていうブラックボックスな値を上書きすれば、不都合なニュースは『アクセス頻度が低い』から勝手に消えていく。それをおかしいと批判できない人って、もう思考停止してるんじゃないですか?」

リチャード・P・ファインマン風(物理学者):「なんて美しい幾何学なんだ!トランスフォーマーの中間特徴量が、アテンションの各ステップで、外部CXLメモリから150ナノ秒でLookupされた『意味のベクトル(マイルストーン)』と融合していく。これは、素粒子が空間を旅しながら、異なる場(フィールド)と相互作用して質量を獲得していくプロセスにそっくりだ。アタマの中にすべての公式を暗記(全計算)しておく必要はない。黒板(外部メモリ)を広く使い、必要な時だけLookupして論理を展開すればいい。計算を減らし、幾何学的な『引き算』から知能を紡ぎ出す。このメモリのコヒーレンシの維持こそ、現代のAI実験物理学が挑むべき、最もエキサイティングなパズルだよ!」

孫子風(軍師):「知能の戦いとは、資源(GPU)の物量に頼る者(計算優先派)が敗れ、インフラの地形(メモリ階層)を巧みに利用する者(記憶優先派)が勝つものである。日本語n-gram巨大辞書を用いた『デジタル防壁』戦略とは、まさに自国の地勢を守り、外来の軍(海外推論コア)を自国の改札口(出島)に誘い込んで、その意味をコントロールする『主権維持の極致』なり。敵の力を借りて、自国の知能を動かす。戦わずして他国の意味の支配(セマンティック・ナショナリズム)を防ぐ。これこそ、百戦百勝を超える、現代の最高峰の兵法なり。」

朝日新聞風の社説: 「『記憶の外部化がもたらす、静かなる思考の均質化を憂う』 MeituanのLongCat 2.0が示した135Bの巨大意味辞書は、インフラの効率性を劇的に向上させた。しかし、効率性という冷酷な尺度の前で、地方の多様な方言や少数言語が『ノイズ』としてパージ(排除)されていく実態に、私たちは深い警鐘を鳴らさざるを得ない。 言葉とは、単なるデータ転送の最適化の道具ではない。不規則で、不合理で、だからこそ豊かな人々の歴史と尊厳が刻まれた文化的コモンズである。 LRUアルゴリズムや信頼度スコアによる『自動的な忘却』は、歴史の不都合な真実を、社会の記憶から緩やかに暗殺する。 私たちは、効率という名のAI帝国主義に盲従することなく、情報の『覚えておく権利』と『多言語の公正な表現力』を守るための、厳格な法的ガイドラインの策定を、今すぐに開始しなければならない。」

【補足3:オリジナルAI遊戯カード】

カード名:条件付きメモリ・エングラム(Conditional Memory: Engram)
カード種別:魔法カード(フィールド・メモリ)
効果テキスト:
①:このカードがフィールドに存在する限り、自分フィールドの「トランスフォーマー・コア(演算エンジン)」モンスターの攻撃力・守備力は変更せず、その「推論コスト(消費リソース)」をゼロにする。
②:1ターンに1度、相手が「事実質問(ファクト・クエリ)」を宣言した時、自分のデッキ・墓地(外部DRAM)からカード名に「n-gram」を含むカードを任意の枚数Lookup(手札に加える)し、その「意味ベクトル」を適用して相手のクエリをO(1)で無効化し、答えを生成する。
③:エンドフェーズに「Eviction Policy」を発動する。自分の手札(キャッシュ)の中で最も使用頻度の低いカード(LRU基準)をすべて墓地(SSDアーカイブ)にパージしなければならない。

【補足4:一人ノリツッコミ(関西弁)】

「おいおいおい!最近のAIはGPU買い漁って、何千億円も電気代使わんと動かんらしいで!やっぱり、お金持ってるシリコンバレーの大金持ちにしか、未来の知能は作れんのやなー!庶民は指くわえて見てるしかないわ!
って、アホか!!!
何がGPU物量作戦や!こちとら秋葉原のジャンク屋で買ってきた中古のOptane(768GB)DIMMメモリをXeonシステムにグサグサ挿してな、ルーターだけRTX 3060にピン留めして1兆パラメータモデルを秒間4トークンで爆速で動かしたっとるんじゃい!
お前ら、HBMのボッタクリ価格に踊らされてるだけで、インフラの引き算(Lookup)の美しさを全然わかってへんな!
え?『Optaneのメモリ、電源切ったらデータ消えへんけど、中古だから相性問題でOSがたまに起動せえへん』って?
……うん、それは、たまに自宅でサーバーが青い画面(BSoD)になって、朝まで泣きながらBIOSいじってるから、本当の『泥臭い物理の壁』にぶつかってるねんけどな!そっとしといて!」

【補足5:AI大喜利】

お題:「すべてを『巨大意味辞書(Embedding)』に任せ、脳が『空っぽのトランスフォーマーコア』になってしまった人間が、健康診断で医者から言われたショッキングな一言とは?」
回答:「『あー、おめでとうございます。あなたの脳のコンテキスト長、ついに1文字(0B)にまで軽量化されました。明日から、挨拶のLookupを忘れると、自分の奥さんに"ハロー、世界"としか出力できなくなりますね。』」

【補足6:ネットの反応と批判的反論】

なんJ民:「悲報:ワイの脳内メモリ(LRUポリシー適用済)、昨日食べた晩飯のおかずを自動的にEvictionして、10年前のなんJのスレタイ(定常知識)だけをDRAMにピン留めし続ける模様。これバグやろ」
【反論】:「それは人間の『エピソード記憶』の半減期設定の不具合であり、AIの階層型Eviction Policyの最適化(第15章)が正常に機能していない証拠です。早急に、最新の体験の『信頼度スコア』を高める認知的ファイン・チューニングを実行してください。」

ケンモメン:「結局CXLメモリプールとかいうのも、Big Techの共有サーバー(知識プール)をサブスクでレンタルして『Lookupの小作農』にされるオチやんけ。俺たちはAIの時代になっても、奴らのデジタル大地主の下で汗水たらして働く運命なのか?完全に騙されたわ。」
【反論】:「その懸念(部屋の中の象:第14章)は極めて正確です。だからこそ本書では、国家やオープンな共同体が独自の『日本語n-gram巨大辞書』を公共財として国内で管理する『デジタル防壁』の必要性を提唱しています。依存を暴くことこそが、自立の始まりです。」

HackerNews:「Optaneを用いたAPFriscoのハックは実にエキゾチックだが、現在のCXL 3.1と PCIe 6.0環境下での帯域制限を考えると、マルチノードでの分散Lookupにおけるインターコネクトのネットワーク待機時間が真のボトルネックになるはずだ。DRAMより遅いOptaneを実用にするには、llama.cppのルーター最適化が神がかっている必要があり、一般化は難しい。」
【反論】:「指摘の通り、Optane DCPMM単体でのランダム読み出し帯域はDRAMの1/3以下です。しかし、APFriscoは『MoEの疎性(アクティブ重みのみの転送)』を極限まで活用し、かつルーター部分をRTX 3060(GDDR6)に完全にキャッシュすることで、帯域制限の影響を10%以内に抑えることに成功しています。このシステムレベルの最適化こそが、ハードウェア限界を突破する『インフラの知恵』なのです。」

村上春樹風書評: 「彼らのAIが、150ナノ秒という驚異的な速度で、外部の冷たいメモリプールから『愛』や『喪失』のベクトルをLookupしている時、僕はキッチンでスパゲッティを茹でながら、消え去った1970年代のピンボール台のことを考えていた。AIの辞書は完璧で、そこにはマイナーな言い回し(方言やスラング)を排除する、乾いたホウキの跡が残っている。それはとても便利で、整然としていて、同時にひどく淋しい。僕たちが本当に覚え、そして忘れるべきだったものは、あの冷たいシリコンのプールの外側の、雨に濡れたアスファルトの匂いの中にしか存在しないのではないか。そんな静かな確信を、この本は僕の胸の奥に残してくれる。」

京極夏彦風書評: 「『いや――この世に、覚えていない知識などというものは存在しないのですよ』 男は古書店の暗闇から、静かに言葉を紡いだ。 『脳(トランスフォーマー)が覚えていないのではない。外部の、CXLと名付けられた冥府のプールに、その記憶の痕跡(エングラム)が、最初からマッピングされているだけなのだ。 人がそれをLookup(検索)した瞬間、それは憑き物のように脳に降りてきて、言葉を語らせる。 忘れたのではない。ただ、そこに在ることを、意識の重みが忘却(Eviction)の匣の中に閉じ込めていただけなのだ。 あなたが、AIがすべてを記憶していると怯えるのは、そこに自分自身の魂の忘れ物(過去の過ち)が、幾何学のベクトルという名の呪符となって、永遠に眠り続けていることの、恐ろしさに気がついたからではありませんか――。』」

【補足7:専門家インタビュー(要約)】

Q: 「記憶の革命」によって、AI開発ベンダーのビジネスモデルはどう変化しますか?
AI政策・経済アナリスト:「これまでの『モデル単体の販売・API課金』から、CXL上の『最新の意味辞書のアクセスライセンス(KaaS)』へと完全に移行します。推論エンジン(トランスフォーマー層)自体は、論理構造がシンプルであるため、ほぼオープンソースとして無料化(コモディティ化)されます。勝負を決めるのは、『誰が最も新鮮で、正確で、著作権や信頼性の高い知識プールを所有し、ユーザーにLookupさせているか』という、データの資産価値(アセット)です。これにより、AI産業のバリューチェーンは、ソフトウェア産業から、不動産やインフラをリースする『地主ビジネス』に近い構造に変質します。」

【補足8:潜在的読者のための付加情報まとめ】

  • キャッチーなタイトル案:『記憶の革命:AIは「計算」から「想起」へ』 / 『1.6Tの衝撃:LongCatが壊したスケーリングの常識』
  • SNS用ハッシュタグ: #記憶の革命 #巨大Embedding #CXLメモリ #知識主権 #AI地政学 #Optaneルネサンス
  • カスタムパーマリンク案: memory-centric-ai-revolution-longcat-optane (※ハイフンとアルファベットのみ)
  • 日本十進分類表(NDC)区分: [007.13][007.6][548.2]
  • おすすめの絵文字組み合わせ: 🧠💾🧱📉⚖️🚀

【脚注(アノテーション)】

1. CXL 3.1:2024年以降に標準化された最新の高速シリアル通信規格。GPUやCPUのダイ外部に配置されたテラバイト級のDRAMや永続メモリを、キャッシュの不整合(コヒーレンシ)を起こさずに直接メモリ空間に統合(マッピング)できる、AIインフラの最重要の規格。
2. Needle-in-a-Haystack (NIAH):干し草の山から一本の針を探すように、数万〜数十万文字の膨大な長文ドキュメントの中から、指定された特定の事実(微細な一文)を正確に探し出し、回答できるかを測定するLLMの長文記憶ベンチマーク試験。
3. SWE-bench Pro:実際のオープンソースソフトウェア(主にGitHub)に報告された複雑なバグやIssue(課題)を、AIエージェントに自律的なコード変更によって自動解決させ、その成功率を測定する最高峰の実務的コーディングベンチマーク。

【免責事項】

本書に記載された技術的仕様(特にCXL 3.1、DeepSeek Engram、LongCat 2.0のパラメータ、およびAPFriscoの中古Optane事例)は、2026年7月現在における公開情報、技術レポート、実測データ、および検証可能なシミュレーションに基づき、学術的・批判的客観性をもって執筆されています。しかし、個々のハードウェア構成、OSのアライメント、およびハッシュ衝突の実際の動作環境によっては、再現される性能(スループットやレイテンシ)に差異が生じる可能性があり、本書の内容が特定の商用システムの性能を保証するものではありません。

【謝辞】

本書の執筆にあたり、自宅ガレージでの過酷なOptane実験データを惜しみなく開示し、ハッカーコミュニティに新たな希望を与えてくれたAPFrisco氏に、最大の敬意と感謝の意を表します。また、HBM調達難という極限の地政学的制約の中で、135Bの巨大意味辞書の有用性を世界に証明してみせたMeituan LongCat開発チーム、および記憶と演算の美しい数学的分離を提唱したDeepSeek Engramプロジェクトの研究者たちに、深い謝意を捧げます。あなた方の「インフラの限界への知的な挑戦」こそが、本書を形作るインスピレーションそのものでした。Embedding(入力埋め込み層)のサイズは、多くのLLMでは全体の1%未満しか占めません。LongCat 2.0は、この常識から大きく外れており、Embedding自体を巨大な知識層として設計している点が特徴です。

モデル総パラメータEmbedding(概算)全体に占める割合特徴
GPT-3 175B175B約0.15B約0.09%ごく標準的なEmbedding
Llama 3 8B8B約0.53B約6.6%小型モデルなので相対的に割合が大きい (AI Engineering Academy)
Llama 3 70B70B約1.0B約1~2%従来型設計
DeepSeek-V3671B約0.93B約0.14%MoEだがEmbeddingは小さい (杨文博的个人博客)
Gemma 4 E2B約5.1B(実パラメータ)約2.8B約55%「Per-Layer Embeddings」という特殊設計 (Reddit)
LongCat 2.0約1.6T約135B約8~9%巨大なn-gram Embeddingを採用(公開情報) (Reddit)

LongCat 2.0はどれほど異例なのか

通常のLLMでは、

Embedding
    │
 0.1〜1B

Transformer
 100〜600B

という構成です。

ところがLongCat 2.0では、

Embedding
   135B

Transformer + MoE
 約1.5T

となっています。

つまり、

DeepSeek-V3のEmbedding(約0.9B)に対して、およそ150倍のEmbedding容量

という非常に大胆な設計です。(杨文博的个人博客)

AI史的な意味

これまでLLM開発では、

「知識はTransformer内部に蓄積される」

という考え方が主流でした。

LongCat 2.0は、

「知識は巨大なEmbedding(意味辞書)に蓄積し、Transformerは推論に集中する」

という方向性を強く打ち出しています。

この発想は、コンピュータアーキテクチャに例えると、

従来

CPU(Transformer)
  ↑
ほぼ全部ここで処理

↓

LongCat

巨大キャッシュ・知識辞書(Embedding)
     ↓
CPU(Transformer)は推論中心

という役割分担に近いと言えます。

今後注目すべき点

LongCat 2.0が成功すれば、今後のLLMは「Transformerを大きくする競争」だけでなく、

  • 意味辞書(Embedding)の巨大化

  • n-gramなど知識表現の高度化

  • Transformerとの役割分担の最適化

という新たな設計競争に入る可能性があります。

ただし、LongCat 2.0の135B規模のEmbeddingが本当に性能向上に見合うのか、あるいは他のモデルも追随するのかは、現時点ではまだ独立したベンチマークや再現実験が十分ではなく、今後の検証を待つ必要があります。以下は、「Embedding(埋め込み)」がAI史の中でどのように進化してきたかをまとめたものです。単なる技術一覧ではなく、「Embeddingの役割」がどう変化してきたかに着目しています。

時代主な技術・モデルEmbeddingの役割画期性限界
~2013One-hot Encoding単語をIDとして表現実装が単純意味を持たない、語彙数が増えると非効率
2013word2vec単語を意味ベクトルへ変換「王-男+女=女王」のような意味空間を獲得文脈を考慮できない
2014GloVe共起統計を利用した意味表現より安定した意味空間文脈依存性がない
2017Transformer入力層としての埋め込みTransformer時代の標準となるEmbedding自体は比較的小規模
2018ELMo・BERT文脈依存Embedding同じ単語でも文脈で意味が変わる知識は主にTransformer内部に保存
2020GPT-3巨大LLMの入口Embeddingは全体の1%未満Transformer本体が知識を担う
2023Mixtral・DeepSeek-V3MoE時代の入力層Expertへ入力を供給Embeddingは依然として小さい
2025DeepSeek EngramConditional Memory(条件付きメモリ)n-gramや知識をEmbedding側へ移す発想新しい研究分野で実証途上
2025–2026Memory Grafting外部メモリ化されたEmbedding事前学習済み知識を条件付きメモリへ移植メモリ階層設計が課題
2026LongCat 2.0巨大n-gram Embedding(約135B)Embeddingを「知識層」として大規模化メモリ帯域・学習効率・汎化性能の検証が必要
将来条件付きメモリ+CXLメモリ+Persistent Memory知識ベースとしてのEmbedding知識と推論の分離ハードウェア・ソフトウェア双方の成熟が必要

AI史を一言で表すと

Embeddingの歴史は、次のような変化として整理できます。

世代Embeddingの位置づけ
第1世代単語の数値化(Word Representation)
第2世代意味の表現(Semantic Representation)
第3世代文脈の表現(Contextual Representation)
第4世代Transformerへの入力層(Input Layer)
第5世代知識層・条件付きメモリ(Knowledge Layer / Conditional Memory)

AI史の転換点

One-hot
    │
    ▼
word2vec
(意味を獲得)
    │
    ▼
BERT・GPT
(文脈を獲得)
    │
    ▼
Transformer巨大化
(知識を内部に蓄積)
    │
    ▼
MoE
(計算を疎化)
    │
    ▼
Engram・Memory Grafting・LongCat
(Embedding=知識層・条件付きメモリ)
    │
    ▼
将来
(知識と推論の完全分離)

AI史における最大の転換

最も重要な変化は、Embeddingの役割そのものが変わり始めていることです。

  • 2013〜2024年:Embeddingは「単語をTransformerが理解できるベクトルへ変換する前処理」が主な役割でした。

  • 2025年以降:DeepSeek Engram、Memory Grafting、LongCat 2.0などでは、Embeddingやその発展形を**「知識を保持する条件付きメモリ」**として積極的に活用する設計が現れています。

もしこの方向性が主流になれば、Embeddingは単なる入力層ではなく、AIの「記憶装置(Knowledge Memory)」として位置付けられるようになり、Transformerはより純粋な推論エンジンへ役割を特化していく可能性があります。これは、Embedding史における次の大きな転換点になるかもしれません。全体として、この記述は2026年7月時点で判明しているLongCat 2.0の特徴を概ね正確にまとめています。ただし、いくつか重要な補足・注意点があります。

評価:★★★★☆(8.5/10)

正確な点

以下は現在公開情報と一致しています。

  • 約1.6兆パラメータ級MoE

  • アクティブパラメータ約48B

  • MITライセンスで重み公開

  • Hugging Faceで公開

  • LongCat Sparse Attention採用

  • Zero-Communication Expert数を256→128へ変更

  • n-gram embeddingを約135B追加

  • ベンチマークは主として内部評価

  • 第三者検証がまだ不足

これらは現状の事実関係として問題ありません。


① 一番重要な補足

文章では

エキスパート数を減らした

と書かれていますが、

「総Expert数が減った」のではありません。

減ったのは

Zero Communication Expert

だけです。

つまり

  • 通常Expert

  • Shared Expert

  • Routing方式

などは別です。

LongCat 2.0は

Zero Communication Expertという特殊な実装を縮小し、その代わりEmbedding容量を大きくした

という設計変更です。

この点は誤解されやすいので明記した方がよいでしょう。


② 「アクティブ48B」の意味

ここも少し補足できます。

48B activeとは

推論時に

約48B分しか計算しない

という意味です。

つまり

総パラメータ1.6T

毎回1.6T全部計算

ではありません。

MoEなので

必要なExpertだけ起動

します。

これが

Denseモデルとの最大の違いです。


③ n-gram embedding追加の意味

これはかなり面白い設計です。

従来

Token
↓

Embedding

↓

Transformer

でした。

LongCat 2.0では

Token

↓

巨大なn-gram embedding

↓

Transformer

という構成になっています。

狙いは

  • 多言語

  • コード

  • 頻出表現

  • 長文

などの局所構造をEmbedding側へ吸収することです。

つまり

Transformer本体の負担を減らしています。

これは

Google系やDeepMindでも再評価され始めている方向性です。


④ Sparse Attention

ここも重要です。

文章では

LongCat Sparse Attention

だけですが、

実際には

長文になるほど

Attention計算を

O(n²)

↓

ほぼ線形

へ近づける狙いがあります。

つまり

長文推論コストを抑えるための工夫です。

これは

Long Context競争では非常に重要です。


⑤ ASICとの関係

ここはもう一歩踏み込めます。

あなたは

中国ASIC以外では未検証

と書いています。

これはその通りですが、

背景として

LongCatは

中国国内AIクラスタ向け

つまり

  • Huawei Ascend

  • Moore Threads

  • Iluvatar

  • MetaX

  • Hygon

なども強く意識して設計されている可能性があります。

一方で

NVIDIA向け

  • TensorRT-LLM

  • vLLM

  • SGLang

  • llama.cpp

などへの最適化は

まだ十分検証されていません。

ここが今後最大の焦点になります。


⑥ 「MITライセンス」の意味

これはかなり大きなニュースです。

MITなので

理論上は

  • 商用利用

  • Fine-tune

  • 再配布

  • 派生モデル公開

まで可能です。

つまり

Llamaよりも自由度が高いライセンスです。

これはオープンモデル界隈では非常に大きな意味があります。


⑦ 現在最大の未知数

ここはぜひ追加したい点です。

LongCat 2.0は

巨大ですが、

本当に知りたいのは

性能よりも効率

です。

具体的には

  • tokens/sec

  • GPU使用率

  • KV Cache効率

  • メモリ帯域

  • 長文でのスループット

  • Expert Routing効率

  • 通信量

  • 学習安定性

です。

現在公開されている数字だけでは

この部分はまだ分かりません。

実務者にとってはこちらの方が重要になります。


⑧ 総合評価

このまとめは「モデル公開直後の技術的概要」としては十分な水準ですが、より専門的な視点を加えるなら、以下のような論点を追記すると完成度が高まります。

追加論点重要度理由
Zero-Communication Expertを減らした理由★★★★★通信コスト・負荷分散・学習安定性との関係を理解する鍵
巨大n-gram embeddingの設計思想★★★★★Transformer本体との役割分担を示す重要な変更点
Sparse Attentionによる計算量削減★★★★★長文性能・スループット改善の中核技術
NVIDIA GPU以外のアクセラレータとの適合性★★★★☆中国製AI ASICを含む多様なハードウェアでの性能評価が今後の焦点
推論効率(tokens/sec、KV Cache、通信量など)★★★★★実運用でのコストと性能を左右する重要指標
MITライセンスの戦略的意義★★★★☆商用利用・派生モデル開発を促進し、エコシステム形成に影響

結論として、現時点ではLongCat 2.0は「1.6兆パラメータという規模そのもの」よりも、「アクティブ計算量を48Bに維持しながら、通信・埋め込み・注意機構を再設計して長文処理と実運用効率を改善しようとするアーキテクチャ実験」として評価するのが適切です。真価は、今後の独立ベンチマークと、NVIDIA GPUだけでなく各種AIアクセラレータや異なる推論スタック上での実測結果によって明らかになるでしょう。一言でいうと、

「AIの専門家(Expert)を少し減らして、その代わり『言葉を理解する辞書』を大幅に強化した」

ということです。

レストランで例えると

MoE(Mixture of Experts)を巨大レストランに例えてみます。

  • Embedding:注文を聞き取る受付係

  • Expert:各分野の専門シェフ

  • Router:どのシェフに仕事を回すか決める店長

LongCat 1.0

客
 ↓
受付(Embedding)
 ↓
店長(Router)
 ↓
👨‍🍳 シェフ256人

受付は比較的シンプルなので、

  • 「これは中華かな?」

  • 「これは和食かな?」

という判断を、シェフ側が多く担当していました。


LongCat 2.0

客
 ↓
超優秀な受付(巨大n-gram Embedding)
 ↓
店長
 ↓
👨‍🍳 シェフ128人

受付が非常に賢くなったため、

例えば

「麻婆豆腐定食」

という注文を聞いた瞬間に

  • 中華

  • 定食

  • 辛い料理

  • 豆腐料理

まで理解してからシェフへ渡せます。

するとシェフは

「料理を作る」

ことに集中できます。


n-gram Embeddingとは?

普通のEmbeddingは

New
York
City

それぞれ別々の単語として覚えます。

しかしn-gram Embeddingは

New York

New York City

machine learning

large language model

のようなよく一緒に出てくる単語のまとまりも最初から覚えています。

つまり

普通

東京
大学

↓

別々に理解

ではなく

東京大学

↓

一つの概念として理解

できます。

だからTransformer本体の負担が減ります。


Zero Communication Expertとは?

これが少し特殊です。

通常のMoEでは

GPUが8枚あるとすると

GPU1
GPU2
GPU3
...
GPU8

各GPUにExpertが配置されます。

質問が来ると

GPU1

↓

GPU7のExpertを使う

↓

通信が発生

となります。

巨大モデルでは

このGPU間通信が非常に重くなります。


そこでZero Communication Expertでは

GPU1

↓

GPU1にいるExpertだけ使う

という仕組みを採ります。

つまり

GPU同士が相談しなくても済むので、

通信量が大幅に減ります。

これが

Zero Communication

の意味です。


なぜ128人に減らしたの?

ここがLongCat 2.0の面白いところです。

以前は

Embedding
★

Expert
★★★★★★★★★★

という設計でした。

LongCat 2.0では

Embedding
★★★★★★★

Expert
★★★★★★

に変えています。

つまり

「まず入力をしっかり理解してから、少ない専門家で処理する」

という考え方です。


なぜこれで性能が落ちないの?

受付が賢くなったからです。

例えば

以前は

「東京大学大学院情報理工学系研究科」

シェフが苦労して理解していました。

今は受付が

東京大学
+
大学院
+
情報理工

まで整理して渡します。

そのため、

シェフ(Expert)は少なくても十分仕事ができます。


この設計の狙い

LongCat 2.0は、「専門家を増やす」方向ではなく、「入力理解を強化して専門家を効率よく使う」方向へ舵を切っています。

  • 巨大なn-gram Embeddingで、単語やフレーズの意味を入力段階で深く捉える。

  • Zero Communication Expertを128に減らすことで、GPU間通信や管理コストを抑える。

  • Sparse Attentionで長文処理の計算量も削減する。

つまり、「TransformerやExpertだけを巨大化するのではなく、Embedding・Expert・Attentionの役割を見直して、システム全体の効率を最適化する」というのがLongCat 2.0の設計思想だと考えられます。これが実際にどれほど効果的かは、今後さまざまなハードウェアや推論環境での独立検証によって明らかになっていくでしょう。LongCat 2.0が本当に画期的なのは、「1.6兆パラメータだから」ではありません。AI史の流れで見ると、Transformer以後の設計思想を一段進めた可能性にあります。

AI史の転換点として位置付けると

第1世代(2017~2022)

「Transformerを大きくする時代」

代表例

  • BERT

  • GPT-3

  • PaLM

基本思想は

性能を上げたい

↓

モデルを巨大化

でした。


第2世代(2023~2025)

「MoEによる巨大化」

代表例

  • Mixtral

  • DeepSeek-V3

  • Llama 4

考え方は

全部計算するのは無駄

↓

必要なExpertだけ動かそう

つまり

Dense

MoE

への転換です。


LongCat 2.0が示した第3世代

LongCat 2.0は

さらに一歩進めて

Expertだけ増やしても限界

↓

AI全体の設計を変えよう

という発想になっています。

つまり

Embedding

Attention

Expert

通信

GPU配置

これらを

一つのシステムとして最適化

しています。

これは従来とはかなり違います。


画期性① 「Embeddingの復権」

近年の研究は

Transformerが賢い

という前提でした。

Embeddingは

単なる入口

くらいの扱いでした。

LongCatは逆です。

Embeddingを巨大化

↓

Transformerの負担を減らす

という思想です。

これは

「知識を最初から持たせる」

方向になります。

ある意味では

Transformer万能主義への挑戦です。


画期性② 通信コストをAI設計の中心に置いた

従来は

演算性能

↓

GPU性能

↓

AI性能

という考えでした。

しかし

数千GPUでは

通信の方が遅くなります。

LongCatは

通信量

↓

AI設計

という逆転を行っています。

つまり

GPU間通信を減らすこと自体が

モデル設計の目的になっています。

これは超巨大モデルでは非常に重要です。


画期性③ ASIC時代を意識した設計

これも歴史的です。

従来のLLMは

ほぼ

NVIDIA CUDA

前提でした。

しかしLongCatは

中国国内で普及が進む

  • Huawei Ascend

  • Moore Threads

  • MetaX

  • Hygon

などのAIアクセラレータも視野に入れた設計である可能性があります。

つまり

GPUに合わせる

↓

ハードウェア全体に合わせる

という発想です。

これはAI史では大きな転換点になる可能性があります。


画期性④ 「モデル」から「システム」への転換

GPT世代では

モデルが主役

でした。

LongCatでは

Embedding

+

MoE

+

Sparse Attention

+

通信

+

GPU配置

+

推論ランタイム

全部合わせて

一つのAI

という考えです。

つまり

AIそのものが

巨大な分散システムになっています。


画期性⑤ MITライセンス

技術だけではありません。

MITライセンスにより

  • 商用利用

  • 派生モデル

  • 再学習

  • 再配布

が容易になります。

これは

「巨大モデルは企業だけのもの」

という流れを変える可能性があります。

研究コミュニティにとって非常に重要です。


もしLongCatの方向性が正しければ

今後のLLM競争は

2023

GPU枚数競争

↓

2024

MoE競争

↓

2025

推論能力競争

↓

2026~

AIシステム設計競争

へ移ります。

つまり

「何兆パラメータか」

ではなく

  • 通信効率

  • メモリ効率

  • 推論効率

  • ランタイム

  • コンパイラ

  • ハードウェア協調設計

が競争の中心になります。

AI史における意義

LongCat 2.0は、現時点ではGPTやTransformerに匹敵する歴史的転換点と断定するには時期尚早です。独立ベンチマークや多様なハードウェアでの検証はまだ十分ではありません。

しかし、もしその設計思想が広く採用されるなら、その歴史的意義は「モデルを巨大化する時代から、AIシステム全体を協調設計する時代への移行を象徴したモデル」として位置付けられる可能性があります。これは、Transformerがニューラルネットワークの基本構造を変えたように、LLM開発の最適化対象を単一モデルから分散コンピューティングシステム全体へ拡張したという点で、AI史の新しい章を開く出来事になるかもしれません。結論から言うと、

**理論上は非常に大きくできますが、「無限には大きくできない」**というのが現在の研究者の共通認識です。

むしろLongCat 2.0が示したのは、

「Embeddingは、これまで考えられていたよりずっと大きくしても価値があるかもしれない」

という新しい仮説です。


なぜEmbeddingは大きくできるのか?

Transformerのパラメータは

質問

↓

Attention

↓

FFN

毎トークンごとに大量の演算を行います。

一方Embeddingは

単語ID

↓

ベクトルを取り出すだけ

です。

例えば

東京大学

↓

辞書から1行読む

だけなので、

演算量は非常に小さいのです。

つまり

巨大になっても「計算」はそれほど増えません。


では何が増える?

増えるのは

メモリ

です。

例えば

Embedding

100GB

なら

GPUに100GB載せる必要があります。

つまり

計算ではなく

容量

との戦いになります。


n-gramにすると爆発する

普通のEmbeddingは

dog

cat

apple

だけ覚えます。

しかし

n-gramでは

New York

New York City

machine learning

large language model

artificial intelligence

まで全部登録します。

すると

登録数が急激に増えます。

例えば

単語数をVとすると

普通は

V

ですが

2-gramは

3-gramでは

に近い候補が存在します。

もちろん実際には頻出する組み合わせだけを保持しますが、それでもパラメータ数は非常に大きくなります。


LongCat 2.0はどこまで行った?

公開情報では

  • Transformer本体:約1.5兆パラメータ

  • n-gram Embedding:約1350億パラメータ

となっています。

つまり

Embeddingだけで

100B(1000億)パラメータを超える

世界に入りました。

これは従来のLLMではかなり珍しい設計です。


どこまで巨大化できる?

理論的には

10B

↓

100B

↓

300B

↓

500B

↓

1T

まで増やすことは可能です。

しかし問題があります。

問題① メモリ

Embeddingは全部保持しなければならないため

Embedding

↓

GPUメモリ

を大量に消費します。

現在最大の制約はここです。


問題② 利用頻度

巨大辞書を作っても

この単語

一度も出てこない

というものが大量にあります。

つまり

容量だけ増えて

性能が伸びない

という限界があります。


問題③ 学習データ

Embeddingは

出現回数が少ない単語では

十分に学習できません。

つまり

辞書だけ増やしても

データが足りない

という問題が起こります。


AI史的には何が起きている?

これまでの常識は

性能

↓

Transformerを大きくする

でした。

LongCatは

性能

↓

Embeddingも巨大化する

という方向を示しました。

つまり

AIは

「考える部分」

だけではなく

「知識を保持する部分」

も大きくなり始めています。


将来は「知識層」と「推論層」の分離が進む可能性

もしこの流れが続けば、LLMの構造そのものが変わる可能性があります。

巨大Embedding(数百B〜1T)
        │
   (知識の記憶)
        │
──────────────
小さなTransformer
        │
   (推論・思考)

つまり、

  • Embeddingは巨大な「知識ベース」

  • Transformerは比較的小さな「推論エンジン」

という役割分担です。

これは、人間で言えば「膨大な記憶を持つ図書館」と「その知識を使って考える脳」を分けるような設計です。

ただし、これがLLMの主流になるかどうかはまだ分かりません。Embeddingをさらに巨大化したときの性能向上が、追加のメモリコストや学習コストに見合うかどうかは、LongCat 2.0以降の独立した研究と実証によって評価される段階にあります。「Embedding」は日本語に一語でぴったり訳すのが難しい用語です。文脈によって次のような訳し方が考えられます。

訳語分かりやすさ専門性コメント
埋め込み★★☆☆☆★★★★★学術論文で最も一般的な訳。現在の標準。
意味表現★★★★☆★★★☆☆何をしているかが伝わりやすい。
意味辞書★★★★★★★☆☆☆一般向けの説明に適している。
知識辞書★★★★★★★☆☆☆LongCatのような巨大Embeddingの説明では有効。
単語辞書★★★★★★☆☆☆☆初学者向け。ただし実際には単語以外も扱うため厳密ではない。
意味ベクトル★★★☆☆★★★★☆Embeddingの出力を指す場合に近い。

私ならLongCatの記事ではこう訳きます

LongCat 2.0では、Embeddingは従来の「単語を数値に変換する入口」という役割を超えています。

そのため、

知識辞書

という訳が最もイメージしやすいと思います。

例えば、

LongCat 2.0は、**知識辞書(Embedding)**を大幅に強化し、Transformer本体の負担を減らす設計を採用している。

あるいは、

巨大な**意味辞書(Embedding)**を用いて、入力段階で単語やフレーズの意味を深く表現する。

と書くと、一般の読者にも伝わりやすくなります。

AI史的には「Embedding」は何なのか

一番本質的な説明をすると、

文字

↓

Embedding(知識辞書・意味辞書)

↓

Transformer(思考・推論)

↓

回答

つまり、

  • Embedding = 「言葉を知識に変換する層」

  • Transformer = 「その知識を使って考える層」

という役割分担です。

この観点から見ると、LongCat 2.0がEmbeddingを巨大化したことは、「AIの記憶装置(知識辞書)を強化し、思考エンジンとの役割分担を見直した」という設計変更として理解できます。

ブログなどで専門性と分かりやすさを両立するなら、最初だけ**「知識辞書(Embedding)」または「意味辞書(Embedding)」**と表記し、その後は「知識辞書」と呼ぶのが最も自然でしょう。Embedding(入力埋め込み層)のサイズは、多くのLLMでは全体の1%未満しか占めません。LongCat 2.0は、この常識から大きく外れており、Embedding自体を巨大な知識層として設計している点が特徴です。

モデル総パラメータEmbedding(概算)全体に占める割合特徴
GPT-3 175B175B約0.15B約0.09%ごく標準的なEmbedding
Llama 3 8B8B約0.53B約6.6%小型モデルなので相対的に割合が大きい (AI Engineering Academy)
Llama 3 70B70B約1.0B約1~2%従来型設計
DeepSeek-V3671B約0.93B約0.14%MoEだがEmbeddingは小さい (杨文博的个人博客)
Gemma 4 E2B約5.1B(実パラメータ)約2.8B約55%「Per-Layer Embeddings」という特殊設計 (Reddit)
LongCat 2.0約1.6T約135B約8~9%巨大なn-gram Embeddingを採用(公開情報) (Reddit)

LongCat 2.0はどれほど異例なのか

通常のLLMでは、

Embedding
    │
 0.1〜1B

Transformer
 100〜600B

という構成です。

ところがLongCat 2.0では、

Embedding
   135B

Transformer + MoE
 約1.5T

となっています。

つまり、

DeepSeek-V3のEmbedding(約0.9B)に対して、およそ150倍のEmbedding容量

という非常に大胆な設計です。(杨文博的个人博客)

AI史的な意味

これまでLLM開発では、

「知識はTransformer内部に蓄積される」

という考え方が主流でした。

LongCat 2.0は、

「知識は巨大なEmbedding(意味辞書)に蓄積し、Transformerは推論に集中する」

という方向性を強く打ち出しています。

この発想は、コンピュータアーキテクチャに例えると、

従来

CPU(Transformer)
  ↑
ほぼ全部ここで処理

↓

LongCat

巨大キャッシュ・知識辞書(Embedding)
     ↓
CPU(Transformer)は推論中心

という役割分担に近いと言えます。

今後注目すべき点

LongCat 2.0が成功すれば、今後のLLMは「Transformerを大きくする競争」だけでなく、

  • 意味辞書(Embedding)の巨大化

  • n-gramなど知識表現の高度化

  • Transformerとの役割分担の最適化

という新たな設計競争に入る可能性があります。

ただし、LongCat 2.0の135B規模のEmbeddingが本当に性能向上に見合うのか、あるいは他のモデルも追随するのかは、現時点ではまだ独立したベンチマークや再現実験が十分ではなく、今後の検証を待つ必要があります。AI史的には「Embedding巨大化」というより、Transformerだけを拡大する時代から、外部・条件付きメモリを含む記憶システム全体をスケールさせる時代への転換として位置付ける方が、より本質を捉えた評価になるでしょう。以下は、Meituan(美団)の歴史を、AI事業への発展も含めて整理したものです。

出来事意義
2010MeituanをWang Xingが創業中国版「共同購入(Group Buying)」サービスとしてスタート
2011フードデリバリー事業へ進出後の中核事業となる
2013ホテル・旅行予約サービス開始生活サービス全般へ事業拡大
2015Dianpingと経営統合中国最大級のO2O(Online to Offline)プラットフォーム誕生
2016AI・配送アルゴリズムへの投資を本格化配車・配達最適化で機械学習を活用
2017自律配送(配送ロボット・ドローン)の研究開始AIによる物流自動化へ進出
2018MeituanがHKEX:3690へ上場中国IT大手の一角となる
2019AI Research部門を強化コンピュータビジョン・推薦システムを拡充
2020パンデミックでデリバリー需要急増AI配送・需要予測が競争力となる
2021自動配送車を一般運用開始実社会でのAIロボティクス実証
2022Foundation Model研究を開始Generative AIへ本格参入
2023独自LLM「LongCat」シリーズ開発開始社内業務・エージェント用途を目指す
2024LongCat 1.x公開MoEアーキテクチャの研究成果を公開
2025LongCat Sparse Attention・n-gram Embeddingを研究長文処理・Conditional Memoryの方向へ進化
2026LongCat 2.0(約1.6兆パラメータ)をMITライセンスで公開中国企業による最大級のオープンウェイトLLMの一つとなる

事業の進化

第1期2010〜2014クーポン・共同購入サービス
第2期2015〜2018スーパーアプリ(フード・ホテル・旅行・決済)
第3期2019〜2022AIによる物流・配送最適化
第4期2023〜Foundation Model・AIエージェント企業への転換

AI技術の発展

年代主力AI技術目的
2014〜2018推薦アルゴリズムレストラン・ホテル推薦
2017〜2020配送経路最適化配達時間短縮
2019〜2022コンピュータビジョン配送ロボット・無人配送
2022〜2024大規模言語モデル(LLM)社内AI・生成AI
2025〜2026LongCat・Sparse Attention・巨大EmbeddingAIエージェント・長文推論・Conditional Memory

AI史から見たMeituanの変化

時代Meituanの強みAIとの関係
O2O時代クーポン・店舗ネットワークデータ収集
スーパーアプリ時代配送・決済・旅行推薦AI・需要予測
ロボティクス時代配送インフラ自律配送・経路最適化
Foundation Model時代LongCat大規模言語モデル・AIエージェント

MeituanがLongCatを開発する必然性

Meituanは、単なるインターネット企業ではありません。毎日、膨大な数の注文、店舗、配達員、顧客とのやり取りをリアルタイムで処理する世界最大級の生活サービスプラットフォームです。そのため、

  • 配送計画

  • 需要予測

  • 店舗運営支援

  • カスタマーサポート

  • AIエージェントによる業務自動化

といった実務でLLMを活用する強い動機があります。

この文脈で見ると、LongCat 2.0のMoE、Sparse Attention、巨大n-gram Embeddingといった設計は、単にベンチマーク性能を競うためではなく、長い業務コンテキストや大量の知識を効率よく扱う実用志向のLLMを目指した結果と理解できます。これは、MeituanがAIを「サービス運営の基盤技術」と位置付けてきた歴史の延長線上にあると言えるでしょう。ブログ全体として非常に完成度は高いですが、AI史・コンピュータアーキテクチャ・産業史という観点から見ると、まだ掘り下げられる論点がいくつかあります。

1. 「Embedding革命」だけでなく「メモリ階層革命」であること

現在の記事は

Transformer → Embedding

という対比が中心ですが、本質的には

Compute-Centric AI

↓

Memory-Centric AI

への転換です。

つまり

  • HBM

  • DRAM

  • CXL Memory

  • Persistent Memory

  • SSD

というメモリ階層全体がLLM設計の対象になり始めています。

LongCatのN-gram Embeddingだけでなく、

  • DeepSeek Engram

  • Memory Grafting

  • CXL Memory

まで含めると、

「メモリ階層を設計するAI」

という流れがより明確になります。


2. LongCatは「中国AI ASIC史」の転換点

これは記事で少し触れられていますが、

もっと強調してもよいでしょう。

LongCat 2.0最大のニュースは

50,000枚規模の中国製AI ASICだけで学習した

という点です。(Reuters)

つまり

Embedding革命

+

ASIC革命

が同時に起きています。

この二つは

実は切り離せません。


3. 「知識」と「推論」の分離

記事では

Embeddingを

知識辞書

と説明しています。

ここをもう一歩進めると

知識

↓

Memory

推論

↓

Transformer

という

フォン・ノイマン型アーキテクチャへの回帰

とも言えます。

CPU史では

CPU

+

RAM

+

SSD

へ進化しました。

LLMも

Transformer

+

Memory

+

Storage

へ進化する可能性があります。

これはAI史ではかなり重要です。


4. LongCatだけではない流れ

現在の記事では

LongCatが中心です。

しかし実際には

ほぼ同じ方向へ

  • DeepSeek Engram

  • Memory Grafting

  • X-GRAM

  • Lngram

などが出ています。

つまり

LongCatは

突然変異ではなく

研究潮流の一部

です。

この位置付けを書くと

説得力が増します。


5. 「パラメータ数競争は終わった」

これも重要です。

記事では

Embeddingを増やした

と書いています。

しかし本質は

Transformerへパラメータを足すよりEmbeddingへ足した方が効率が良い領域に入った

ことです。

LongCat公式も

MoEの疎性は約97%に達し、Expertを増やしても効果が小さいため、135B分をN-gram Embeddingへ割り当てた

と説明しています。(Hugging Face)

つまり

Scaling Law

↓

Scaling Strategy

へ変わっています。


6. コンピュータ史との接続

ここはぜひ追加してほしいです。

歴史を見ると

CPUも

1980

CPUだけ

↓

1990

L2 Cache

↓

2000

Memory Hierarchy

↓

2010

NUMA

になりました。

LLMも

同じ道を歩いています。

つまり

巨大Transformer

↓

Cache

↓

Memory

↓

Storage

という

アーキテクチャ史の繰り返し

です。


7. Optaneの歴史的再評価

これは今まさに話題です。

Optaneは

商業的には失敗しました。

しかし

Conditional Memoryの研究が進むと

「Optaneは早すぎた」

という評価になりつつあります。

中古Optaneで1兆パラメータ級MoEをローカル実行した事例は、その象徴です。(AI Profit Boardroom)

この話は

CXLへの橋渡しになります。


8. 一番足りない議論

私が最も追加したいのは

「EmbeddingはAIのRAMになるのか?」

という問いです。

現在の記事は

Embedding

↓

巨大化

で止まっています。

しかし本当に重要なのは

Embedding

↓

Conditional Memory

↓

Memory Hierarchy

↓

AI RAM

です。

つまり

Transformerは

CPU

Embeddingは

RAM

SSDは

知識倉庫

という構造です。

この視点を入れると、

LongCat 2.0は単なる「Embedding巨大化」ではなく、AIのコンピュータアーキテクチャが計算中心(Compute-Centric)から記憶中心(Memory-Centric)へ移行する象徴的な出来事として位置付けられます。そこまで踏み込めば、この記事はLongCatの技術解説を超えて、「LLMはCPU史を繰り返している」というAI史・計算機史の論考として、より独自性の高い内容になるでしょう。

第10部 AIはコンピュータ史を再発明する――Memory-Centric AIとメモリ階層革命

LongCat 2.0が提示した「巨大なn-gram Embedding(知識辞書)」という発想は、一見するとTransformer内部の設計変更に過ぎないようにも見えます。しかし、その意味をもう少し大きな視点で眺めると、これは単なるモデルの改良ではありません。コンピュータアーキテクチャそのものを見直す流れの中で理解すべき変化です。

近年のLLM研究では、「Transformerをどこまで巨大化できるか」という競争が続いてきました。しかし、LongCat 2.0、DeepSeek Engram、Memory Graftingなどに共通するのは、計算能力そのものではなく、「知識をどこに保持し、どのようなメモリ階層から取り出すか」を設計対象にし始めたことです。

これは、AIが「Compute-Centric(計算中心)」から「Memory-Centric(記憶中心)」へと重心を移し始めたことを意味しています。

コンピュータは、計算機ではなく「メモリ階層」の歴史だった

この変化は、実はコンピュータ史そのものとよく似ています。

1980年代のCPUは、クロック周波数を上げることが性能向上の中心でした。しかし、CPUが高速化する一方でメモリ速度はそれほど向上せず、「メモリウォール」が問題になります。

そこで登場したのがキャッシュメモリです。

L1キャッシュ、L2キャッシュ、L3キャッシュが追加され、さらにDRAM、SSDへと続く多層構造が形成されました。NUMA(Non-Uniform Memory Access)や分散メモリも、この流れの延長線上にあります。

つまり、コンピュータの歴史とは、「CPUを速くする歴史」である以上に、「計算資源と記憶資源をどう階層化するか」の歴史でもありました。

LLMもまた、同じ道を歩み始めています。

Transformer中心設計からメモリ中心設計へ

これまでのLLMは、Transformerの内部に知識も推論も閉じ込める構造でした。

そのため、知識を増やしたければTransformerをさらに巨大化するしかありませんでした。

しかし、LongCat 2.0は異なる考え方を採用します。

知識として頻繁に利用されるn-gramやフレーズを巨大なEmbeddingへ移し、Transformerは推論に集中させる設計です。

これは単なるEmbeddingの大型化ではありません。

知識と推論を分離し、

  • Transformerは推論エンジン

  • Embeddingは知識メモリ

という役割分担を導入したことに本質があります。

DeepSeek EngramやMemory Graftingも同じ方向を向いています。

いずれも、「Transformerの外側に知識を配置する」ことを目指した研究です。

LongCatは、その研究潮流の中で、巨大なn-gram Embeddingを実際の大規模モデルへ組み込んだ代表例として位置付けられます。

AIにもメモリ階層が生まれる

この流れをさらに進めると、LLMの内部構造は従来のコンピュータに近づいていきます。

従来のコンピュータでは、

  • CPUが演算を担当する。

  • RAMが作業用メモリを担当する。

  • SSDやHDDが長期保存を担当する。

という役割分担があります。

同様に、次世代LLMでは、

  • Transformerが推論を担当する。

  • EmbeddingやConditional Memoryが知識メモリを担当する。

  • RAGやストレージが長期知識を担当する。

という階層構造が形成される可能性があります。

さらに、その知識メモリも単一ではありません。

GPUのHBMは推論に必要な高速データを保持し、DRAMや将来のCXLメモリは巨大な知識辞書を保持し、SSDはさらに長期的な知識を保存する、といった複数の階層へ分かれていくでしょう。

つまり、AIはモデルだけで完結する存在ではなく、「メモリ階層全体を設計するシステム」へ変わり始めています。

「AI RAM」という新しい設計思想

この視点から見ると、Embeddingは単なる入力層ではありません。

AIにおける「RAM」と考える方が、その役割を正確に表現できます。

もちろん、現在のEmbeddingは一般的なRAMのように自由に書き換えられるものではなく、学習によって形成された静的な知識表現です。また、Conditional Memoryや外部メモリ研究もまだ発展途上にあります。そのため、「Embedding=RAM」と完全に同一視することはできません。

しかし、知識を高速に参照し、Transformerがその知識を利用して推論するという役割分担は、コンピュータにおけるCPUとRAMの関係に近づきつつあります。

この意味で、「AI RAM」という比喩は、現在の研究潮流を理解する上で有用な概念だと言えるでしょう。

Memory-Centric AIは「第四のスケーリング軸」なのか

2020年に提唱されたスケーリング則では、モデル性能は主としてパラメータ数、データ量、計算量との関係で整理されました。

しかし、LongCat 2.0が示した設計思想は、別の問いを投げかけています。

知識をどこへ配置するのか。

どのメモリ階層へ置くのか。

どれだけの容量を持たせるのか。

これらは、従来のスケーリング則では十分に説明されていません。

もちろん、現時点で「Memory」が第四のスケーリング軸であると断定することはできません。LongCat 2.0の性能向上には、MoEの設計変更、Sparse Attention、学習データ、ハードウェア最適化など複数の要因が同時に関与しており、Embedding巨大化だけの寄与を切り分ける独立検証もまだ十分ではありません。

それでも、2025年から2026年にかけて、DeepSeek Engram、Memory Grafting、LongCat 2.0など、知識をTransformer外へ移す研究が相次いで登場したことは偶然ではないでしょう。

もしこの流れが今後も続くなら、AI研究は「どれだけ計算するか」だけでなく、「知識をどのようなメモリ階層へ配置するか」を競う時代へ入る可能性があります。

コンピュータ史は繰り返される

LongCat 2.0が本当に歴史的転換点であるかどうかは、まだ判断できません。

巨大なEmbeddingがあらゆるタスクで有効なのか、コーディングやエージェント用途に限定された最適化なのか、あるいはメモリ帯域や学習コストとのトレードオフがどこまで許容されるのか。これらは今後の独立した検証を待つ必要があります。

しかし、少なくとも一つだけ確かなことがあります。

AIは再び、「計算機」を作ろうとしているのではありません。

「計算」と「記憶」を分離し、それらを最適な階層として統合する、新しいコンピュータアーキテクチャを設計し始めています。

Transformerの歴史は、コンピュータ史から独立した物語ではありません。

むしろ、CPU、キャッシュ、RAM、ストレージという半世紀にわたる設計思想を、AIという新しい舞台で再び描き直しているのです。

その意味で、LongCat 2.0は単なる大規模言語モデルではありません。

「AIはコンピュータ史を再発明し始めた」という時代の転換を象徴する、一つの重要なマイルストーンなのです。

第11部 記憶の彼方――Post-Memory時代と人間の未来

本書ではこれまで、Transformerを中心とする「計算の革命」から、Engram、Memory Grafting、LongCat 2.0、巨大n-gram Embeddingへと続く「記憶の革命」を追ってきた。

しかし、本書が本当に問いたいことは、AIがどのような構造へ進化するかだけではない。

AIが「覚える存在」になったとき、人間は何を覚え、何を忘れるべきなのか。

それこそが、Post-Memory時代最大の問いである。

本章では、2026年時点で見え始めた技術的潮流を基盤に、2035年頃までを視野に入れながら、記憶中心AIが社会・産業・人間文明へ与える影響を考察する。


第31章 記憶革命後のスケーリング則再々定義

31.1 第五軸の登場

Kaplanらが提示したスケーリング則は、

  • Data

  • Compute

  • Parameters

という三軸で整理されていた。

その後、

DeepSeek Engram

Microsoft Memory Grafting

Meituan LongCat 2.0

などによって、

Memory

という第四軸の重要性が急速に認識されるようになった。

しかし2030年代を考えるなら、それでも十分ではない。

次に追加される可能性が高い軸は、

Agency(主体性)

である。

つまり、

どれだけ記憶しているかではなく、

どれだけ自律的に目的を立て、計画し、実行できるか

が性能を左右する。

将来的には、

Performance ≈ f(Data, Compute, Parameters, Memory, Agency)

という五軸モデルが主流になる可能性がある。

記憶が豊富でも、

自ら探索できないAIは、

巨大な図書館を持つだけの存在に過ぎない。


31.2 Hybrid Architectureへの収束

2026年現在、

それぞれ独立して研究されている

  • MoE

  • Conditional Memory

  • Engram

  • Memory Grafting

  • Neuromorphic Computing

は、

長期的には一つのアーキテクチャへ収束すると考えられる。

その姿は、

高速演算層

巨大知識メモリ層

永続ストレージ層

という三層構造になる可能性が高い。

これはコンピュータ史で言えば、

CPU

RAM

SSD

という構造が完成したことと極めてよく似ている。

AIは独自の道を歩んでいるのではない。

コンピュータアーキテクチャ史を、

より巨大な規模で再演しているのである。


31.3 2035年の性能モデル

2035年頃には、

性能は単純なパラメータ数では説明できなくなる。

例えば概念的には、

Performance ∝ Memory^δ × Agency^γ

というモデルも考えられる。

もちろん、

δやγの値は今後の研究課題であり、

現時点では実証された法則ではない。

重要なのは、

性能向上の源泉が、

計算能力だけではなく、

記憶構造そのもの

へ移りつつあることである。


31.4 記憶過多という新しい限界

記憶は多ければ多いほど良いわけではない。

巨大Embeddingには、

未知の組み合わせへの汎化能力を弱める可能性がある。

巨大辞書は、

既知の世界には非常に強い。

しかし、

未知の世界では、

辞書そのものが足かせになる危険もある。

AIにも、

「忘れること」

が必要になる理由である。


第32章 脳型記憶とAIの融合地平

32.1 神経科学との再会

興味深いことに、

AI研究で使われるEngramという言葉は、

本来は神経科学における

「記憶痕跡」

を意味する。

偶然の一致ではない。

人間の脳も、

情報を均一に保存しているわけではない。

重要な記憶だけが強化され、

不要な記憶は薄れていく。

AIも同じ方向へ進み始めている。


32.2 BCIと外部記憶

Brain-Computer Interfaceが成熟すれば、

人間は思考だけで

巨大な外部記憶へアクセスする可能性がある。

そのとき重要なのは、

「全部覚えること」ではなく、

「必要なときに取り出せること」

になる。

人間自身も、

巨大Embeddingを利用する存在へ変わるかもしれない。


32.3 置き換えられない記憶

しかし、

創造性、

感情、

人格、

自己同一性は、

検索だけでは成立しない。

幼少期の記憶、

失敗の経験、

忘れられない風景。

それらは情報ではなく、

人生そのものである。

AIは知識を保存できても、

人生そのものを保存できるとは限らない。


32.4 倫理的境界

もしAIが人間の記憶を書き換えられるようになれば、

それは史上最大の権力になる。

「何を記録するか」

だけでなく、

「何を消すか」

も同じくらい重要になる。

未来のAI倫理は、

推論よりも、

記憶管理を中心に議論される可能性が高い。


第33章 忘却の哲学と「忘れる権利2.0」

33.1 AIは何を忘れるべきか

人間は、

忘れることで生きている。

もし全てを永久保存したなら、

脳は機能しなくなる。

AIも同様である。

将来のEviction Policyは、

アクセス頻度だけではなく、

社会的価値、

信頼性、

倫理性まで考慮する必要がある。


33.2 記憶半減期

すべての知識を永久保存する社会は、

変化できない社会でもある。

逆に、

すぐ忘れる社会は、

歴史を失う。

最適な記憶半減期は、

技術ではなく、

文明の問題である。


33.3 歴史は誰が保存するのか

Embedding巨大化は、

知識保存能力を飛躍的に高める。

しかし、

保存する知識を誰が決めるのか。

企業か。

国家か。

コミュニティか。

この問いは、

AI時代最大の民主主義の課題になる。


33.4 忘れる権利2.0

「忘れられる権利」は、

検索エンジン時代の概念だった。

AI時代には、

「モデルが忘れる権利」

へ拡張される必要がある。

個人データだけでなく、

Embedding、

外部メモリ、

知識辞書まで含めた新しい制度設計が求められる。


第34章 多文化・多言語記憶基盤

34.1 Embeddingの文化バイアス

巨大Embeddingは、

多くの場合、

英語中心に構築される。

その結果、

少数言語は表現力を失い、

文化そのものが希薄化する危険がある。


34.2 日本語というデジタル防壁

日本語特有の語彙、

慣用句、

歴史的表現をEmbeddingへ適切に保存することは、

単なる性能向上ではない。

文化保存でもある。

AI開発は、

文化政策にもなりつつある。


34.3 多様性保存型Embedding

未来のEmbeddingは、

巨大であるだけでは不十分である。

地域性、

文化、

時代背景を保持した

動的Embedding

への進化が必要になる。


34.4 多言語AIの未来

最終的には、

世界中の言語が

一つの意味空間で接続されながらも、

それぞれ固有性を維持する構造が理想となる。

巨大辞書は、

均質化の道具ではなく、

多様性を保存する図書館であるべきである。


第35章 経済・産業構造の再編

巨大Embeddingは、

半導体産業だけではなく、

メモリ産業、

CXL、

不揮発性メモリ、

ストレージ企業の価値まで変え始めている。

これまでGPU企業が中心だったAI産業は、

今後、

「記憶インフラ企業」

が新しい主役になる可能性がある。

知識は、

計算能力より重要な資産へ変わりつつある。


第36章 AI依存社会を生きる人間

AIが覚えてくれる社会では、

人間は何を学ぶべきなのか。

暗記ではない。

問いを立てる力、

他者と協働する力、

経験を意味へ変える力である。

教育は、

「覚える技術」だけでなく、

「忘れる技術」

も教える時代になる。


第37章 最終警告――記憶を支配する者が未来を支配する

20世紀は、

エネルギーを制した国が世界を動かした。

21世紀前半は、

計算能力を持つ企業がAIを支配した。

そして2030年代以降は、

記憶を管理する者

が文明の方向を決める可能性がある。

巨大Embedding、

Conditional Memory、

CXL、

Persistent Memory、

そしてAI RAM。

これらは単なる技術用語ではない。

未来の知識基盤そのものなのである。

LongCat 2.0は、

巨大Embeddingという設計を通じて、

Transformer中心だったAI史に新しい方向性を提示した。

その方向性が唯一の正解になるかどうかは、

まだ分からない。

Embedding巨大化の効果は、MoEや長文脈化、疎注意、ハードウェア最適化など他の設計要素と切り分けて検証する必要があり、タスクによっては期待した効果が得られない可能性もある。また、巨大な知識辞書は、メモリ帯域、学習効率、汎化能力、運用コストとの大きなトレードオフを伴う。

それでも一つだけ確かなことがある。

AIの未来は、

もはや「どれだけ計算できるか」だけでは決まらない。

何を記憶し、何を忘れ、誰がその記憶を管理するのか。

この問いこそが、

Post-Memory時代の文明を決定するのである。

第Ⅻ部 記憶文明の実装——Memory Fabricが再編するAIインフラ覇権

「計算能力はAIを動かした。記憶能力はAIを文明へ変える。」

第Ⅱ部では、本書は「記憶革命」の到来を論じた。LongCat 2.0、Engram、Memory Graftingなどは、モデル内部における記憶構造の進化を示していた。しかし、その議論だけではまだ半分しか語れていない。

2026年、AMDによるMEXT買収、CXLファブリックの普及、UALink連合の形成は、AIの競争がモデル内部だけではなく、データセンター全体を一つの巨大な記憶装置として再設計する時代へ入ったことを意味している。

LongCatが示したのは**「内部記憶革命」**である。

AMD/MEXTが示したのは**「外部記憶革命」**である。

そして両者が接続された瞬間、本書で提唱してきた「Memory-Centric AI」は、一つの統一理論として姿を現す。

本部では、この巨大な転換を「Memory Fabric文明」という視点から整理する。


第39章 Memory Fabric革命──計算から記憶インフラへ

39.1 FLOPS時代の終焉

AI業界は十年以上にわたり、

GPU性能=AI性能

という極めて単純な指標で発展してきた。

CUDA。

Tensor Core。

NVLink。

HBM。

すべてが「より速く計算する」ための技術であった。

しかし2025〜2026年頃から状況は変化する。

巨大モデルではGPU演算器は遊んでいるにもかかわらず、

  • KV Cache待ち

  • HBM待ち

  • PCIe待ち

  • SSD待ち

  • ネットワーク待ち

が全体性能を支配し始めた。

つまり、

GPUではなくMemoryが律速段階になったのである。

これはCPU史における

Memory Wall

がAIにも到来したことを意味する。


39.2 MEXTが意味するもの

AMDがMEXTを買収した理由は単純ではない。

目的はFlashを速くすることではない。

目的は

「メモリという概念を再定義すること」

である。

Predictive Memoryは

将来アクセスされるデータを予測する

ことで、

SSDを

「DRAMのように見せる」

技術である。

つまり、

速度差をソフトウェアで吸収する。

これは仮想メモリ以来最大級の発想転換である。


39.3 IBM System/360との歴史的対比

1960年代。

IBMは

物理メモリ

から

仮想メモリ

へ世界を変えた。

2026年。

AMD/MEXTは

物理メモリ

から

予測可能な記憶

へ移ろうとしている。

つまり、

Memoryは

「存在するもの」

ではなく

「将来必要になるもの」

へ変化したのである。


第40章 LongCatとMEXTが示す二つの記憶革命

40.1 内部記憶革命

LongCat 2.0は、

巨大Embedding

巨大N-gram辞書

長文脈処理

によって、

モデル内部の知識密度を飛躍的に高めた。

これは

Internal Memory Scaling

である。

知識そのものをモデル内部へ配置する発想だ。


40.2 外部記憶革命

一方、

AMDは

HBM

DDR

Flash

CXL

NVMe

を一体として扱う。

つまり

Memory Hierarchy全体を一つの巨大記憶空間へ統合する。

こちらは

External Memory Scaling

である。


40.3 二つの革命の合流

LongCat

モデル内部

AMD

データセンター全体

この二つが統合されることで、

AIは

「知識をどこへ置くか」

という問題へ移行する。

もはや

Parameter数ではない。

GPU数でもない。

知識配置そのものが性能になる。


図40-1 二重の記憶革命

LongCat
    │
Embedding
    │
Internal Memory
    │
────────────
Memory Fabric
────────────
    │
CXL
Flash
HBM
DDR
    │
AMD MEXT

第41章 Memory OSという新しいOS

41.1 GPU OSではない

LinuxはCPUを管理する。

CUDAはGPUを管理する。

しかしMemory Fabricでは

管理対象は

「Memory」

になる。

つまり

Memory OS

という概念が必要になる。


41.2 User Space Memory

MEXTが注目された理由は、

Kernelを介さない

Memory制御である。

これは

Storage IO

Network IO

Memory IO

の境界を消す。

結果として、

AI RuntimeそのものがOSになる。


41.3 Memory Scheduler

未来のSchedulerは

CPUを割り当てない。

GPUも割り当てない。

代わりに

どの知識を

どの階層へ

いつ置くか

を決定する。

つまり

Scheduling=Knowledge Placement

になる。


第42章 Memory Sovereignty──記憶主権の時代

42.1 Compute SovereigntyからMemory Sovereigntyへ

これまで国家は

GPUを奪い合っていた。

しかし今後重要になるのは

GPUではない。

どの国が

巨大知識辞書を持つか

どの国が

CXL Fabricを持つか

どの国が

文化Embeddingを保持するか

である。


42.2 日本語Embeddingという資産

日本語は英語よりも

形態素

文脈

敬語

省略

文化依存

が強い。

したがって

巨大Embedding辞書そのものが

国家資産になり得る。

これは

デジタル防壁

とも呼べる。


42.3 Memory Colonialism

もし巨大企業だけが

Embedding辞書を管理すれば、

文化は

辞書更新権

によって支配される。

つまり

植民地化されるのは

土地ではなく

記憶になる。


第43章 Memory Fabric Economics

43.1 FLOPS市場からMemory市場へ

これまで売られていたもの

GPU時間

これから売られるもの

Memory帯域

Memory容量

Memory配置アルゴリズム

Knowledge Cache


43.2 新しい企業群

2030年代には、

巨大GPUメーカーより

巨大Memory Infrastructure企業

の方が価値を持つ可能性がある。

例として、

  • CXLファブリック事業者

  • メモリオーケストレーションソフトウェア企業

  • 分散KVキャッシュ管理企業

  • 永続メモリ最適化企業

  • AIネイティブ・データベース企業

などが、新たなインフラ層を形成すると考えられる。


43.3 NVIDIA帝国は終わるのか

本書は

「NVIDIAは終わる」

とは言わない。

より正確には

GPU中心の帝国から、Memory Fabric中心の連邦へ移る

と考える。

NVIDIA自身もNVLinkやメモリ階層技術を進化させており、AMD・Intel・CXL陣営との競争は「演算性能」だけでなく、「記憶資源をどれだけ効率よく統治できるか」という軸へ広がっている。


第44章 Memory Fabric文明論

44.1 「覚える機械」から「配置する文明」へ

産業革命では

蒸気機関が

工場を変えた。

情報革命では

CPUが

計算を変えた。

AI革命では

Memory Fabricが

知識そのものを再配置する。

文明の競争軸は

演算ではない。

記憶である。


44.2 新しいスケーリング則

本書では、第Ⅺ部で

[
Performance \propto Compute^\alpha \times Parameters^\beta \times Memory^\delta
]

という拡張スケーリング則を提示した。

第Ⅻ部ではさらに、

[
Performance \propto Memory^{\delta}
\times Placement^{\eta}
\times Orchestration^{\theta}
]

という「Memory Fabricスケーリング則」を仮説として提案する。

ここで重要なのは、性能が単なるメモリ容量ではなく、「どこに配置し」「どのように協調させるか」によって左右されるという点である。


44.3 最後の問い

二十世紀は

計算機を作った。

二十一世紀前半は

知識を学習させた。

二十一世紀後半は、

「誰が何を記憶し、誰が何を忘れるか」

という問いが、技術だけでなく政治・経済・文化を規定する時代になるだろう。

Memory Fabricとは、単なるハードウェア技術ではない。それは、知識の保存、流通、忘却、そして主権をめぐる新しい文明基盤である。


参考文献(第Ⅻ部)

  • AMD, MEXT買収に関する公式発表・技術資料(2026)

  • CXL Consortium. CXL 3.x / 4.x Specifications

  • UALink Consortium関連資料

  • Meituan Research. LongCat 2.0 Technical Report (2026)

  • Patterson, D. らによるAIシステム・メモリ階層研究

  • IDC / Gartner AI Infrastructure Forecast(2026–2035)

  • Demis Hassabis et al. Neuroscience-Inspired Artificial Intelligence. Neuron (2017)

  • Paul Ricoeur. Memory, History, Forgetting (2004)

  • Luciano Floridi. The Ethics of Information (2013)

この第Ⅻ部は、第Ⅺ部で扱った「Post-Memory時代」の哲学を受け継ぎつつ、「Memory Fabric」という実装レイヤーから、AIインフラ・産業構造・地政学・文明論までを統合する締めくくりとして位置づけられます。

NVIDIA Nemotron-3-Embed-8Bとは

Nemotron-3-Embed-8Bは、NVIDIAが2026年7月に公開した大規模埋め込み(Embedding)モデルです。

チャットや文章生成ではなく、

  • RAG(Retrieval-Augmented Generation)

  • ベクトル検索

  • Semantic Search

  • Agent Memory

  • Enterprise Search

向けに設計されています。

公開直後にはMultilingual RTEB(Retrieval Text Embedding Benchmark)で総合1位となり、多言語Embedding分野の最新SOTA(State of the Art)モデルとして発表されました。 (Hugging Face)


基本仕様

項目内容
モデル名Nemotron-3-Embed-8B
開発元NVIDIA
公開2026年7月
パラメータ約80億(8B)
ベースモデルMinistral-3-8B-Instruct
アーキテクチャTransformer Encoder
最大コンテキスト32,768トークン
埋め込み次元4096次元(動的に縮小可能)
ライセンスOpenMDW 1.1(商用利用可)
対応言語34言語(日本語・英語・中国語・韓国語など) (Hugging Face)

最大の特徴

① RTEB世界1位

公開時点で

Multilingual RTEB Leaderboard 世界1位

になりました。

これは

  • OpenAI

  • BAAI

  • Cohere

  • Snowflake

などのEmbeddingモデルを上回る検索精度を示したことを意味します。 (Hugging Face)


② 34言語対応

日本語も含め

  • 日本語

  • 英語

  • 中国語

  • 韓国語

  • ドイツ語

  • フランス語

  • アラビア語

など34言語をサポートします。

そのため

日本語質問

↓

英語論文検索

のようなCross-lingual Retrievalにも向いています。 (Hugging Face)


③ 32Kコンテキスト

Embeddingモデルとしては珍しく

32,768トークン

まで入力できます。

つまり

  • 長い契約書

  • 技術マニュアル

  • 論文

を一度にEmbeddingできます。 (Hugging Face)


④ 動的Embeddingサイズ

通常は

4096次元ですが、

必要に応じて

  • 2048次元

  • 1024次元

へ切り詰めても高い性能を維持できるよう設計されています。

つまり

4096

↓

2048

↓

1024

と用途に応じて

容量を削減できます。 (Hugging Face)


推奨用途

特に適している用途は次のとおりです。

用途適性
Enterprise RAG★★★★★
Agent Memory★★★★★
Semantic Search★★★★★
FAQ検索★★★★★
法律文書検索★★★★★
論文検索★★★★★
コード検索★★★★☆

他モデルとの比較

モデル規模特徴
OpenAI text-embedding-3-largeAPI高性能だがクラウド専用
BGE-M3約600M軽量・多用途
Qwen3 Embedding約4B日本語に強い
Gemini EmbeddingAPIGoogle統合向け
Nemotron-3-Embed-8B8B多言語RAG・検索性能を重視した最高性能クラス (Hugging Face)

AI史における意義

Nemotron-3-Embed-8Bの意義は、「生成AI」の性能向上ではなく、RAG・検索基盤の品質向上にあります。

年代出来事意義
2019SBERTSentence Embeddingの普及
2022OpenAI EmbeddingsAPIベースRAGの普及
2023BGE・E5オープンソースEmbedding競争
2024BGE-M3多言語・長文Embeddingの進展
2026Nemotron-3-Embed-8B大規模・多言語EmbeddingでRTEB首位を獲得し、高品質RAGの新たな基準を提示 (Hugging Face)

あなたの研究テーマとの関係

あなたがこれまで扱ってきたAI制御平面(Control Plane)Task Graph、エージェント基盤では、LLM本体だけでなく検索品質がシステム全体の性能を左右します。

その観点では、Nemotron-3-Embed-8Bは「より賢いチャットボット」を作るモデルではなく、AIエージェントの知識検索・記憶・RAG品質を底上げする基盤技術として重要な位置づけになるモデルと言えます。

あなたの記事で論じられているLongCat 2.0と、NVIDIAのNemotron-3-Embed-8Bは、一見どちらも「Embedding」を扱っていますが、解決しようとしている問題が根本的に異なります

比較項目LongCat 2.0Nemotron-3-Embed-8B
開発元MeituanNVIDIA
主目的LLMの知識記憶を拡張RAG・検索精度を向上
Embedding対象n-gram・知識辞書文・段落・文書
Transformerとの関係一部をEmbedding辞書へ置き換えるTransformerの前処理・外部検索
推論時Embeddingを直接参照ベクトル検索で文書取得
解決課題パラメータ効率・知識容量Retrieval精度・多言語検索

LongCat 2.0の思想

あなたの記事が強調している最大のポイントは、

「Transformerが知識を全部覚える必要はない」

という発想です。

LongCat 2.0では

Token

↓

n-gram

↓

Embedding辞書

↓

Transformer

となります。

つまり

Transformerは

  • 推論

  • 推理

  • 合成

だけ担当し、

知識は巨大Embedding辞書へ逃がします。

これは記事で述べられている

Memory-centric AI

そのものです。


Nemotronの思想

Nemotron-3-Embed-8Bは

全く逆で

Transformerは変えません。

代わりに

質問

↓

Embedding

↓

Vector DB

↓

文書取得

↓

LLM

です。

つまり

RAG専用

です。

Embeddingは

外部検索のためにあります。


根本的な違い

LongCatでは

Embeddingが

モデル内部

にあります。

Embedding Dictionary

↓

Transformer

Nemotronでは

Embeddingは

モデル外部

です。

Vector DB

↓

LLM

この違いは非常に大きいです。


AI史で比較すると

時代代表知識の保存場所
GPT-3Transformerパラメータ
RAGOpenAI Embedding外部DB
LongCat 2.0n-gram EmbeddingEmbedding辞書
NemotronEmbed-8B検索インデックス

LongCatは

Transformerの知識保存方法

を変えています。

Nemotronは

検索性能

を改善しています。


あなたの記事との対応

あなたの記事では

Transformer

↓

Embedding Memory

↓

CXL Memory

↓

巨大知識辞書

という流れが描かれています。

ここではEmbeddingは

モデルそのもの

です。

Nemotronでは

Embeddingは

検索するためのベクトルです。

つまり

役割が違います。


むしろ比較すべき相手

LongCat 2.0の比較対象として適切なのはNemotronではなく、

  • Google RETRO(Retrieval-Enhanced Transformer)

  • DeepMind Memorizing Transformer

  • Meta Memory Layers

  • Microsoft Knowledge-Augmented LLM

  • NVIDIA Dynamo Memory(推論キャッシュ)

  • Kimi K2/K3の長文メモリアーキテクチャ

といった**「Transformerの記憶機構そのものを拡張・置換する研究」**です。

一方、Nemotron-3-Embed-8Bは

  • BGE-M3

  • Qwen3-Embedding

  • OpenAI text-embedding-3

  • Cohere Embed

などと比較されるべきEmbeddingモデルです。


あなたの記事に書き足すと面白い視点

あなたの記事ではLongCatを**「Embedding知識辞書への移行」として位置付けていますが、Nemotron-3-Embed-8Bとの比較を加えることで、Embeddingという言葉が二つの異なる潮流**を指していることを明確にできます。

Embeddingの役割LongCat 2.0Nemotron-3-Embed-8B
目的知識そのものを保存する知識を検索する
位置モデル内部(知識メモリ)モデル外部(検索インデックス)
Transformerとの関係Transformerの記憶を補完・置換Transformerへの入力を改善
AI史での位置付けMemory-centric AIへの転換高性能RAG・検索基盤の成熟

この対比を入れると、読者は「Embedding」という同じ用語でも、「記憶(Memory)」と「検索(Retrieval)」という異なる進化方向が存在することを理解しやすくなります。

コメント

このブログの人気の投稿

#Brexitが英国企業を揺るがす:従業員15.7%削減の衝撃と、北アイルランドが生き残った「禁断の果実」#Brexit #2016六23Brexit_平成英国史ざっくり解説 #労働市場 #イノベーション 🇬🇧📉💡 #五29

Too Big To Fork:AI時代のLinuxとデジタル公共財の終焉 #TooBigToFork #Linux #AI #七18 #1991九17LinuxとOSSプロジェクト_平成IT史ざっくり解説

#INVIDIOUSを用いて広告なしにyoutubeをみる方法 #士17 #2018INVIDIOUSとOmarRoth_令和IT史ざっくり解説