エレファントな解法の技術史
# エグゼクティブサマリ 近年のAI研究は、 エレファントな解法 (大量の計算資源とデータに依存する「力技」)によって飛躍的に進展した。本レポートではその定義・起源から始め、大規模モデルの スケーリング則 、2012年以降の主要モデル年表、 経済・インフラ 的要因、 技術的限界と代替手法 、 倫理・社会的影響 まで幅広く分析する。例えば、OpenAIらが示したスケーリング則ではパラメータ数 \(N\)、データ量 \(D\)、計算量 \(C\) と性能(損失)の間に べき乗則 が見出され、倍精度モデルではパラメータを倍増させると損失が約1.13倍に減少する。一方、DeepMindの計算最適化(Chinchilla)研究では、計算量に対してパラメータ・データの増やし方はほぼ均等(\(N\propto C^{0.5}\), \(D\propto C^{0.5}\))とされ、実際に70Bモデルで優位性を示した。 年表では、2012年のAlexNet(60Mパラメータ)から2023年のPaLM(540B)・GPT-4・Geminiに至るモデルを網羅し、設計・パラメータ数・訓練データ量・計算量・成果を整理する。経済面では、GPU/TPUなど専用ハードウェアの調達・運用コスト、膨大なデータ収集・クリーニング費用、冷却・電力コスト、クラウド対自社インフラのコスト比較を分析する。Cottierらは「最前線モデルのトレーニング費用は年率2.4倍で増加し、2027年には1回あたり10億ドル超に達する」と予測しており、実際GPT-4は~4千万ドル、Gemini Ultra 3千万ドルと見積もられている。こうした巨額コストは資本力のある大手企業に研究を集中させる一因となっている。 ただし純粋なスケーリングには限界もある。 MoE (混合専門家アーキテクチャ)や 知識蒸留 、量子化など効率化手法、 Test-Time Scaling や Control Plane (動的モジュール呼び出し)などが提案されており、メリット・課題を比較する表とフローチャートを示す。また、 倫理・社会面 として、リソース集中・研究アクセス格差、環境負荷(GPT-4訓練に50GWh・約1.2万トンCO₂消費)、軍事利...