個人開発者、小規模モデルアーキテクチャで ARC-AGI-1 44% を達成──学習時間 1.5 時間・コスト 67 セント
小規模 Transformer を用いたメタ学習アプローチにより、学習コストを大幅に抑えつつ多くの商用 LLM を凌駕するスコアを実証した。
リリース: 2026-01-01 · 読了 3 分記事の要約
1. 核心(What)
- RTX 5090 GPUを1基使用し、1.5時間・0.67ドルの学習コストで ARC-AGI-1 ベンチマークスコア 44% を達成した。
- 入力トークンの学習を廃止し、出力トークンのみを対象とする教師あり学習に切り替えることでスコアが 40% から 44% へ向上した。
- 8層の Transformer 構成を採用し、SwiGlu、RMSNorm、3D RoPE、NorMuon オプティマイザを組み合わせてサンプル効率を最大化した。
2. 影響(Why)
- 数万ドルの検証コストを数ドルに圧縮: 1回 1 ドル未満で小規模モデルの学習ループを回せるため、国内の自社専用モデル開発チームは、クラウド GPU 予算を気にせずアーキテクチャの高速な試行錯誤が可能になる。
- メタ学習における前提の再検証: 莫大な事前学習データや複雑な合成データに依存せずとも、適切な表現学習とアーキテクチャ設計によってサンプル効率の限界を突破できることを示している。
3. 根拠・詳細(How)
- 3D RoPE とタスク別埋め込みによる位置情報処理: 各パズルの2Dグリッド構造に対し、3D RoPE 埋め込みと学習可能なタスク別加算埋め込みを適用することで、クロス・タスク学習を安定化させている。
- NorMuon オプティマイザとフラッシュアテンションの統合: AdamW から NorMuon への移行により収束性を高め、vLLM 環境下での可変長トレーニングとフレックスアテンションカーネルを組み合わせて推論コストを抑制した。
4. 展望・課題(Next)
- スコア 65% に向けたアーキテクチャ拡張: データ拡張の完全な排除や、位置エンコーディングのさらなるモダナイズを通じて、追加の合成データに頼らずに 65% の達成を目指す。