📜Papers🔥🔥

機械学習エンジニアリングの再帰的自己改善を実現する 35B モデル Frontis-MA1──MLE-Bench Lite で 71.21% を記録

オープンなフルスタック環境 OpenMLE と Frontis-MA1 により、MLE-Bench Lite のメダル獲得率をベースモデル比 21.22pt 向上させ GPT-5.5 + Codex を超える性能を実証。
リリース: 2026-07-30 · 読了 5

論文概要

機械学習エンジニアリング(MLE)のプロセス自体を自動化し改善する「AI4AI」システムにおいて、再帰的自己改善(Recursive Self-Improvement: RSI)の検証を行うオープンフルスタックシステム「OpenMLE」と、35B パラメータのメタ進化エージェントモデル「Frontis-MA1」が提案された。検証環境 OpenMLE-Gym、演算子学習 OpenMLE-RL、長文脈探索 OpenMLE-Evo を統合し、MLE-Bench Lite においてベースモデルのメダル獲得率 39.39% から、OpenMLE-Evo 適用で 60.61%、OpenMLE-Evo-Max 適用で 71.21% へ向上したことを報告している。

Figure 2: OpenMLEのトレーニングおよび推論ワークフローの全体概要図。

関連研究

コード生成やソフトウェア工学向けの自動化エージェント(例: GPT-5.5 + Codex や各種基盤モデル)の発展が見られる一方で、機械学習のパイプライン構築やモデル改善といった「機械学習エンジニアリング」のドメインに特化した閉ループでの再帰的自己改善の検証は十分に体系化されていなかった。本研究は、実行フィードバックを伴う検証環境と、アトミックなプログラム進化演算子を組み合わせた点が先行研究と異なる。

新規性と貢献

主要な貢献は、AI4AI のためのオープンなフルスタック実装(OpenMLE)と、4つの原子プログラム進化演算子(Draft, Improve, Debug, Crossover)を中心に据えた学習・推論アライメント手法にある。データ重複排除を徹底した評価ベンチマークにおいて、RTX 4090(12GB VRAM制限、1タスク12時間制限)という現実的なハードウェア制約下で高い性能向上を実証した。

Figure 1: MLE-Bench Liteにおける各モデルのハーネス結果とパレートパネルの比較。

提案手法の詳細

Frontis-MA1(35B)は、4つのアトミック進化演算子(Draft, Improve, Debug, Crossover)を軸にポストトレーニングされている。なぜこの4つに絞ったかというと、プログラムの生成から修正、改善、交差というソフトウェア工学の最小単位をカバーすることで、長文脈探索(OpenMLE-Evo)における学習と進化のループを安定させるためである。これらを実行グラウンデッドな SFT(教師あり微調整)および RL(強化学習)で訓練している。

評価・考察

MLE-Bench Lite において、ベースモデルが 39.39% であったメダル平均獲得率が、OpenMLE-Evo によって 60.61% に向上した。さらにベンチマーク非依存のエクスペリエンスプライアと非同期探索を組み合わせた OpenMLE-Evo-Max により 71.21% に達し、GPT-5.5 + Codex を超え、GPT-5.6 Sol や 2.8T パラメータの Kimi K3 に迫る性能を示した。また、NatureBench Lite でもモデルとフレームワークの置換により Match-SOTA が 20% から 70% に向上し、手法の汎用性が確認されている。

Figure 3: MLE-Bench LiteにおけるFrontis-MA1や各種ベースラインモデルの結果比較を表す表。

応用例と今後の展望

国内のAI・機械学習受託開発企業やテックリードにとって、ローカルの単一 GPU(RTX 4090 等)環境でも実用的なチューニング・実験自動化パイプラインを構築できる可能性を示している。今後はより多様な実世界タスクへの適応と、推論コストのさらなる最適化が課題となる。

結論

Frontis-MA1 と OpenMLE のオープンソース化により、機械学習エンジニアリングにおける再帰的自己改善の研究の再現性と発展性が大きく加速することが期待される。

注釈

  • 再帰的自己改善 (Recursive Self-Improvement: RSI): AI自身が自らの能力や性能を向上させる仕組みを作り出し、それを繰り返すことで指数関数的にシステムが賢くなっていくパラダイム。