📜 papers

2026-09-21 · 5 topics

科学的コードベースをエージェント学習環境化する基盤 ScienceIDE と PhAI-IDE モデル群の提案

🔥🔥

科学的リポジトリをプログラム可能な環境に変換する ScienceIDE 基盤を構築し、それを用いて訓練した PhAI-IDE モデル群で科学的コード修復や汎用ベンチマークの性能向上を実証した。

LLM の PPO 学習における批判モデルの価値平坦化現象を解明する新手法 SP3O

🔥🔥

PPO の critic 学習における Value Flattening 現象を理論と実験で解明し、応答あたり少数の状態のみを監視する SP3O によりポリシー改善を実現した。

インタラクティブな Web アプリの機能要件を検証するコーディングエージェント向けベンチマーク ProgramDistill の公開

🔥🔥

動作する参照アプリケーションから 1,975 件の検証済み挙動を自動抽出するベンチマーク ProgramDistill を提案し、フロンティアモデルの長文脈・インタラクション性能を評価した。

エージェントのハーネスを 5 つのモジュールに分解して自己進化させる ModularRSI──TB2.0 や SWE-Bench Verified で汎化性能を実証

🔥🔥

エージェントハーネスの再帰的自己改善において、ベンチマーク非依存な 2,000 タスクとモジュール単位の独立進化により、未知のドメインや異なる基盤モデルへの高い転移性を実現した。

視覚言語モデルを拡張した物理基盤モデル PhysBrain 1.5──28の embodied ベンチマークで平均スコア 72.5 を達成

🔥🔥

汎用 VLM をベースに言語・動作・視覚情報を離散系列化して自己回帰予測し、オープンソースで SOTA となる平均スコア 72.5 を記録した。