📜 papers
2026-08-24 · 5 topics
PLC コード生成向けエージェントハーネス SemaPLC──動的検証により実行トレース一致率 52.2% を達成
🔥🔥プロジェクト文脈における PLC コード生成において、厳格な外部検証ゲートと実行時トレース比較を導入し、動的検証スコアでベースラインの最大 31.4 から 52.2 へ大幅に向上させた。
動画生成のタスク完了能力を評価する SemComp-Bench を公開──6ドメインでの実証結果を報告
🔥🔥動画生成モデルのタスク遂行能力を評価するため、Outcome Achievement と Generation Reliability を測定する SemComp-Bench と 6 ドメインのデータセットを構築した。
LLMの自己進化を実現する強化学習枠組み SPADE──環境自動生成でベンチマーク精度を最大 13.9pt 向上
🔥🔥単一のLLMが環境デザイナーと推論エージェントの2役を担い、報酬ギャップを用いて自律的に学習環境を適応させることで、既存の固定環境を大きく上回る性能を実証した。
化学的妥当性を考慮した大規模言語モデル C3LM による単段階逆合成予測──OOD URSA-expert-2026 で SOTA を達成
🔥🔥45.6百万件の検証済み反応データセットと Top-K プロンプティングにより、化学的妥当性と多様な反応予測を両立させた。
Zetta ζ: 3重のタイムスケールで動作する物理知能向けクローズド・ループハーネス──LIBERO-Proで 90.8% を達成しつつ 11.1 倍の推速化を実現
🔥🔥ベースポリシーを凍結したまま、コードベースの実行時批評とリカバリスキルをオンラインで進化させることで、物理インタラクション中の動的適応と高い成功率を両立した。