Epoch AI、家具組立評価ベンチマーク FAB 公開──GPT-6 Astra が正答率 80% を記録
IKEAの組立マニュアルと施工写真を比較するFABベンチマークにおいて、GPT-6 Astraが10ヶ月で最高スコアを28%から80%へ引き上げた。
リリース: 2026-09-23 · 読了 3 分記事の要約
1. 核心(What)
- Epoch AIがFurniture Assembly Benchmark (FAB)を公開し、誤りを含む60枚の半組立家具写真を対象にマルチモーダルモデルを評価した。
- GPT-6 Astraが10ヶ月で最高正答率を28%から80%へ更新し、中央値3分で処理を完了した。
- GeminiやQwen系モデルは過剰検知(False Positive)を起こしやすく、初期のGPTやClaudeは誤りを見落としやすい傾向が確認された。
- Kimi K3などのオープンウェイトモデルは、フロンティアモデルに対して7ヶ月遅れの性能水準にある。
2. 影響(Why)
- 実世界推論の新たな評価基準: 単純なVQAや文書解析では測れない、物理的オブジェクトの空間的整合性や手順の妥当性を検証できるため、実務的なビジョンエージェントの選定基準が変わる。
- 国内製造業のシステム要件: [国内のFA・製造業向け受託開発企業] は、単なる認識精度だけでなく、見落としを防ぐ感度(Sensitivity)を優先したモデル評価の導入が求められる。
3. 根拠・詳細(How)
- エージェント型サンドボックスによる検証手順: 各評価においてモデルは写真、PDFマニュアル、拡大用ツール、Pythonインプリターを受け取り、エージェント型サンドボックス内で最大80ステップを実行する。
- LLMジャッジによる評価機構: GPT-5.6 Solを審査員として用い、誤りの記述が適切かどうかを寛容な基準で判定する仕組みを採用している。
4. 展望・課題(Next)
- 多様な環境への適応検証: FABは1社の製品による60枚の写真に限定されているため、今後は異なる照明条件やユーザー生成画像に対する検証が必要となる。