Anthropic、Fable 5 の生物学関連セーフティ制限を 85% 削減──誤検知による過剰ブロックを修正
安全性の過剰反応で日常的な医療・生物学の質問まで迂回させていた安全分類器を再学習させ、フォールバック頻度を最大 67% 削減した。
リリース: 2026-08-07 · 読了 3 分記事の要約
1. 核心(What)
- Anthropic は Fable 5 の生物学に関する安全分類器を再学習させ、生物学関連のフォールバックを全プロダクトサーフェスで 85% 削減した。
- ラボの結果や症状、基礎生物学などの日常的な健康に関する質問は、Opus 5 への迂回を取りやめ Fable 5 が直接処理するように変更された。
- ウイルス学や毒物学などのデュアルユース(軍民両用)トピックは一般ユーザーに対して引き続きブロックされ、専門研究者は信頼済みアクセスを申請する必要がある。
- カテゴリ全体のフォールバック発生率は、Claude.ai で約 67% 減、Cowork で約 55% 減、Claude Code で約 17% 減、API で約 7% 減となった。
2. 影響(Why)
- 医療・科学系プロンプトの過剰反応が解消: mRNA ワクチンやがん治療といった日常的な医学的質問でも下位モデルへ迂回していた挙動が改善され、Fable 5 本来の推論性能をそのまま引き出せるようになった。
- 国内ヘルスケア SaaS への導入ハードル低下: 医療・バイオ領域を扱う国内 SaaS 企業は、安全フィルターの誤検知によって API 応答が別モデルにすり替わるリスクが低下し、本番環境での予測可能性が向上する。
3. 根拠・詳細(How)
- 分類器憲章の全面書き換えとデータ再構築: Anthropic は安全分類器をゼロから再構築し、専門家のフィードバックを基に新たなトレーニングデータを収集してモデルを再学習させた。
4. 展望・課題(Next)
- 専門研究者向けアクセスの運用監視: デュアルユース領域における信頼済みアクセスの申請プロセスと、不正利用を防ぐための追加監視体制の運用が継続される。