🧠Research🔥🔥

Anthropic、Claude の安全ガードレール発動リクエストに対する課金ポリシーを発表──生物・蒸留・最先端開発の 3 分野が対象

安全フィルターでブロックされた入力トークンに対し、生物安全性・モデル蒸留・最先端開発の 3 カテゴリで課金を開始し、自動化されたプロビングやジェイルブレイクのコストを引き上げる。
リリース: 2026-09-24 · 読了 3 分

記事の要約

1. 核心(What)

  • Anthropic はバイオロジー安全性、モデル蒸留攻撃、最先端 LLM 開発の 3 つのカテゴリにおいて、安全フィルターでブロックされた事前出力リクエストの入力トークン課金を開始する。
  • テスト環境において Claude Code、Claude.ai、Cowork アカウントの 99.7% が影響を受けるブロックに該当しなかったことが示されている。
  • 拒否された応答は HTTP ステータス 200 で返され、stop_reason: "refusal" および stop_details.category が含まれる構造に維持される。
  • 開発者はサーバー側の fallback 構成や SDK ミドルウェアを利用して、拒否されたリクエストを推奨モデルに自動リトライさせることが可能である。

2. 影響(Why)

  • 自動プロビングコストの引き上げ: 無償だった拒否リクエストを有償化することで、モデル抽出や自動ジェイルブレイクを実行する攻撃者のインフラコストを高め、システムの乱用を防ぐ防御層として機能させる。
  • 国内 SaaS の例外コスト管理: [国内 AI アプリ開発・SaaS 業種] のように Claude を大規模に組み込む企業では、分類器の偽陽性(0.1% 未満)による偶発的な課金が運用コストを圧迫するため、リクエスト単位の厳密なログ監査とフォールバック制御が不可欠となる。

3. 根拠・詳細(How)

  • 分類器カテゴリと HTTP 200 の仕様: 事前出力拒否時は HTTP 200 を返し、stop_reason: "refusal"、stop_details.category、および input_tokens の使用量が返却される仕様となっており、出力トークンは 0 となる。
  • サーバー側フォールバックと SDK 連携: サーバー側フォールバック機能や SDK ミドルウェアを使用し、fallback="default" と server-side-fallback-2026-07-01 ベータヘッダーを付与することで、拒否リクエストを推奨モデルへ自動リトライできる。

4. 展望・課題(Next)

  • 正式な適用日と請求項目の明確化: 記事発表時点では具体的な適用開始日は未公開であり、フォールバック成功時の請求項目の整合性に関する詳細の開示が待たれる。