humans&、550B パラメータの人間模倣モデル Persimmon を公開──AI 検出器を人間並みに欺くグループチャットシミュレータ
NVIDIA Nemotron 3 Ultra 550B をベースに RL と敵対的学習を適用し、従来のアシスタント型モデルが持つ会話の均質性と過剰な情報開示の癖を克服した。
リリース: 2026-09-10 · 読了 4 分記事の要約
1. 核心(What)
- humans& が 5500 億パラメータの人間模倣モデル「Persimmon」を研究プレビューとして公開
- マルチユーザ・チューリングテスト(LLM ジャッジによる識別)で約 20% の欺瞞率を記録し、従来型アシスタントの 3% 未満を圧倒
- AI 検出器 Pangram による判定で、人間と同等水準の 2.3% の検出率を達成
- NVIDIA Nemotron 3 Ultra 550B を初期化モデルとし、アダプティブ・ディスクリミネータを用いた RL で事後学習
2. 影響(Why)
- エージェント評価の歪みを解消: カスタマーサポートや交渉エージェントの検証で従来のアシスタントモデルを疑似ユーザに使うと、応答のばらつきが少なすぎて過剰適合するため、実環境での検証精度が大幅に向上する。
- 国内 SaaS のシミュレーション検証への波及: コールセンター業務や対話型 AI を開発する国内のコンタクトセンター・SaaS 事業者は、プロンプト指示による簡易なユーザ役から、実際の人間らしい揺らぎを持つモデルベースの評価基盤へ切り替える動機が生じる。
3. 根拠・詳細(How)
- 敵対的学習による長文脈一貫性の補正: 単純な次トークン予測の誤差蓄積を防ぐため、モデル自身の生成データを訓練データとする GAN ライクな目的関数で事後学習を実施し、会話全体のダイナミクスを最適化。
- Trickle Test における情報開示精度の向上: 参照トランスクリプトと同じペースで情報を開示するかを測る Trickle Test で 43 モデル中最高となる 88.5% の精度を記録し、初手での過剰な情報吐き出しを抑制。
4. 展望・課題(Next)
- 悪用防止のためのガードレールとアクセス制御: なりすましや悪意ある操作への転用を防ぐため、API とプレイグラウンドへのアクセスは厳格に事前審査される方式を採用。