📜 papers
2026-09-25 · 5 topics
Tencent Hunyuan Team、総パラメータ数 80B で推論時活性化 13B の MoE 言語モデル Hunyuan-A13B を公開
🔥🔥🔥20T トークンでの事前学習とデュアルモード CoT により、大規模モデルに匹敵する推論能力と高いスループットを両立させたオープンソース LLM。
LLM のハルシネーション検出・訂正に向けた幾何学的不確実性評価フレームワーク
🔥🔥回答埋め込み空間上でプロンプト条件付きセマンティック分布を幾何学的にモデル化し、医療データセット等で従来手法を上回るハルシネーション検出・訂正性能を実証。
LLM の不確実性を軽量蒸留する Semantic Self-Distillation──サンプリング不要でハルシネーションを予測
🔥🔥大規模言語モデルのセマンティック分布を軽量な学生モデルに蒸留し、サンプリングを伴わずにプロンプトレベルの不確実性と回答の信頼性を高効率に評価する手法を提案する。
全米郡別統計とピクセル観測を統合する弱教師あり農業収量予測ベンチマーク AgroBench
🔥🔥USDA の郡別収量統計と Sentinel 衛星データから生成した 1,300 万超の観測値を含むマルチモーダル農業ベンチマーク。
ローカル学習の深度ロバスト性を高めるスペクトル更新手法──深さ48層での崩壊を防ぎ精度42.7%を達成
🔥🔥各層の局所学習に Muon 型スペクトル更新幾何を適用し、深さ 48 層における勾配伝播の課題を克服してハイパーパラメータの汎用性を向上させた。