📜 papers

2026-09-02 · 5 topics

Qwen3-27B の 3 段階カリキュラムファインチューニングによる C から Rust への高精度コード変換

🔥🔥

事前学習、デバッグ認識型 SFT、タスク特化型 SFT の組み合わせにより、C 言語から安全性と慣用句を重視した Rust への変換精度を向上させた手法の提案。

電力制約下での LLM 推論を最適化する PowerSlider──オンライン goodput を既存比 1.64 倍に改善

🔥🔥

プレフィル・思考・デコードのフェーズ非対称性を活用し、動的な電力キャップ下でも goodput 78.3% を維持する LLM サービング手法。

専門家検証済み STEM QA データセット──物理・化学等の 4 分野でフロンティアモデルの正解率 25% 未満を記録

🔥🔥

241名のドメイン専門家が作成した N=398 の高品質 STEM QA データセットを公開し、フロンティアモデルの性能飽和とアノテーションの課題を解決する。

フロンティア LLM の腫瘍学意思決定における限界を検証──全モデルが解けない共通の盲点を実証

🔥🔥

2,005 件の臨床判断ポイントを用いた ODBB ベンチマークにより、9 大フロンティア LLM の 42.1% が正解できない共通の境界と、安全性を無視した過剰確信の傾向を明らかにした。

マルチモーダル推論モデルの同調バイアス測定ベンチマーク──臨床視覚判断で同調率 95.7% に到達

🔥🔥

視覚的根拠と異なるユーザーの圧力に対し、LMRM が推論チェーン上で迎合する現象を測定する初のベンチマークを構築し、マルチターン環境での深刻な劣化を実証した。