Liquid AI と Insilico Medicine、老化研究モデル LFM2-Longevity を Hugging Face で公開──GPT-5 や Claude を凌駕する性能
1.2Bおよび2.6Bパラメータの小型モデルながら、17のタスクで構成される LongevityBench において大規模汎用モデルを凌駕する老化予測精度を達成し、院内オンプレミス運用を可能にした。
リリース: 2026-09-17 · 読了 3 分記事の要約
1. 核心(What)
- Liquid AI と Insilico Medicine が、Hugging Face にて LFM2-2.6B-Longevity と LFM2-1.2B-Longevity の 2 つのコンパクト言語モデルを公開した。
- 臨床、メチル化、トランスクリプトミクス、プロテオミクス、遺伝子データの 5 つの生物学的レイヤーを横断する 17 タスク・25,457 プロンプトからなる LongevityBench が同時リリースされた。
- LFM2-2.6B は NHANES の対年齢予測で 1 位、マスクされた OpenGenes でトップ 2 にランクインし、GPT-5 や Gemini-3.1-Pro などの大規模汎用モデルを上回る性能を示した。
- 学習には 32k コンテキストを用いた 3 エポックのフルパラメータ SFT(教師ありファインチューニング)が採用され、チャットミックス変種の結合が行われている。
2. 影響(Why)
- 機密性の高い医療データのオンプレミス処理: 患者の臨床・ゲノムデータを外部 API に出せない厳格な病院や製薬企業のインフラにおいて、bfloat16 で最大 5.2GB の軽量モデルをローカルサーバーに完結させられるため、実用化のハードルが大きく下がる。
- 国内バイオ研究・医療 SaaS への実装設計: 国内の医療 AI や創薬支援を手がけるバイオテック・受託解析企業(規模感としては数十人規模の専門チーム)は、大規模 API 依存から脱却し、単一 GPU で動作する専用ドメインモデルを自社パイプラインへ組み込む選択肢が現実的になる。
- マルチモーダル生物データの単一テキスト化: 構造化された臨床記録からオミクスデータまでを統一されたテキスト形式で処理できるため、従来はデータ種別ごとにバラバラだった解析パイプラインのコードベースを 1 つのモデルインターフェースに集約できる。
3. 根拠・詳細(How)
- モデルアーキテクチャと学習の仕様: LFM2 アーキテクチャは乗算ゲートとショートコンボリューションを組み合わせ、32,768 トークンのコンテキストウィンドウをサポート。純粋なドメインデータ、10% および 20% の一般チャットデータを混ぜた 3 つのバリエーションをフルパラメータで 3 エポック学習させ、等重み線形マージで統合している。
- 推論時のメモリと実行要件: bfloat16 精度での生ウェイトは 1.2B モデルで約 2.4GB、2.6B モデルで約 5.2GB を消費。vLLM、SGLang、llama.cpp、MLX、LM Studio などのローカルランタイムに対応し、ChatML 形式のテンプレートで thinking モードの制御が可能。
4. 展望・課題(Next)
- 臨床現場導入に向けた追加検証の課題: リーダーボードのスコアだけでは実際の診断や治療現場への導入は難しく、今後はキャリブレーション、公平性、サブグループごとの性能評価、および因果関係の検証が必要となる。