Mininglamp Technology、視覚モデル VisionHOPE をオープンソースで公開──ImageNet-1K で DeiT や Vim を上回る精度を達成
推論時に 5 つのメモリと学習則を共進化させることで、トークン数に対する線形計算量を維持しつつ高解像度画像での認識精度を高めた。
リリース: 2026-10-04 · 読了 3 分記事の要約
1. 核心(What)
- Mininglamp Technology や中国科学院自動化研究所などの研究チームが、推論時に動的メモリが共進化するオープンソースの視覚モデル VisionHOPE を公開した。
- ImageNet-1K ベンチマークの Tiny/Small/Base 各サイズでそれぞれ 84.1/85.2/85.6 の Top-1 精度を記録している。
- 従来の Vision Transformers や State-Space Models と異なり、コンテンツや学習率など 5 つのメモリが入力ごとに動的に変化する機構を採用した。
- MIT ライセンスの下で重みとコードが提供され、COCO や ADE20K を含む複数のタスクで検証されている。
2. 影響(Why)
- 高解像度処理の新しい選択肢: 長文脈処理で進む線形スケーリングの利点をビジョン領域にも持ち込むことで、高解像度画像を扱うプロダクトで計算コストと精度のトレードオフを再設計できる。
- 国内マルチモーダル基盤への波及: 画像認識モデルの開発を自前で行う国内のコンピュータービジョン関連企業は、重みが MIT ライセンスで公開された本アーキテクチャをベースラインとして検証する価値がある。
3. 根拠・詳細(How)
- 5 つのメモリによるデルタ則更新: コンテンツ・キー・バリュー・学習率・保持率の 5 つの小規模行列を定義し、予測値とターゲット値の差分を用いたデルタ則によってトークンごとに状態を調整する。
- 非発散を保証する制約機構: ソフトインジェクションキャップとスペクトルクランプを適用することにより、自己言及的な重み更新が非発散かつ安定するように数学的に制御されている。
- A100 GPU での線形スケーリング検証: A100 環境でのベンチマークにおいて、DeiT や Vim などの既存アーキテクチャと比較し、トークン数に対してメモリと計算量が線形にスケールすることを確認している。
4. 展望・課題(Next)
- 実プロダクトへの適用と検証: 公開された Tiny/Small/Base のチェックポイントを用いて、既存の画像認識パイプラインやセグメンテーションタスクにおける実用性能の検証が進められる。