🧠Research🔥🔥

Z AI、推論モデル GLM-5.3-Flash の性能と価格を公開──ベンチマークスコア 57 と 100 万トークンコンテキストを実証

320B パラメータの MoE アーキテクチャを採用し、1M トークンの長文脈処理と画像入力を $0.15/1M 入力トークンの低価格で実現した。
リリース: 2026-08-26 · 読了 3

記事の要約

1. 核心(What)

  • Z AI が開発した推論モデル GLM-5.3-Flash の性能および価格の評価結果が Artificial Analysis で公開された。
  • モデルはテキストおよび画像入力に対応し、テキスト出力を行うマルチモーダル仕様となっている。
  • Artificial Analysis Intelligence Index においてスコア 57 を獲得し、同クラスのオープンウェイトモデルの中央値 28 を超える性能を示した。
  • 推論速度は秒間 50.2 トークン、初回トークン出力までの遅延(TTFT)は 1.49 秒を記録している。

2. 影響(Why)

  • 長文脈 RAG のコスト劇的削減: 1M トークンのコンテキスト窓を $0.15/1M token の入力コストで扱えるため、従来はコスト制約で断念していた数千ページ規模のマニュアルやコードベース全体を網羅した RAG 設計が現実解になる。
  • 国内オンプレミス環境への波及: [国内金融システム受託開発] のような機密性を重視する開発現場において、320B 総パラメータながら 18B アクティブで動く MoE 構造は、自社データセンター内での効率的な推論運用を後押しする。

3. 根拠・詳細(How)

  • MoE アーキテクチャとパラメータ設計: 総パラメータ数 320B のうち推論時に稼働するのは 18B のみとする Mixture of Experts 構造を採用し、処理効率とモデル性能の両立を図っている。
  • ベンチマーク検証環境: Artificial Analysis の Intelligence Index 評価において総計 1.5 億出力トークンを生成し、同カテゴリの中央値である 1.1 億トークンを上回る詳細な検証を実施した。

4. 展望・課題(Next)

  • プロバイダー別価格の最適化: API 提供元やホスティング環境によって実際のキャッシュヒット率やスループットが変動するため、本番導入前の実測検証が必要となる。