Edge0、音声認識モデル Audio8-ASR-Infinite を公開──Rolling KV Cache で 24 時間連続ストリーミングを実現
Voxtral のリアルタイムアーキテクチャを継承し、80/120/160 ms の選択式オーディオクロックと 240-560 ms の遅延設定で 24 時間ノンストップの文字起こしを可能にした。
リリース: 2026-09-21 · 読了 3 分記事の要約
1. 核心(What)
- Edge0 は、24 時間連続のストリーミング音声認識が可能なオープンモデル Audio8-ASR-Infinite を Hugging Face に公開した。
- ネイティブストリーミングアーキテクチャにより、1 秒間に 12.5 回のデコード処理を実行する。
- Rolling KV Cache を採用することで、メモリ使用量と遅延を一定に保ちながら 24/7 の連続稼働を実現する。
- セマンティック VAD を搭載し、思考中の沈黙や言い淀みと発話の本当の終端を区別する。
2. 影響(Why)
- 長時間の常時稼働における安定性: 従来のストリーミング ASR で問題となっていた長時間のコンテキスト肥大化を Rolling KV Cache で解決し、インフラ運用の負荷を低減する。
- 国内 SaaS への実用展開: [国内 音声認識 SaaS ベンダー] 規模の事業者は、秒間 12.5 回の高速デコードとカスタム vLLM による 24 時間安定稼働を背景に、リアルタイム文字起こし機能の SLA を向上させられる。
3. 根拠・詳細(How)
- Rolling KV Cache による RoPE 再基礎化: 30 秒のウィンドウサイズと正確な RoPE 再基礎化を組み合わせることで、24 時間の連続運用でもメモリとレイテンシを一定に抑制する。
- Docker Compose によるデプロイ構成: 公式リポジトリに含まれる Docker 構成を使用し、ポート 18191 を介した WebSocket 接続および Web クライアントによる検証が可能。
4. 展望・課題(Next)
- リアルタイムセマンティック知覚の構築: プレビューリリースである現在は文字起こしベースを配信中であり、同一のフレームグリッドと音響フォワードパス上でリアルタイムセマンティック知覚機能の構築が進められている。