オープンソース macOS 向けローカルアプリ Lipflow 公開──Webcam の口元トラッキングで無音声テキスト入力を実現
Webcam の口元読み取りと Apple Silicon 向け MLX を組み合わせ、静かな環境でもカーソル位置に直接テキストを入力できる OSS ディクテーションツール。
リリース: 2026-10-05 · 読了 3 分記事の要約
1. 核心(What)
- Lipflow は Webcam の映像から無音声での発話内容を認識し、macOS のアクティブなカーソルへテキストを入力するローカルアプリである。
- 初期設定として 8 分間の顔と表現のパーソナライゼーションを行い、モデルの口元認識精度を高める。
- テキストの補正はオフライン環境で行うほか、ローカルの Qwen3-0.6B や Ollama、あるいは Anthropic の Claude を利用して類似音素を識別できる。
- 右 Option キーの長押しでキャプチャを制御し、ダブルタップで最大 60 秒間のハンズフリーセッションを開始する。
2. 影響(Why)
- プライバシーとローカル処理の両立: 音声データをクラウドに送らず Apple Silicon 上で完結させるため、機密情報を扱う開発環境でもプライバシーの懸念を抑えて利用できる。
- 国内オフィスでの実用性: 国内のオープンオフィスやリモートワーク環境で声を出せない状況下でも、キーボード入力を補う実用的なディクテーション手段となる。
3. 根拠・詳細(How)
- MediaPipe と Auto-AVSR によるパイプライン: MediaPipe FaceLandmarker で毎フレームの顔のランドマークを追跡し、96×96 ピクセルのグレースケール口元領域を切り出して毎秒 25 フレームにリサンプルする。
- 音声と視覚のマルチモーダル融合: Whisper モードでは口の動きと微小な音声を同時に処理することで、視覚情報のみの 31.9% から 6.9% へ単語誤り率 (WER) を大幅に改善する。
4. 展望・課題(Next)
- 商用利用時のウェイト制約: コード自体は MIT ライセンスだが、利用する LRS3 モデルウェイトが非商用研究限定であるため、商用プロダクトへの組み込み時は代替ウェイトの検討が必要。