🛠Tools🔥🔥

オープンソース macOS 向けローカルアプリ Lipflow 公開──Webcam の口元トラッキングで無音声テキスト入力を実現

Webcam の口元読み取りと Apple Silicon 向け MLX を組み合わせ、静かな環境でもカーソル位置に直接テキストを入力できる OSS ディクテーションツール。
リリース: 2026-10-05 · 読了 3 分

記事の要約

1. 核心(What)

  • Lipflow は Webcam の映像から無音声での発話内容を認識し、macOS のアクティブなカーソルへテキストを入力するローカルアプリである。
  • 初期設定として 8 分間の顔と表現のパーソナライゼーションを行い、モデルの口元認識精度を高める。
  • テキストの補正はオフライン環境で行うほか、ローカルの Qwen3-0.6B や Ollama、あるいは Anthropic の Claude を利用して類似音素を識別できる。
  • 右 Option キーの長押しでキャプチャを制御し、ダブルタップで最大 60 秒間のハンズフリーセッションを開始する。

2. 影響(Why)

  • プライバシーとローカル処理の両立: 音声データをクラウドに送らず Apple Silicon 上で完結させるため、機密情報を扱う開発環境でもプライバシーの懸念を抑えて利用できる。
  • 国内オフィスでの実用性: 国内のオープンオフィスやリモートワーク環境で声を出せない状況下でも、キーボード入力を補う実用的なディクテーション手段となる。

3. 根拠・詳細(How)

  • MediaPipe と Auto-AVSR によるパイプライン: MediaPipe FaceLandmarker で毎フレームの顔のランドマークを追跡し、96×96 ピクセルのグレースケール口元領域を切り出して毎秒 25 フレームにリサンプルする。
  • 音声と視覚のマルチモーダル融合: Whisper モードでは口の動きと微小な音声を同時に処理することで、視覚情報のみの 31.9% から 6.9% へ単語誤り率 (WER) を大幅に改善する。

4. 展望・課題(Next)

  • 商用利用時のウェイト制約: コード自体は MIT ライセンスだが、利用する LRS3 モデルウェイトが非商用研究限定であるため、商用プロダクトへの組み込み時は代替ウェイトの検討が必要。