nathan.rs、gzip を用いた非ニューラル言語モデル実装 gzipt を公開──DEFLATE とビームサーチによるテキスト生成
ニューラルネットワークや学習済み重みを一切使わず、OS 標準の gzip (zlib) とビームサーチのみでシェイクスピアのテキスト生成を実現した。
リリース: 2026-06-14 · 読了 3 分記事の要約
1. 核心(What)
- 学習パラメータを持たず、OS 標準の圧縮機能を利用してテキスト生成を行う Python 実装 gzipt が公開された。
- コーパスをウィンドウに初期投入し、候補文字列を追加した際の zlib 圧縮後バイト長をスコアとして次トークンを予測する。
- 整数長による量子化ノイズを回避するため、ビームサーチを適用して複数バイトの先読みとスコアリングを行い出力を決定する。
2. 影響(Why)
- 情報理論に基づく検証手法: すべての圧縮器が予測モデルを内包するという等価性を利用し、重みファイルなしで言語モデルの振る舞いを数理的に検証できる。
- 教育・研究への応用: 国内の大学や研究室の講義において、ディープラーニング以前の情報理論的アプローチによる言語生成を最小限のコードで解説できる。
3. 根拠・詳細(How)
- DEFLATE アルゴリズムの活用: 32 KiB のスライディングウィンドウ内でのバックリファレンスを利用し、予測に一致する文字列ほど短いバイト数に圧縮される特性をスコア化する。
- ビームサーチによる最適化: 単一バイトの単純選択では圧縮長の整数量子化により信号が埋もれるため、beam_width と horizon を設定したビームサーチで系列を探索する。
4. 展望・課題(Next)
- コードの公開と検証: Python の zlib 標準ライブラリのみで構成された実装が GitHub 上で公開されており、手元で動作を検証可能。