GitHub上の再現可能なベンチマークによると、LLMにcablese—19世紀の電報の簡潔な小文字スタイル—で書くよう促すと、下流の理解を損なうことなくトークン使用量が40–49%削減されます。50のパッセージと約1,300の質問からなるベンチマークを使用して、この研究ではgemma-4-31b、qwen3.8-27b、およびGLM-5.3-Flashなどのモデルが、プレーンテキストと比較して圧縮レコードを読む際の回復率が0.99から1.10の範囲内であることがわかりました。鍵となるのは小文字の単一の指示です:これがないと、モデルはデフォルトでALL CAPSになり、14–19ポイントの精度を失います。特に注目すべきは、gpt-5-miniは推論を無効にできず、その結果コストが2倍になることです。この手法は、cableseで訓練されたことがないモデルファミリーを含む4つのモデルファミリーで機能し、その能力がすでに重みに組み込まれていることを証明します。圧縮は、コンテンツが確定した後に適用するのが最も効果的で、構成中に適用すると「レジスタ税」が発生します。その結果、ゼロコストで検証済みの最適化が得られ、有効コンテキストがほぼ2倍になるか、出力コストが半分になります。
出典: Hacker News · 要約:HeadlinesBriefing