Sebuah benchmark yang dapat diulang di GitHub menunjukkan bahwa meminta LLM untuk menulis dalam cablese—gaya singkat dan huruf kecil dari pesan telepon abad ke-19—menghemat 40–49% token tanpa mengurangi pemahaman downstream. Dengan menggunakan benchmark 50 pasaj dan sekitar 1.300 pertanyaan, penelitian menemukan bahwa model seperti gemma-4-31b, qwen3.8-27b, dan GLM-5.3-Flash semua mencapai rasio pemulihan antara 0.99 dan 1.10 saat membaca rekaman yang terkompresi dibandingkan dengan teks biasa. Kunci adalah satu instruksi huruf kecil: tanpa itu, model secara default beralih ke HURUF BESAR SEMUA, yang menyebabkan kehilangan 14–19 poin akurasi.
Notably, gpt-5-mini tidak dapat menonaktifkan penalaran, sehingga mengalihkan biayanya menjadi dua kali lipat. Teknik ini bekerja di empat keluarga model, termasuk yang tidak pernah dilatih pada cablese, membuktikan bahwa kemampuan tersebut sudah ada dalam bobotnya. Kompresi paling efektif ketika diterapkan setelah konten stabil, bukan selama komposisi, untuk menghindari "pajak registrasi".
Hasilnya adalah optimisasi yang terverifikasi dan tanpa biaya yang hampir menggandakan konteks efektif atau memotong tagihan output menjadi setengah.
Sumber: Hacker News · Diringkas oleh HeadlinesBriefing