Une référence reproductible sur GitHub montre que demander aux LLM d'écrire en cablese—le style concis et en minuscules des télégrammes du XIXe siècle—permet d'économiser 40–49 % de tokens sans perte de compréhension downstream. En utilisant une référence de 50 passages et d'environ 1 300 questions, l'étude a révélé que des modèles comme gemma-4-31b, qwen3.8-27b et GLM-5.3-Flash atteignent tous des taux de récupération compris entre 0.99 et 1.10 lorsqu'ils lisent des enregistrements compressés par rapport au texte brut. La clé réside dans une seule instruction en minuscules : sans elle, les modèles reviennent par défaut aux MAJUSCULES, ce qui leur coûte 14–19 points de précision.
Notably, gpt-5-mini ne peut pas désactiver le raisonnement, ce qui double sa facture. Cette technique fonctionne auprès de quatre familles de modèles, y compris ceux qui n'ont jamais été entraînés sur le cablese, prouvant que cette capacité est déjà présente dans leurs poids. La compression est la plus efficace lorsqu'elle est appliquée après que le contenu est stabilisé, et non pendant la rédaction, évitant ainsi une « taxe de registre ».
Le résultat est une optimisation vérifiée et sans coût qui presque double le contexte effectif ou réduit de moitié les factures de sortie.
Source: Hacker News · Résumé par HeadlinesBriefing