Um benchmark reproduzível no GitHub mostra que pedir aos LLMs para escreverem em cablese—o estilo conciso e em minúsculas dos telegramas do século XIX—resulta em economia de 40–49% de tokens sem perda de compreensão downstream. Usando um benchmark de 50 trechos e aproximadamente 1.300 perguntas, o estudo descobriu que modelos como gemma-4-31b, qwen3.8-27b e GLM-5.3-Flash alcançam razões de recuperação entre 0.99 e 1.10 ao ler registros comprimidos em comparação com texto simples. A chave é uma única instrução em minúsculas: sem ela, os modelos padrão para TUDO EM MAIÚSCULAS, custando 14–19 pontos de precisão.
Notably, gpt-5-mini não pode desativar o raciocínio, dobrando sua conta. A técnica funciona em quatro famílias de modelos, incluindo aqueles nunca treinados em cablese, provando que a capacidade já está em seus pesos. A compressão é mais eficaz quando aplicada após o conteúdo estar estabilizado, não durante a composição, evitando um "imposto de registro".
O resultado é uma otimização verificada e sem custo que quase dobra o contexto efetivo ou reduz pela metade as contas de saída.
Fonte: Hacker News · Resumido por HeadlinesBriefing