Воспроизводимый бенчмарк на GitHub показывает, что запрос к LLM писать в стиле cablese—коротком и строчном стиле телеграмм XIX века—дает экономию 40–49% токенов без потери downstream-п理解ния. Используя бенчмарк из 50 отрывков и примерно 1300 вопросов, исследование показало, что модели вроде gemma-4-31b, qwen3.8-27b и GLM-5.3-Flash достигают коэффициентов восстановления от 0.99 до 1.10 при чтении сжатых записей по сравнению с обычным текстом. Ключ — одна строчная инструкция: без нее модели по умолчанию переходят на ВСЕ ЗАГЛАВНЫЕ, теряя 14–19 пунктов точности. Notably, gpt-5-mini не может отключить рассуждения, что удваивает его счет. Эта техника работает в четырех семействах моделей, включая те, которые никогда не обучались на cablese, доказывая, что способность уже заложена в их весах. Сжатие наиболее эффективно, когда применяется после стабилизации контента, а не во время составления, избегая «налога на регистр». Результат — проверенная оптимизация без затрат, которая почти удваивает эффективный контекст или сокращает счета за вывод вдвое.
Источник: Hacker News · Сводку подготовил HeadlinesBriefing