HeadlinesBriefing favicon HeadlinesBriefing.com

Эмпирическое исследование дизайна упряжи для агентов кодирования

Hacker News •
×

Исследователи провели эмпирическое исследование дизайна упряжи для автономных агентов кодирования, оценивая, как отдельные компоненты влияют на производительность инженерии программного обеспечения. Используя легкую упряжь с фиксированными циклами выполнения, они протестировали 176 соответствующих настроек на четырех моделях в SWE-Bench Verified и Terminal-Bench 2.1, варьируя компоненты планирования, пространства действий и управления контекстом.

Ключевые выводы включают: управление контекстом становится все более ценным по мере ужесточения бюджетов окна контекста, главным образом за счет предотвращения сбоев из-за переполнения контекста. Выполнение правил-ориентированного элизирования перед LLM-ориентированным суммированием обеспечивает наибольшую эффективность, тогда как восстановление элиминированного контента добавляет сложность без улучшения точности. Планирование переходит от роли опоры точности для слабых моделей к роли экономии затрат для сильных моделей с минимальным изменением точности. Предопределенные инструменты улучшают производительность моделей с низкой квалификацией в bash, тогда как модели, способные к bash, достигают значительно меньших затрат с интерфейсом только bash, особенно в задачах, ориентированных на командную строку.

Анализ на уровне траекторий показывает, что управление контекстом увеличивает длину траекторий выполнения без изменения поведения агента, планирование меняет место остановки траекторий, а пространство действий меняет гранулярность написания кода. Эти результаты информируют о проектировании упряжи, осознанном относительно модели и бюджета, и предоставляют модульную структуру для оценки будущих компонентов упряжи. Исследование было представлено Run-Ze Fan 17 сентября 2026 года.

Ключевые сущности: Люди: Run-Ze Fan