HeadlinesBriefing favicon HeadlinesBriefing.com

AI-агенты неудачны на простых багах

Towards Data Science •
×

Более 28 слепых экспериментов по отладке реальных багов из [PERSON_NAME], immer и decimal.js показывают, что AI-агенты для кодирования терпят неудачу не из-за сложности, а из-за отсутствия информации. Два сложных бага — один глубоко во внутренностях Immer и числовой пограничный случай в decimal.js — были исправлены правильно во всех 16 попытках. Однако, aparentemente тривиальный баг HTTP-клиента в [PERSON_NAME], который молча отбрасывал опцию повторной попытки, потерпел неудачу во всех моделях и рабочих процессах в 12 запусках. Каждое исправление, сгенерированное ИИ, повреждало данные пользователя, но проходило весь набор из 84 тестов на повторную попытку. Ошибка не была в обнаружении — агент-рецензент правильно определил риск повреждения данных, но всё же одобрил изменение, посчитав проблему маловероятной. Это подчеркивает критическую слепую зону: когда исправления зависят от недокументированных контрактов API, ИИ лишен суждения, чтобы отвергнуть правдоподобные, но неправильные решения. Сложность не предсказывала неудачу; отсутствие информации делало это. Для команд, которые объединяют исправления ИИ на основе зелёного CI, это именно тот режим отказа, который проскальзывает незамеченным — простые на вид баги с проходящими тестами, которые тайно повреждают данные в production.