HeadlinesBriefing favicon HeadlinesBriefing.com

Нормализация непонятных сбоев в разработке ИИ

Hacker News •
×

В недавнем эпизоде President Curtis, President борется с открытием двери в двух отдельных случаях. Эти двери не работют, потому что на пути есть препятствия: тело первоначально, а затем примерно миллиард долларов золота. В обоих случаях, в ответ на фрустрацию, персонаж бормочит "глупая штука ненавидит." Это не разумная модель дверей! Двери не должны "ненавидеть" непонятно! Я нашел эти моменты outrageously hilarious¹ но, возможно, мой глупый мозг просто ненавидит.

Jev: Делать больше дверей, которые ненавидят Internet сbuzz о Jev, модели ИИ, разработанной Type Safe AI, которая возвращает типизированные значения с оценками вероятности. Важные вещи о Jev, насколько я могу сказать: это быстро и дешево, вы можете быстро построить на нем, это быстро, и это дешево. Я не особенно хорош в понимании, какая технология будет adopt. Я все еще не понимаю² Slack. Подождите. Вы все еще должны делать hard часть? Моя проблема, возможно, в ожидании, что продукты будут работать. Никто, кто это покупает, не запускает evals. Они просто handed opaque questions Jev и getting opaque responses.

Благожелательно, это позволяет им проверить "IA-powered" коробку и ship до пятницы, и когда это breaks downstream logic, они могут always shrug и сказать "ну, ИИ делает ошибки." Error budgets? Failure modes? Test sets? Все это может быть handled позже. Пользователь может discover failure rate! Вы уже shiped!

False Confidence "О," strawman, отвечая на мой пост, отвечает, "вы не учли, что Jev дает вам confidence scores!" Что вы с ними сделаете? Для того чтобы doing something reasonable с confidence scores, вам нужно have both понимание calibration этих confidence scores и also модель для costs of uncertainty.

On calibration side: Jev's topline ad copy в основном о том, как хорошо они score на various benchmarks, но не о том, насколько calibrated их confidence scores. There's cookbook о том, как использовать confidence scores для подъема на дерево классификации, но это fundamentally не о том, насколько хороши confidence scores. At best, люди используют confidence scores в cargo cult manner. At worst, люди используют их как excuse для того, что API call failed. Модель была только 73% confident! Это означает, что мой error budget - 27%!

Accountability Когда кнопка ломается на веб-сайте, у меня есть модель того, что должно было случиться. Где-то contract broken. Мой DNS broken. Somebody shipped slop, который has Java Script syntax errors только по определенным путям. Handler threw, который не был expected to throw. Я могу not have access to debug just HTTP 500, но я expect, чтобы быть somebody, чья job понять, why endpoint 500ing. Ownership well-defined, albeit³ opaque.

Для многих пользователей, actual experience примерно "stupid thing sucks." Software уже feels capricious; больше failures просто меняют rate frustration. Кажется, что не much loss в удалении возможности следовать failure к concrete cause. Иногда things just suck. Это ведет к нормализации inexplicability.

Мой fear не в том, что больше things will fail, когда things accelerated LLM-driven development. Они will. Они have. Таков part of price of building things в novel manner. Мой fear в том, что "sometimes it just sucks" будет более и более accepted endpoint of investigations. Это sad, потому что LLM-accelerated development может indeed help us solve some of these issues. There are plenty automated QA workflows, которые не written из-за lack of engineering time. Сам eval, который gets you most of the way к replacing (или justifying use of) Jev, может быть в нескольких prompts away.

Трагедия software engineering сегодня в том, что мы actively engineering системы, где ни user, ни builder, по-видимому, не have interest в проверке, есть ли body за дверью. Мы просто...