HeadlinesBriefing favicon HeadlinesBriefing.com

Миллион агентов: проблема распределенных систем

Hacker News •
×

Я думаю об агентах так же, как о людях. Один агент — это работник. Тысяча агентов — это организация, а организация машин — это распределенная система. Люди постоянно говорят мне, что агенты могут работать вечно. Технически это правда. Вы можете вызывать модель в цикле, пока ваша кредитная карта не будет отклонена. Но агент все равно работает на конечных вещах: токены, контекст, вычисления, память, инструменты, деньги. Что-то всегда заканчивается. Люди не сильно отличаются. Мы работаем какое-то время и устаем. Наша рабочая память крошечная. Мы забываем вещи. Поэтому мы записываем важные части, спим и возвращаемся на следующее утро с ясной головой и той же личностью. У машин то же ограничение в другой форме. У бокса заканчивается CPU. У пода заканчивается память. Никто не исправляет это, предполагая, что каждый процесс должен жить вечно. Мы планируем работу на имеющихся ресурсах. Я не вижу, почему интеллект получает поблажку. Агент может работать какое-то время, записывать важное, очищать свой контекст и позволять себе или другому агенту продолжить с этого места. Мы запускаем наших собственных агентов кодирования на VPS в Ins Forge, и они убиваются, перезапускаются и у них заканчивается контекст постоянно. Сбои, которые действительно причиняют боль, — это те, где план жил только внутри окна контекста агента.

Добавление агентов помогло параллельной работе до 80,9% и навредило последовательной работе на 39% до 70% в исследовании Google Research с 180 конфигурациями. Форма задачи решает. Оркестратор снизил усиление ошибок с 17,2× до 4,4× в том же исследовании. Координация — это настоящая работа. В Silo-Bench (ACL 2026) команды из 2–100 агентов много говорили и плохо рассуждали. Самые сложные задачи достигли нулевого успеха при 50 агентах. Так что долговечным должно быть состояние, а не агент. Планируйте агентов как процессы и восстанавливайте их как узлы.

Агенты начинают выглядеть как процессы. Это перестало быть аналогией некоторое время назад. Существует целая исследовательская линия, строящая это. AIOS, «Операционная система агентов LLM» из Rutgers, открывает проблему одним предложением: «Предоставление неограниченного доступа к ресурсам LLM или инструментам может привести к неэффективному или даже потенциально вредному распределению и использованию ресурсов для агентов». Их ответ — ядро. Каждый запрос агента разбивается на системные вызовы, планировщик решает, чей вызов выполняется следующим, а менеджер контекста делает снимок агента в середине задачи, чтобы его можно было прервать и возобновить. Они сообщают о до 2,1× более быстром выполнении при обслуживании агентов, построенных на существующих фреймворках. Планирование, переключение контекста, управление памятью, хранение, контроль доступа. Это операционная система. Процессы просто оказывается, думают.

Это окупается и на уровень выше. LLM-as-Scheduler, из ACL 2026, исходит из наблюдения, что большинство запросов не заслуживают тяжелого многозадачного рабочего процесса, и позволяет планировщику выбирать рабочий процесс для каждого запроса. Они получили 43% меньше токенов и более 36% меньшую сквозную задержку, с падением точности не более чем на 1,4 процентного пункта по сравнению с сильным фиксированным рабочим процессом. Итак, один агент выглядит как процесс, и тысячи процессов нуждаются в планировщике. Хорошо. Но планирование вычислений — это только половина. Вам также нужно координировать агентов друг с другом, и вот тут становится интересно. Десять человек координируются. Десять тысяч изобретают менеджеров. Десять человек могут координироваться в комнате. Тысяча человек не могут все разговаривать друг с другом и независимо решать, что должна делать компания, поэтому мы изобрели команды, менеджеров, отделы и в конечном итоге генерального директора. Менеджеры существуют частично потому, что координация сама по себе является работой, и кто-то должен ее выполнять. Я предположил, что у агентов будет та же проблема. Теперь есть данные. Google Research и MIT провели контролируемое исследование 180 конфигураций агентов в пяти архитектурах и трех семействах моделей. Их заголовок: «подход "больше агентов" часто достигает потолка и может даже...»