HeadlinesBriefing HeadlinesBriefing.com

Агент поиска: меньше вызовов, хорошие результаты

Towards Data Science •
×

В своей статье Frugal GPT Lingjiao Chen, Matei Zaharia и James Zou описывают три способа снижения стоимости вызова большой языковой модели (LLM): адаптация промптов, аппроксимация LLM и каскад LLM. Авторы сообщают, что их каскад сначала пробует более дешевые модели и может соответствовать производительности лучшей отдельной модели со снижением затрат до 98%. Я построил небольшого агента, которого мог проверять вызов за вызовом. Он проверяет объявления о квартирах на соответствие требованиям арендатора, например, двухкомнатная квартира в Остине менее чем за 1500 долларов, где разрешены собаки. Моя первая версия отправляла каждое объявление сильной модели, даже если название города или сумма арендной платы уже исключали объявление. Это означало 2500 вызовов модели для поиска 101 реального совпадения.

В этой статье измеряются три отправные точки вместо одной. Первая отправляет каждую пару модели. Вторая — это агент, который уже ищет по городу. Третья выполняет запрос к базе данных по городу, количеству комнат и арендной плате до того, как какая-либо модель увидит объявление. Я взял фиксированную выборку из 500 объявлений из общедоступного набора данных объявлений об аренде в США за 2019 год. Я написал пять требований арендатора и оценил каждую версию агента по одним и тем же ответам. Сильной моделью была gpt-6-sol от Open AI, которую я называю Sol, а более дешевой моделью была gpt-6-luna, которую я называю Luna. Я отслеживал каждый вызов с помощью Weights & Biases (W&B) Weave.

По сравнению с отправной точкой запроса к базе данных, финальная версия стоила примерно в 25 раз меньше. Расчетная стоимость составила 0,008 доллара против 0,20 доллара за те же 2500 проверок, и финальная версия вернула все 101 совпадение без ошибок. Предоставление коду возможности обрабатывать поле с домашними животными составило около 44% этого снижения, а использование более дешевой модели с надежным резервным копированием — около 39%. Более короткий промпт и повторно использованные ответы составили остальное.

Три вывода меня удивили. Столбец стоимости Weave показывал $0,0000 для каждого вызова. Sol пропустил совпадение 10 раз из 10 с полным объявлением и нашел его 10 раз из 10 только с заголовком и текстом. Отправка меньшего объема текста дала лучший ответ. Обе модели сообщали уверенность 5 почти по каждому ответу. Правило, которое срабатывает ниже 5, почти никогда не срабатывает, поэтому оно не может выполнять много работы. В статье также говорится, где тест слаб. Только одно из 101 совпадений зависит от чтения текста, поэтому тест измеряет стоимость гораздо лучше, чем понимание.

Источник: Towards Data Science · Сводку подготовил HeadlinesBriefing