HeadlinesBriefing favicon HeadlinesBriefing.com

Умная маршрутизация снижает затраты LLM 10x

ByteByteGo •
×

Когда приложение использует большую языковую модель (LLM), оно обычно выбирает самую мощную модель. Это означает, что каждый запрос отправляется на эту дорогую модель. Хотя такой подход проще в реализации, в долгосрочной перспективе он может стать довольно дорогим. Например, запрос типа «классифицировать этот тикет поддержки как биллинг, технический или связанный с аккаунтом» не требует того же уровня рассуждений, что и «расследовать, почему эти финансовые записи не совпадают должным образом, и объяснить вероятную причину».

С помощью умной маршрутизации моделей мы можем решить эту проблему. При таком подходе мы выбираем конкретную модель для каждого запроса. Другими словами, простая работа отправляется на маленькую модель, которая может быть дешевле, а сложная работа направляется на более мощную модель. Если большинство запросов простые, этот подход может значительно снизить общую стоимость, иногда даже примерно в 10 раз. Кроме того, качество ответа заметно не снижается.

Однако снижение затрат не гарантировано. Это также зависит от типов запросов, которые получает приложение, разницы в ценах между моделями и того, насколько хорошо работает система маршрутизации. Общая стоимость использования API LLM обычно зависит от количества обработанных токенов. Входные токены включают сообщение пользователя, системные инструкции, историю разговора и любые документы, предоставленные модели. Выходные токены — это токены, сгенерированные в ответе. Более крупные и мощные модели обычно стоят дороже, потому что требуют больше вычислительных ресурсов.

Например, представьте приложение поддержки клиентов, которое должно обрабатывать миллион запросов в месяц. Если каждый запрос идет на самую мощную модель, компания должна платить премиальную цену даже за довольно простую работу. Вы можете думать об этом как о найме старшего архитектора программного обеспечения для переименования файлов, сортировки тикетов поддержки и форматирования дат — пустая трата возможностей и плохое управление ресурсами.