HeadlinesBriefing favicon HeadlinesBriefing.com

Enrutamiento inteligente reduce costos LLM 10x

ByteByteGo •
×

Cuando una aplicación adopta un modelo de lenguaje grande (LLM), generalmente elige el modelo más capaz posible. Esto significa que cada solicitud se envía a ese modelo costoso. Aunque este enfoque es más fácil de implementar, puede volverse bastante caro a largo plazo. Por ejemplo, una solicitud como "clasificar este ticket de soporte como facturación, técnico o relacionado con la cuenta" no requiere el mismo nivel de razonamiento que "investigar por qué estos registros financieros no coinciden correctamente y explicar la causa probable".

Con el enrutamiento inteligente de modelos, podemos resolver este problema. En este enfoque de enrutamiento, elegimos un modelo específico para cada solicitud. En otras palabras, el trabajo simple se envía a un modelo pequeño que puede ser menos costoso, y el trabajo difícil se enruta a un modelo más capaz. Si la mayoría de las solicitudes son simples, este enfoque puede reducir el costo total de manera significativa, a veces incluso alrededor de 10 veces. Además, la calidad de la respuesta no disminuye notablemente.

Sin embargo, la reducción de costos no está garantizada. También depende de los tipos de solicitudes que recibe la aplicación, la diferencia de precio entre modelos y qué tan bien funciona el sistema de enrutamiento. El costo total de usar una API de LLM generalmente depende del número de tokens procesados. Los tokens de entrada incluyen el mensaje del usuario, instrucciones del sistema, historial de conversación y cualquier documento proporcionado al modelo. Los tokens de salida son los tokens generados dentro de la respuesta. Los modelos más grandes y capaces generalmente cuestan más porque requieren más recursos computacionales.

Por ejemplo, imagine una aplicación de atención al cliente que tiene que procesar un millón de solicitudes al mes. Si cada solicitud va al modelo más potente, la empresa tiene que pagar un precio premium incluso por trabajo bastante simple. Podrías pensar en esto como contratar a un arquitecto de software senior para renombrar archivos, clasificar tickets de soporte y formatear fechas: un desperdicio de capacidad y una mala gestión de recursos.