HeadlinesBriefing HeadlinesBriefing.com

Tu Factura de IA es un Peaje: Deja de Pagar Dos Veces

Towards Data Science •
×

Aquí hay una pregunta que vale la pena hacerle a tu equipo financiero: ¿cuánto del presupuesto de IA de este año queda? Para un número sorprendente de empresas, la respuesta honesta es "no mucho". Algunas se quedan sin fondos en abril. El presupuesto anual, desaparecido en un trimestre.

La razón principal es cómo lo estamos usando. Hemos pasado de hacer preguntas a chatbots a ejecutar agentes. Y los agentes no solo responden.

Llaman herramientas, leen archivos, verifican resultados y llaman a más herramientas. Cada uno de esos pasos quema tokens. Una solicitud de agente puede costar muchas veces lo que cuesta un mensaje de chat simple.

No ayuda que los precios sigan cambiando. Hay suscripciones. Hay acceso API de pago por uso.

Hay promociones que aparecen por unos meses para evitar que la gente cambie, y nuevos modelos de primer nivel que llegan cada pocos meses con sus propios precios. Así que antes de entrar en cómo reducir la factura, asegurémonos de que todos entendemos por qué estamos pagando realmente. Porque una vez que veas cómo funciona el medidor, los ahorros se vuelven obvios.

Un LLM predice un token a la vez. Para cada token, ejecuta una pila de matemáticas. Para predecir el siguiente token, necesita las matemáticas para cada token anterior.

Una y otra vez, hasta que produce un token especial "he terminado". Imagina cada llamada API como una carretera de peaje. Pagas para entrar (tokens de entrada) y pagas para salir (tokens de salida).

La salida es el carril más caro. Tomemos la línea de productos de Anthropic como ejemplo. Claude Fable 5 cuesta $10 por millón de tokens de entrada y $50 por millón de salida. Eso es una diferencia de 10x entre el modelo más barato y el más caro de la misma empresa.

Ahora busca la línea más pequeña en esa hoja de precios. Los tokens en caché cuestan una décima parte de los tokens normales. Guarda ese número en tu bolsillo.

Vale más que todo lo demás en este artículo combinado. Sin almacenamiento en caché, el modelo necesita toda la conversación cada vez. Envías el mensaje uno.

Devuelve el mensaje uno más su respuesta. Envías todo más el mensaje tres. Devuelve todo más la respuesta dos.

Fuente: Towards Data Science · Resumido por HeadlinesBriefing