En su artículo Frugal GPT, Lingjiao Chen, Matei Zaharia y James Zou describen tres formas de reducir el coste de llamar a un modelo de lenguaje grande (LLM): adaptación de prompts, aproximación LLM y cascada LLM. Los autores informan que su cascada prueba primero modelos más baratos y puede igualar el rendimiento del mejor modelo individual con una reducción de coste de hasta el 98%. Construí un pequeño agente que podía inspeccionar llamada por llamada. Comprueba listados de apartamentos contra los requisitos de un inquilino, como un dormitorio doble en Austin por menos de $1,500 que permita perros. Mi primera versión enviaba cada listado a un modelo fuerte, incluso cuando un nombre de ciudad o una cifra de alquiler ya descartaban el listado. Eso significó 2,500 llamadas al modelo para encontrar 101 coincidencias reales.
Este artículo mide tres puntos de partida en lugar de uno. El primero envía cada par al modelo. El segundo es un agente que ya busca por ciudad. El tercero ejecuta una consulta de base de datos sobre ciudad, dormitorios y alquiler antes de que cualquier modelo vea un listado. Tomé una muestra fija de 500 listados de un conjunto de datos público de anuncios de alquiler de Estados Unidos de 2019. Escribí cinco requisitos de inquilino y puntué cada versión del agente contra las mismas respuestas. El modelo fuerte era gpt-6-sol de Open AI, al que llamo Sol, y el modelo más barato era gpt-6-luna, al que llamo Luna. Rastreé cada llamada con Weights & Biases (W&B) Weave.
Frente al punto de partida de la consulta de base de datos, la versión final costó aproximadamente 25 veces menos. El coste estimado fue de $0.008 frente a $0.20 para las mismas 2,500 comprobaciones, y la versión final devolvió las 101 coincidencias sin errores. Dejar que el código resolviera el campo de mascotas representó aproximadamente el 44% de esa reducción, y usar el modelo más barato con un respaldo fuerte representó aproximadamente el 39%. Un prompt más corto y respuestas reutilizadas completaron el resto.
Tres hallazgos me sorprendieron. La columna de coste de Weave mostraba $0.0000 para cada llamada. Sol falló una coincidencia 10 veces de 10 con el listado completo, y la encontró 10 veces de 10 con solo el título y el cuerpo. Enviar menos texto dio una mejor respuesta. Ambos modelos informaron una confianza de 5 en casi todas las respuestas. Una regla que escala por debajo de 5 casi nunca se activa, por lo que no puede hacer mucho trabajo. El artículo también dice dónde es débil la prueba. Solo una de las 101 coincidencias depende de leer texto, por lo que la prueba mide el coste mucho mejor de lo que mide la comprensión.
Fuente: Towards Data Science · Resumido por HeadlinesBriefing