HeadlinesBriefing HeadlinesBriefing.com

Agente busca: menos chamadas, bons resultados

Towards Data Science •
×

Em seu artigo Frugal GPT, Lingjiao Chen, Matei Zaharia e James Zou descrevem três maneiras de reduzir o custo de chamar um modelo de linguagem grande (LLM): adaptação de prompt, aproximação LLM e cascata LLM. Os autores relatam que sua cascata tenta modelos mais baratos primeiro e pode igualar o desempenho do melhor modelo individual com uma redução de custo de até 98%. Construí um pequeno agente que podia inspecionar chamada por chamada. Ele verifica listagens de apartamentos contra os requisitos de um inquilino, como um quarto duplo em Austin por menos de $1.500 que permite cães. Minha primeira versão enviava cada listagem para um modelo forte, mesmo quando um nome de cidade ou um valor de aluguel já descartava a listagem. Isso significou 2.500 chamadas ao modelo para encontrar 101 correspondências reais.

Este artigo mede três pontos de partida em vez de um. O primeiro envia cada par ao modelo. O segundo é um agente que já pesquisa por cidade. O terceiro executa uma consulta de banco de dados sobre cidade, quartos e aluguel antes que qualquer modelo veja uma listagem. Peguei uma amostra fixa de 500 listagens de um conjunto de dados público de anúncios de aluguel dos Estados Unidos de 2019. Escrevi cinco requisitos de inquilino e pontuei cada versão do agente contra as mesmas respostas. O modelo forte era o gpt-6-sol da Open AI, que chamo de Sol, e o modelo mais barato era o gpt-6-luna, que chamo de Luna. Rastreei cada chamada com Weights & Biases (W&B) Weave.

Em comparação com o ponto de partida da consulta de banco de dados, a versão final custou cerca de 25 vezes menos. O custo estimado foi de $0,008 contra $0,20 para as mesmas 2.500 verificações, e a versão final retornou todas as 101 correspondências sem erros. Deixar o código resolver o campo de animais de estimação representou cerca de 44% dessa queda, e usar o modelo mais barato com um backup forte representou cerca de 39%. Um prompt mais curto e respostas reutilizadas completaram o restante.

Três descobertas me surpreenderam. A coluna de custo do Weave mostrava $0,0000 para cada chamada. Sol perdeu uma correspondência 10 vezes em 10 com a listagem completa e a encontrou 10 vezes em 10 apenas com o título e o corpo. Enviar menos texto deu uma resposta melhor. Ambos os modelos relataram uma confiança de 5 em quase todas as respostas. Uma regra que escala abaixo de 5 quase nunca é acionada, então não pode fazer muito trabalho. O artigo também diz onde o teste é fraco. Apenas uma das 101 correspondências depende da leitura de texto, então o teste mede o custo muito melhor do que mede a compreensão.

Fonte: Towards Data Science · Resumido por HeadlinesBriefing