HeadlinesBriefing HeadlinesBriefing.com

Agent recherche : moins d'appels, bons résultats

Towards Data Science •
×

Dans leur article Frugal GPT, Lingjiao Chen, Matei Zaharia et James Zou décrivent trois façons de réduire le coût d'appel d'un grand modèle de langage (LLM) : l'adaptation de prompt, l'approximation LLM et la cascade LLM. Les auteurs rapportent que leur cascade essaie d'abord les modèles moins chers et peut égaler les performances du meilleur modèle individuel avec une réduction de coût allant jusqu'à 98 %. J'ai construit un petit agent que je pouvais inspecter appel par appel. Il vérifie les annonces d'appartements par rapport aux exigences d'un locataire, comme une chambre double à Austin à moins de 1 500 $ qui accepte les chiens. Ma première version envoyait chaque annonce à un modèle puissant, même si un nom de ville ou un chiffre de loyer excluait déjà l'annonce. Cela signifiait 2 500 appels au modèle pour trouver 101 correspondances réelles.

Cet article mesure trois points de départ au lieu d'un. Le premier envoie chaque paire au modèle. Le second est un agent qui recherche déjà par ville. Le troisième exécute une requête de base de données sur la ville, les chambres et le loyer avant que tout modèle ne voie une annonce. J'ai prélevé un échantillon fixe de 500 annonces d'un ensemble de données public d'annonces de location américaines de 2019. J'ai écrit cinq exigences de locataire et noté chaque version de l'agent par rapport aux mêmes réponses. Le modèle puissant était le gpt-6-sol d'Open AI, que j'appelle Sol, et le modèle moins cher était le gpt-6-luna, que j'appelle Luna. J'ai tracé chaque appel avec Weights & Biases (W&B) Weave.

Par rapport au point de départ de la requête de base de données, la version finale a coûté environ 25 fois moins cher. Le coût estimé était de 0,008 $ contre 0,20 $ pour les mêmes 2 500 vérifications, et la version finale a renvoyé les 101 correspondances sans erreur. Laisser le code régler le champ des animaux de compagnie a représenté environ 44 % de cette baisse, et l'utilisation du modèle moins cher avec une sauvegarde solide a représenté environ 39 %. Un prompt plus court et des réponses réutilisées ont constitué le reste.

Trois découvertes m'ont surpris. La colonne des coûts de Weave affichait 0,0000 $ pour chaque appel. Sol a manqué une correspondance 10 fois sur 10 avec l'annonce complète, et l'a trouvée 10 fois sur 10 avec seulement le titre et le corps. Envoyer moins de texte a donné une meilleure réponse. Les deux modèles ont signalé une confiance de 5 sur presque toutes les réponses. Une règle qui monte en dessous de 5 ne se déclenche presque jamais, elle ne peut donc pas faire grand-chose. L'article indique également où le test est faible. Une seule des 101 correspondances dépend de la lecture du texte, donc le test mesure bien mieux le coût qu'il ne mesure la compréhension.

Source: Towards Data Science · Résumé par HeadlinesBriefing