In ihrem Artikel Frugal GPT beschreiben Lingjiao Chen, Matei Zaharia und James Zou drei Möglichkeiten, die Kosten für den Aufruf eines großen Sprachmodells (LLM) zu senken: Prompt-Anpassung, LLM-Approximation und LLM-Kaskade. Die Autoren berichten, dass ihre Kaskade zuerst günstigere Modelle ausprobiert und die Leistung des besten einzelnen Modells mit einer Kostensenkung von bis zu 98 % erreichen kann. Ich habe einen kleinen Agenten gebaut, den ich Aufruf für Aufruf überprüfen konnte. Er prüft Wohnungsinserate gegen die Anforderungen eines Mieters, wie ein Zweibettzimmer in Austin unter 1.500 $, das Hunde erlaubt. Meine erste Version sendete jedes Inserat an ein starkes Modell, selbst wenn ein Stadtname oder eine Mietzahl das Inserat bereits ausschloss. Das bedeutete 2.500 Modellaufrufe, um 101 echte Treffer zu finden.
Dieser Artikel misst drei Ausgangspunkte anstelle von einem. Der erste sendet jedes Paar an das Modell. Der zweite ist ein Agent, der bereits nach Stadt sucht. Der dritte führt eine Datenbankabfrage zu Stadt, Schlafzimmern und Miete durch, bevor ein Modell ein Inserat sieht. Ich habe eine feste Stichprobe von 500 Inseraten aus einem öffentlichen Datensatz von US-Mietanzeigen von 2019 genommen. Ich habe fünf Mieteranforderungen geschrieben und jede Version des Agenten gegen die gleichen Antworten bewertet. Das starke Modell war Open AIs gpt-6-sol, das ich Sol nenne, und das günstigere Modell war gpt-6-luna, das ich Luna nenne. Ich habe jeden Aufruf mit Weights & Biases (W&B) Weave verfolgt.
Gegenüber dem Ausgangspunkt der Datenbankabfrage kostete die endgültige Version etwa 25-mal weniger. Die geschätzten Kosten betrugen 0,008 $ gegenüber 0,20 $ für die gleichen 2.500 Prüfungen, und die endgültige Version gab alle 101 Treffer ohne Fehler zurück. Das Überlassen des Haustierfelds an den Code machte etwa 44 % dieses Rückgangs aus, und die Verwendung des günstigeren Modells mit einer starken Sicherung machte etwa 39 % aus. Ein kürzerer Prompt und wiederverwendete Antworten machten den Rest aus.
Drei Erkenntnisse überraschten mich. Die Kostenspalte von Weave zeigte für jeden Aufruf 0,0000 $ an. Sol verfehlte einen Treffer 10 von 10 Malen mit dem vollständigen Inserat und fand ihn 10 von 10 Malen nur mit Titel und Text. Das Senden von weniger Text ergab eine bessere Antwort. Beide Modelle meldeten bei fast jeder Antwort ein Konfidenzniveau von 5. Eine Regel, die unter 5 eskaliert, wird fast nie ausgelöst, kann also nicht viel Arbeit leisten. Der Artikel sagt auch, wo der Test schwach ist. Nur einer der 101 Treffer hängt vom Lesen von Text ab, daher misst der Test die Kosten weitaus besser als das Verständnis.
Quelle: Towards Data Science · Zusammengefasst von HeadlinesBriefing