論文Frugal GPTの中で、Lingjiao Chen、Matei Zaharia、James Zouは、大規模言語モデル(LLM)を呼び出すコストを削減する3つの方法(プロンプト適応、LLM近似、LLMカスケード)を説明しています。著者らは、彼らのカスケードは最初に安価なモデルを試し、最大98%のコスト削減で最良の個別モデルのパフォーマンスに匹敵できると報告しています。私は呼び出しごとに検査できる小さなエージェントを構築しました。これは、オースティンで1,500ドル未満の2ベッドルームで犬を許可するなど、賃借人の要件に対してアパートのリストをチェックします。私の最初のバージョンは、都市名や家賃の数字がすでにリストを除外している場合でも、すべてのリストを強力なモデルに送信しました。つまり、101件の実際のマッチを見つけるために2,500回のモデル呼び出しが必要でした。
この記事では、1つではなく3つの開始点を測定しています。1つ目はすべてのペアをモデルに送信します。2つ目はすでに都市で検索するエージェントです。3つ目は、モデルがリストを確認する前に、都市、ベッドルーム、家賃に関するデータベースクエリを実行します。2019年の米国の賃貸広告の公開データセットから500件のリストの固定サンプルを取得しました。5つの賃借人要件を作成し、同じ回答に対してエージェントの各バージョンをスコアリングしました。強力なモデルはOpen AIのgpt-6-sol(Solと呼びます)で、安価なモデルはgpt-6-luna(Lunaと呼びます)でした。すべての呼び出しをWeights & Biases (W&B) Weaveでトレースしました。
データベースクエリの開始点と比較して、最終バージョンのコストは約25分の1でした。同じ2,500回のチェックで推定コストは0.20ドルに対して0.008ドルで、最終バージョンは101件すべてのマッチをエラーなく返しました。コードにペットフィールドを処理させることでその削減の約44%を占め、強力なバックアップとともに安価なモデルを使用することで約39%を占めました。より短いプロンプトと再利用された回答が残りを占めました。
3つの発見に驚きました。Weaveのコスト列にはすべての呼び出しで$0.0000と表示されました。Solは完全なリストで10回中10回マッチを逃し、タイトルと本文のみで10回中10回見つけました。より少ないテキストを送信することでより良い回答が得られました。両方のモデルがほぼすべての回答で5の信頼度を報告しました。5未満でエスカレートするルールはほとんど発動しないため、あまり機能しません。記事ではテストの弱点も指摘しています。101件のマッチのうち1件だけがテキストの読み取りに依存しているため、テストは理解度を測定するよりもはるかにコストを測定しています。
出典: Towards Data Science · 要約:HeadlinesBriefing