HeadlinesBriefing HeadlinesBriefing.com

公寓搜索代理:减少模型调用,良好匹配

Towards Data Science •
×

在他们的论文《Frugal GPT: How to Use Large Language Models While Reducing Cost and Improving Performance》中,Lingjiao Chen、Matei Zaharia 和 James Zou 描述了三种降低调用大型语言模型(LLM)成本的方法:提示适配、LLM近似和LLM级联。作者报告称,他们的级联方法首先尝试更便宜的模型,并且可以在其测试的任务上,以高达98%的成本降低,匹配最佳单个模型的性能。我构建了一个可以逐次检查调用的小型代理。它根据租房者的需求检查公寓列表,例如奥斯汀两居室、低于1500美元、允许养狗。我的第一个版本将每个列表都发送给一个强大的模型,即使城市名称或租金数字已经排除了该列表。这意味着进行了2,500次模型调用来找到101个真实匹配。

本文衡量了三个起点,而不是一个。第一个将每一对都发送给模型。第二个是一个已经按城市搜索的代理。第三个在任何模型看到列表之前,对城市、卧室和租金进行数据库查询。我从2019年美国租赁广告的公共数据集中抽取了500个列表的固定样本。我编写了五个租房者需求,并根据相同的答案对每个版本的代理进行评分。强大的模型是Open AI的gpt-6-sol,我称之为Sol,更便宜的模型是gpt-6-luna,我称之为Luna。我使用Weights & Biases (W&B) Weave追踪了每次调用。

与数据库查询起点相比,最终版本的成本降低了约25倍。对于相同的2,500次检查,估计成本为0.008美元,而之前为0.20美元,最终版本返回了所有101个匹配,没有错误。让代码处理宠物字段约占成本下降的44%,使用更便宜的模型并搭配强大的备份约占39%。更短的提示和重复使用的答案构成了其余部分。

三个发现让我感到惊讶。Weave的成本列显示每次调用的成本为$0.0000。Sol在完整列表的情况下10次中有10次错过了一个匹配,而仅使用标题和正文时10次中有10次找到了它。发送更少的文本得到了更好的答案。两个模型几乎对每个答案都报告了5的置信度。一个在低于5时升级的规则几乎从未触发,因此它无法做太多工作。文章还指出了测试的弱点。101个匹配中只有一个依赖于阅读文本,因此测试衡量成本的能力远高于衡量理解能力。

来源: Towards Data Science · 由HeadlinesBriefing整理摘要