HeadlinesBriefing favicon HeadlinesBriefing.com

智能模型路由降低LLM成本10倍

ByteByteGo •
×

当应用程序采用大型语言模型(LLM)时,他们通常会选择最强大的模型。这意味着每个请求都会发送到那个昂贵的模型。虽然这种方法更容易实现,但从长远来看可能会变得相当昂贵。例如,像“将此支持工单分类为账单、技术或账户相关”这样的请求,不需要与“调查为什么这些财务记录不匹配并解释可能的原因”相同的推理水平。

通过智能模型路由,我们可以解决这个问题。在这种路由方法中,我们为每个请求选择特定的模型。换句话说,简单的工作被发送到可能更便宜的小模型,而困难的工作被路由到更强大的模型。如果大多数请求是简单的,这种方法可以大幅降低总成本,有时甚至降低约10倍。此外,响应的质量不会明显下降。

然而,成本降低并非必然。它还取决于应用程序接收的请求类型、模型之间的价格差异以及路由系统的性能。使用LLM API的总成本通常取决于处理的令牌数量。输入令牌包括用户消息、系统指令、对话历史以及提供给模型的任何文档。输出令牌是响应中生成的令牌。更大、更强大的模型通常成本更高,因为它们需要更多的计算资源。

例如,想象一个客户支持应用程序每月需要处理一百万次请求。如果每个请求都发送到最强大的模型,公司即使对于相当简单的工作也必须支付高价。你可以把这想象成雇佣一位高级软件架构师来重命名文件、整理支持工单和格式化日期——这是能力的浪费和资源管理不善。