HeadlinesBriefing favicon HeadlinesBriefing.com

AI模型弃用的隐藏成本

Towards Data Science •
×

生产级AI的经常性成本并非推理。而是重新认证:每次模型在你脚下变更时,你都要重新运行评估、调整提示词并进行回归测试。那封邮件是在一个周二到达的。一个我们已经在生产环境中运行了将近一年、并且特意锁定到特定版本的模型,即将被弃用。我们有一个迁移窗口。在那之后,端点将开始返回错误。我们已经做了谨慎工程手册告诉你该做的一切。我们没有漂浮在一个可能在一夜之间在我们脚下变化的最新别名上。我们锁定了确切的模型版本,将其写入配置,并像对待任何其他我们不想在没有审查的情况下移动的依赖项一样对待它。锁定本应是安全的选择。弃用通知让一件被锁定悄悄掩盖的事情变得清晰:锁定模型版本并不能让你免于变化。它给你的是延迟。地面仍在移动。你只是可以选择那个周二。这一区别是生产级AI中预算最不足的成本。团队将他们的AI支出建模为推理:输入token、输出token,乘以价格。他们优化模型选择,优化提示词长度,争论更便宜的模型是否足够好。几乎没有人预算中有一行用于模型变更、整个系统必须再次被证明正确的那一天。我将把那一行称为重新认证税,到本文结束时,我希望你既能为它命名,也有办法围绕它进行规划。锁定实际上保护你免受什么,以及不能保护你免受什么 锁定模型版本确实是良好的实践。它阻止了静默行为漂移,即提供商在别名背后更新权重,你的输出在你自己的代码一行未改的情况下发生变化。如果你曾经看到评估分数在你自己的提交中找不到任何原因的情况下移动,你已经知道团队为什么要锁定。但锁定是你这一侧的门锁,而门提供商也控制着。提供商会弃用。2026年,节奏如果说有什么变化的话,那就是加速了:新的前沿模型每隔几个月发布,较旧的模型被日落,几家提供商已在短时间内退役模型。无论如何,大多数团队并不是在运行一个模型。当前现实,贯穿全年的工程调查所证实,是生产栈同时保持多个模型在飞:一个前沿模型用于困难推理,一个更便宜的模型用于常规调用,有时一个自托管模型用于不能离开大楼的数据。每一个都有自己的弃用时钟。所以锁定并没有消除变化。它将不可预测的变化转换为计划内的变化。这是一个真正的改进,因为计划内的变化是你可以配备人员和预算的事情。只有当你把锁定当作永久,并且没有为它到期的那一天在计划中放入任何东西时,它才是一场灾难。每个人都忘记定价的事情:模型不是唯一变化的东西 这就是使重新认证昂贵而非微不足道的地方。当你从一个模型版本迁移到下一个时,模型不是一个即插即用的部件。你建立在旧模型之上的几乎所有东西,无论你是否有意,都是针对该模型的特定行为调整的。你的提示词是针对它调整的。在旧模型上可靠产生结构化输出的措辞,在新模型上可能产生微妙不同的东西。你的少样本示例是根据它的怪癖校准的。你的护栏是针对它的失败模式设置的。你的输出解析器是针对它倾向于返回的特定形状加固的。你的温度和y……