HeadlinesBriefing favicon HeadlinesBriefing.com

上下文窗口不知道什么仍然有效 - 有效性层基准测试

Towards Data Science •
×

我用纯 Python 构建了一个确定性基准测试,用于测量在过时上下文上行动的成本。核心问题:上下文窗口记住了发生了什么,但不知道这些信息是否仍然有效。两个执行者执行相同的工作——一个在行动前验证依赖关系,另一个在失败后才发现无效性。这种小差异会产生可测量的步骤浪费和失败任务。

我运行了 96 种配置的扫描,本以为图形形状会驱动浪费的工作,但规模才是真正的驱动因素。我更新了实验,而不是强行假设,从而得到了更精确的结果。该基准测试使用航班定价场景:在 10:00 时,航班 A 价格为 420 美元,计划在 10:01 形成,价格在 10:03 升至 610 美元,然而基线仍然基于陈旧的 420 美元假设在 10:04 预订。验证感知的执行者在行动前检查价格有效性并立即重新规划。

这不是上下文丢失——没有任何内容被遗忘或省略。导致错误决策的事实仍然在窗口内,但早在几分钟前就不再真实了。有效性层不预测未来;它在依赖这些事实的行动之前重新验证事实。可运行的演示仓库展示了基于真实数字的执行者之间确定性差距。