HeadlinesBriefing favicon HeadlinesBriefing.com

编码代理的意图连续性

Towards Data Science •
×

我构建了一个系统,能自动发现、验证并应用早期交互中的相关需求,无需询问用户这些需求的来源。

核心教训:仅仅调出过往历史并不等同于知道哪些内容实际上仍然准确。一个基础的搜索设置只抓取到了编码代理所需需求的57%。添加一个验证层后,这一比例提升到了100%

8个任务中,基线一个都没做对,基础搜索做对了4个,而意图感知搜索全部8个都做对了。我完成这一切时使用了零嵌入、零向量数据库,并且管道中绝对没有任何LLM调用。

我搭建了一个编码代理工作流,起初运行得完美无缺。但一旦项目变得足够长,它就开始引发问题。当一个项目经过几十个步骤后,核心规则开始消失。没有人删除它们。上下文窗口并没有满。那些规则在技术上仍然留在聊天日志中。它们只是从雷达上消失了,因为新的请求没有触发代理去检查一个更早的决定是否仍然重要。

例如,你可能在第一天告诉代理永远不要在API响应中暴露内部数据库ID。六十条消息之后,你要求它构建一个新的身份验证流程。那个新请求完全没有提到ID。由于代理缺乏明确的理由去回顾,它跳过了那一步,并发布了一个泄露你试图保护的确切数据的端点。

这不是一个虚构的场景。这是我为本文使用的实际测试案例。下面,我将向你展示三种不同的方法如何处理这个确切的问题。

FAQ:编码代理中的意图连续性是什么?

意图连续性意味着将旧需求带入新任务而无需用户重复,同时如果更新的内容覆盖了该规则,则将其丢弃。

FAQ Q:编码代理中的意图连续性是什么?

FAQ A:意图连续性意味着将旧需求带入新任务而无需用户重复,同时如果更新的内容覆盖了该规则,则将其丢弃。