HeadlinesBriefing favicon HeadlinesBriefing.com

深入AI聊天机器人:按下Enter键时会发生什么

ByteByteGo •
×

当你在AI聊天机器人中按下Enter键时,大约会经历十几个处理阶段才能看到答案。输入的消息不会直接发送给模型——它会被组装成一个包含系统提示、工具定义、内存、知识库文档、对话历史和新输入的文档。这个过程称为上下文工程,它决定了哪些信息会到达模型以及以什么顺序到达。

模型在设计上是无状态的,这意味着它们会在每次交互时从头重建对话历史,并与其他用户共享资源。文本出现前的初始停顿涉及预填充和解码步骤、缓存和流式处理。不同提供商对这个文档的结构不同——有些会提前检索所有内容,有些则允许模型在处理过程中获取信息。

组装后的文档会影响准确性,因为模型的注意力预算是有限的。每增加一个token都会逐渐降低精度,即使是在简单任务上也是如此。这解释了为什么使用完全相同模型的两个产品可能会产生不同的答案——包装问题的文档不同。相同的底层模型架构,但不同的上下文工程方法,会导致输出不同。理解这一过程——从输入组装到安全检查再到流式响应——揭示了为什么AI响应可能会有所不同,以及在你按下Enter键和第一个单词出现之间那些看似空闲的秒内到底发生了什么。