HeadlinesBriefing favicon HeadlinesBriefing.com

GLM-5.3-Flash类似Jev决策模型

Hacker News •
×

2026年9月24日 通过在单次前向传递中为每个选项提供概率的类型化决策:利用LLM匹配Jev的精度与速度。Marko Rosenmüller,博士,AITL技术负责人;DR:在本文中,我们展示了如何利用现成的LLM在单次前向传递中做出类型化决策。这种方法使得将LLM转化为类似Jev的决策模型成为可能。我们使用在Privatemode上运行的GLM-5.3-Flash对该方法进行评估。通过使用从公共数据集构建的基准测试,我们表明该设置在决策精度/正确性和速度方面与Type Safe的Jev相当。此外,使用GLM-5.3-Flash的设置还支持对图像进行类型化决策,而Jev无法实现这一点。工作原理 操场基准测试 为什么需要类型化决策 软件要求LLM做出的大部分决策都是这样的:“哪个团队应该处理这张工单?”或者“这个合同条款是否属于责任部分?”在这种情况下,软件通常要求LLM的响应遵循某种格式,如JSON,并且来自预定义的集合,如“是”和“否”。只要给出正确的指令,LLM通常已经能够可靠地实现这一点。然而,在基本方法中,速度和成本成为问题:对于每个决策,LLM都需要编写整个JSON对象,而推理模型在之前可能需要思考数百个令牌。此外,除非明确要求,否则你无法了解模型的置信度。所有这些方面在实践中可能非常重要,并且迄今为止阻止了人们在高容量/高吞吐量场景中使用LLM进行决策。专门的决策模型(或“系统一”模型)如Jev和Laya正是为此设计的。你输入一段状态和一组命名选项,然后你得到所选选项以及每个选项的置信值(即概率)。将LLM转化为决策模型 最初,我们问自己是否可以将LLM转化为具有类似Jev特性的决策模型。简短的回答是:“是”。在下面,我们展示了它是如何工作的。要理解我们的方法,重要的是要理解LLM是如何工作的:LLM永远不会直接写出文本。给定一个提示,LLM会输出其整个词汇表中令牌的概率分布。在文本生成中,在最简单的情况下,具有最高概率的令牌被选为下一个令牌。所选令牌然后被附加到提示中,整个过程重复进行。如上所述,如果你只是想在JSON对象中设置几个字段,这是昂贵且缓慢的。我们的核心见解是,没有必要让LLM预测整个JSON对象,因为我们已经知道它的形状。我们只对LLM对给定输入的类型化判断感兴趣。我们意识到,可以通过精心设计提示,使得我们能够在LLM的一次运行中获得类型化判断——无需微调,直接使用模型出厂时的状态。这与Jev和Laya的区别在于,后者是为此目的而训练的模型。基本步骤如下:对选项进行编号。状态、问题和输出选项作为JSON进入提示,并为每个选项添加索引。指令要求模型将第一个输出令牌作为决策答案...