HeadlinesBriefing favicon HeadlinesBriefing.com

LLM评判员一致性是否可信?依赖感知聚合方法

Hacker News •
×

想象一下,在评估一个检索增强生成系统时,多个LLM评判员评估同一段落。八个说“相关”;两个说“不相关”。十个里有八个一致听起来很有说服力,但一致性的强度取决于评判员的独立性。如果评判员共享提示模板、训练谱系、模型家族或盲点,他们可能会重复相同的错误,导致投票计数产生误导性的强烈信号。论文《用于LLM即评判员的依赖感知标签聚合:基于Ising模型》,由Shiva Kasiviswanathan合著并在ICML上发表,提出了一种评估评判员输出间相关性并调整聚合分数以确保意见多样性的方法。在三项任务的测试中,该方法在标准指标上比表现最好的基线——按历史准确性加权的专家组——高出9%到14%。多数表决假设评判员独立犯错,这对LLM即评判员系统来说往往过于乐观。两个评判员可能因相似的评分标准理解、共享的提示示例或共享的模型敏感性而共同失败。聚合器将专家组建模为一个网络,其中每个评判员都有可靠性概况,成对之间存在关系,他们的一致频率高于预测或提供互补视角。该方法使用Ising模型对评判员技能和相似性建模,这是一种表示二元变量间成对依赖的统计模型。存在两种建模变体:一种将关系模式视为在正负标签间保持一致,调整相关性权重;另一种是类别依赖模型,允许关系模式随标签变化,适用于评判员在明确项目上达成一致但在模糊项目上聚类的情况。该无监督方法从评判员输出中学习,无需人工参考标签,将真实标签视为潜在变量,联合推断评判员的可靠性和依赖性。