HeadlinesBriefing favicon HeadlinesBriefing.com

LLM分类是特征工程,而非分类器

Hacker News •
×

使用LLM直接作为分类器存在重大挑战:它们产生硬标签且不可靠校准,难以将结构化数据与非结构化文本结合,且缺乏说明哪些提示元素影响决策的可解释性。LLM还携带可能不匹配目标人群类别分布的内置先验。

解决方案是将LLM输出作为传统机器学习框架中的特征。用逻辑回归包裹LLM判决——p(y=1|x) = σ(α + β·LLM(x))——即可恢复校准概率,从而实现精确-召回权衡的本质阈值控制。在标记数据上训练可将模型适应到特定人群基线,并允许整合额外的结构化协变量。重新加权示例进一步可针对不同分布的兴趣进行目标设定。

这种方法在保留LLM在非结构化数据方面的强大能力的同时,恢复了标准ML算法的理想属性:校准、灵活的特征整合以及更清晰的可解释性,说明LLM信号如何为最终预测做出贡献。LLM成为一个强大的特征提取器,而不是不可靠的端到端分类器。