HeadlinesBriefing favicon HeadlinesBriefing.com

检索即训练:AI搜索速度提升

Google AI Blog •
×

现代搜索应用必须返回一组连贯的结果,而不是同一个匹配项的多种变体。对于“露营装备”,用户想要的是帐篷、睡袋、炉具和头灯。系统使用查询扇出来将宽泛的提示拆分为子查询。但教会LLM进行数据库感知的查询分解会消耗巨大的思考预算。零样本LLM是通用文本预测器,并非针对目标语料库优化,因此它们需要延长测试时计算来优化多样性、覆盖度等集合级属性,同时保持有据可依。

在ICML 2026论文《Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion》中,我们通过奖励到数据的编译框架来解决这一问题。我们的Retrieve-for-Train框架不依赖庞大的推理思考预算,而是使用离线强化学习来发现奖励对齐的扇出,并将其编译为监督信号。通过将这些行为蒸馏到轻量级扩散检索器中,我们能够在推理时实现高效的单次查询扇出。

现成LLM面临两个挑战:同义改写坍缩,即它们生成“波西米亚音乐节时尚”和“波西米亚音乐节服装”等冗余查询,而不是流苏夹克或钩针连衣裙;以及自回归延迟瓶颈,需要数百个思维链token。这造成了与亚秒级搜索相冲突的延迟下限。Retrieve-for-Train将训练视为一次离线练习。

关键实体:公司:Google AI Blog

FAQ:什么是Retrieve-for-Train框架?

Retrieve-for-Train是一个奖励到数据的编译框架,它使用离线强化学习来发现奖励对齐的扇出并将其编译为监督信号,然后将其蒸馏到轻量级扩散检索器中,以便在推理时实现高效的单次查询扇出。

FAQ Q:什么是Retrieve-for-Train框架?

FAQ A:Retrieve-for-Train是一个奖励到数据的编译框架,它使用离线强化学习来发现奖励对齐的扇出并将其编译为监督信号,然后将其蒸馏到轻量级扩散检索器中,以便在推理时实现高效的单次查询扇出。