HeadlinesBriefing favicon HeadlinesBriefing.com

Retrieve-for-Train: Impulso de velocidad en la búsqueda con IA

Google AI Blog •
×

Las aplicaciones de búsqueda modernas deben devolver un conjunto coherente de resultados, no variaciones de una sola coincidencia. Para "equipo de camping", los usuarios quieren una tienda de campaña, un saco de dormir, una estufa y una linterna frontal. Los sistemas utilizan el fan-out de consultas para dividir un prompt amplio en subconsultas. Pero enseñar a un LLM a descomponer consultas con conocimiento de la base de datos consume un enorme presupuesto de pensamiento. Los LLM de cero disparos son predictores de texto generales, no están optimizados para un corpus objetivo, por lo que necesitan una computación extendida en tiempo de prueba para optimizar propiedades a nivel de conjunto como la diversidad y la cobertura mientras se mantienen fundamentados.

En el artículo de ICML 2026 "Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion", abordamos esto mediante un marco de compilación de recompensa a datos. En lugar de un gran presupuesto de pensamiento en inferencia, nuestro marco Retrieve-for-Train utiliza aprendizaje por refuerzo offline para descubrir fan-outs alineados con recompensas y compilarlos en supervisión. Al destilar estos comportamientos en un recuperador de difusión ligero, habilitamos un fan-out de consulta eficiente en una sola pasada durante la inferencia.

Los LLM listos para usar enfrentan dos desafíos: el colapso parafrástico, donde generan consultas redundantes como "moda de festival bohemio" y "ropa de festival bohemio" en lugar de chaquetas de flecos o vestidos de crochet; y los cuellos de botella de latencia autorregresiva, que requieren cientos de tokens de cadena de pensamiento. Esto crea un piso de latencia que está en conflicto con la búsqueda subsegundo. Retrieve-for-Train trata el entrenamiento como una sesión de práctica offline.

Entidades clave: Empresas: Google AI Blog