HeadlinesBriefing favicon HeadlinesBriefing.com

Retrieve-for-Train : Boost de vitesse pour la recherche IA

Google AI Blog •
×

Les applications de recherche modernes doivent renvoyer un ensemble cohérent de résultats, et non des variations d'une seule correspondance. Pour « matériel de camping », les utilisateurs veulent une tente, un sac de couchage, un réchaud et une lampe frontale. Les systèmes utilisent le fan-out de requêtes pour décomposer une invite large en sous-requêtes. Mais apprendre à un LLM une décomposition de requêtes consciente de la base de données épuise un budget de réflexion massif. Les LLM zero-shot sont des prédicteurs de texte généraux, non optimisés pour un corpus cible, ils ont donc besoin d'un calcul étendu au moment du test pour optimiser des propriétés au niveau de l'ensemble comme la diversité et la couverture tout en restant ancrés.

Dans l'article ICML 2026 « Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion », nous abordons cela via un framework de compilation récompense-vers-données. Au lieu d'un grand budget de réflexion à l'inférence, notre framework Retrieve-for-Train utilise l'apprentissage par renforcement hors ligne pour découvrir des fan-outs alignés sur la récompense et les compiler en supervision. En distillant ces comportements dans un retriever de diffusion léger, nous permettons un fan-out de requêtes efficace en une seule passe à l'inférence.

Les LLM prêts à l'emploi font face à deux défis : l'effondrement paraphrastique, où ils génèrent des requêtes redondantes comme « mode festival bohème » et « vêtements festival bohème » au lieu de vestes à franges ou de robes en crochet ; et les goulots d'étranglement de latence autorégressive, nécessitant des centaines de tokens de chaîne de pensée. Cela crée un plancher de latence en contradiction avec une recherche inférieure à la seconde. Retrieve-for-Train traite l'entraînement comme une séance de pratique hors ligne.

Entités clés : Entreprises : Google AI Blog

FAQ : Qu'est-ce que le framework Retrieve-for-Train ?

Retrieve-for-Train est un framework de compilation récompense-vers-données qui utilise l'apprentissage par renforcement hors ligne pour découvrir des fan-outs alignés sur la récompense et les compiler en supervision, puis les distille dans un retriever de diffusion léger pour un fan-out de requêtes efficace en une seule passe à l'inférence.

FAQ Q : Qu'est-ce que le framework Retrieve-for-Train ?

FAQ A : Retrieve-for-Train est un framework de compilation récompense-vers-données qui utilise l'apprentissage par renforcement hors ligne pour découvrir des fan-outs alignés sur la récompense et les compiler en supervision, puis les distille dans un retriever de diffusion léger pour un fan-out de requêtes efficace en une seule passe à l'inférence.