HeadlinesBriefing favicon HeadlinesBriefing.com

ToolGrad : Génération efficace de jeux de données d'utilisation d'outils

Google AI Blog •
×

Les agents IA ont besoin de jeux de données de chaînes d'utilisation d'outils pour apprendre l'automatisation des tâches dans le monde réel. Les méthodes précédentes utilisaient des approches de requête d'abord avec des agents de recherche en profondeur (DFS) pour générer des données synthétiques, mais cela est inefficace en raison de l'exploration complexe. Dans "ToolGrad: Génération efficace de jeux de données d'utilisation d'outils avec des textes 'Gradients'", présenté à ACL 2026, les chercheurs introduisent un paradigme de réponse d'abord : générez une chaîne d'utilisation d'tools ground-truth d'abord, puis annotez son prompt utilisateur correspondant.

Cela réduit l'ambiguïté et ne nécessite qu'une seule étape LLM par échantillon. ToolGrad adapte le concept de textes gradient—originalement utilisé en ingénierie de prompts—pour construire itérativement des workflows API valides. Le cadre comprend quatre modules : API Proposer (réduit les candidats), API Exécuteurs (teste les APIs en parallèle), API Sélecteur (choisit la meilleure API via un retour textuel gradient), et LLM Updater (affine la requête et la réponse synthétiques).

Des expériences utilisant les 16k+ APIs réelles de Tool Bench montrent que ToolGrad génère des données d'utilisation d'outils plus complexes, à long horizon avec des taux de passage plus élevés et un coût inférieur aux méthodes basées sur le DFS. Les LLMs entraînés sur des données ToolGrad surpassent les modèles de base et égalent les LLMs propriétaires sur des jeux de données out-of-distribution (OOD) avec des outils non vus, démontrant une généralisation supérieure et une efficacité dans la génération de données synthétiques pour l'IA agente.