HeadlinesBriefing HeadlinesBriefing.com

Faire progresser l'utilisation de l'ordinateur avec Ironclad

OpenAI Blog •
×

Lorsque nous avons présenté GPT‑6 Astra, nous avons démontré jusqu'où nos modèles sont allés dans l'utilisation des ordinateurs pour le travail professionnel, de la préparation de documents aux tests de sites Web. Notre prochain objectif est de rendre les agents plus capables et efficaces dans l'utilisation de logiciels spécialisés pour résoudre des problèmes commerciaux complexes. Nous explorons comment former des modèles à comprendre les règles commerciales d'une entreprise, exécuter des flux de travail en plusieurs étapes et vérifier que leur travail répond aux exigences initiales.

Pour accélérer cette recherche, nous nous associons directement à un petit nombre de sociétés de logiciels qui comprennent le mieux ces flux de travail. Notre premier partenaire est Ironclad, un leader dans le domaine des contrats d'IA. En travaillant en étroite collaboration avec l'équipe d'Ironclad, nous avons développé des tâches qui obligent les agents à configurer des accords, des approbations et des conditions juridiques réutilisables. L'expertise d'Ironclad a été déterminante pour définir à quoi ressemble le succès et apporter les besoins réels des clients directement dans le développement de modèles de pointe.

GPT‑6 Astra est notre premier modèle de pointe formé sur les tâches d'Ironclad. Lors de notre évaluation de recherche, son score moyen était 32% plus élevé que celui de GPT‑5.6 Sol, tandis que le temps estimé par tentative était 48% inférieur. Les employés d'Ironclad et les personnes qui utilisent Ironclad chez Open AI ont aidé nos chercheurs à identifier 11 tâches dans les domaines juridique, commercial et des achats. Nous avons évalué chaque tâche selon 8 à 50 critères, en fonction de sa complexité.

Sur les 11 tâches de recherche, le score moyen d'Astra était de 55.0%, contre 41.6% pour GPT‑5.6 Sol, tandis que le temps moyen estimé par tentative est passé de 37,0 minutes pour Sol à 19,2 minutes pour Astra. Un modèle interne utilisé dans le développement d'Astra a obtenu un score encore plus fort de 63.7% sur ces tâches, et nous visons à apporter ces gains supplémentaires aux futurs modèles.

Source: OpenAI Blog · Résumé par HeadlinesBriefing