HeadlinesBriefing HeadlinesBriefing.com

Fortschrittliche Computernutzung mit Ironclad

OpenAI Blog •
×

Als wir GPT‑6 Astra vorstellten, zeigten wir, wie weit unsere Modelle bei der Nutzung von Computern für professionelle Arbeiten gekommen sind, von der Vorbereitung von Dokumenten bis zum Testen von Websites. Unser nächstes Ziel ist es, Agenten leistungsfähiger und effizienter im Umgang mit spezialisierter Software zu machen, um komplexe Geschäftsprobleme zu lösen. Wir erforschen, wie man Modelle trainieren kann, die Geschäftsregeln eines Unternehmens zu verstehen, mehrstufige Arbeitsabläufe auszuführen und zu überprüfen, ob ihre Arbeit den ursprünglichen Anforderungen entspricht.

Um diese Forschung zu beschleunigen, arbeiten wir direkt mit einer kleinen Anzahl von Softwareunternehmen zusammen, die diese Arbeitsabläufe am besten verstehen. Unser erster Partner ist Ironclad, ein führendes Unternehmen im Bereich KI-Verträge. In enger Zusammenarbeit mit dem Team von Ironclad haben wir Aufgaben entwickelt, die von Agenten verlangen, Vereinbarungen, Genehmigungen und wiederverwendbare rechtliche Bedingungen zu konfigurieren. Die Expertise von Ironclad war maßgeblich daran beteiligt, zu definieren, wie Erfolg aussieht, und echte Kundenbedürfnisse direkt in die Entwicklung von Grenzmodellen einzubringen.

GPT‑6 Astra ist unser erstes Grenzmodell, das an Ironclad-Aufgaben trainiert wurde. Bei unserer Forschungsevaluierung war seine durchschnittliche Punktzahl 32% höher als die von GPT‑5.6 Sol, während die geschätzte Zeit pro Versuch 48% niedriger war. Mitarbeiter von Ironclad und Personen, die Ironclad bei Open AI verwenden, halfen unseren Forschern, 11 Aufgaben in den Bereichen Recht, Handel und Beschaffung zu identifizieren. Wir bewerteten jede Aufgabe anhand von 8 bis 50 Kriterien, abhängig von ihrer Komplexität.

Bei den 11 Forschungsaufgaben lag die durchschnittliche Punktzahl von Astra bei 55,0%, verglichen mit 41,6% für GPT‑5.6 Sol, während die geschätzte durchschnittliche Zeit pro Versuch von 37,0 Minuten für Sol auf 19,2 Minuten für Astra sank. Ein internes Modell, das bei der Entwicklung von Astra verwendet wurde, erreichte mit 63,7% eine noch stärkere Leistung bei diesen Aufgaben, und wir streben an, diese weiteren Verbesserungen in zukünftige Modelle einzubringen.

Quelle: OpenAI Blog · Zusammengefasst von HeadlinesBriefing