যখন আমরা GPT‑6 Astra চালু করি, আমরা প্রদর্শন করি যে পেশাদার কাজের জন্য কম্পিউটার ব্যবহারে আমাদের মডেলগুলি কতদূর এগিয়েছে, নথি প্রস্তুত করা থেকে ওয়েবসাইট পরীক্ষা করা পর্যন্ত। আমাদের পরবর্তী লক্ষ্য হল এজেন্টদের জটিল ব্যবসায়িক সমস্যা সমাধানের জন্য বিশেষায়িত সফ্টওয়্যার ব্যবহারে আরও সক্ষম এবং দক্ষ করে তোলা। আমরা অন্বেষণ করছি কিভাবে মডেলগুলিকে একটি কোম্পানির ব্যবসায়িক নিয়ম বুঝতে, বহু-পদক্ষেপ কর্মপ্রবাহ সম্পাদন করতে এবং তাদের কাজ মূল প্রয়োজনীয়তা পূরণ করে কিনা তা যাচাই করতে প্রশিক্ষণ দেওয়া যায়।
এই গবেষণাকে ত্বরান্বিত করতে, আমরা সরাসরি অল্প সংখ্যক সফ্টওয়্যার কোম্পানির সাথে অংশীদারিত্ব করছি যারা এই কর্মপ্রবাহগুলি সবচেয়ে ভালো বোঝে। আমাদের প্রথম অংশীদার হল Ironclad, AI চুক্তিতে একজন নেতা। Ironclad এর দলের সাথে ঘনিষ্ঠভাবে কাজ করে, আমরা এমন কাজ তৈরি করেছি যাতে এজেন্টদের চুক্তি, অনুমোদন এবং পুনর্ব্যবহারযোগ্য আইনি শর্তাবলী কনফিগার করতে হয়। সাফল্য কেমন দেখায় তা সংজ্ঞায়িত করতে এবং প্রকৃত গ্রাহকের প্রয়োজনীয়তা সরাসরি সীমান্ত মডেল উন্নয়নে আনতে Ironclad এর দক্ষতা গুরুত্বপূর্ণ ভূমিকা পালন করেছে।
GPT‑6 Astra হল Ironclad কাজের উপর প্রশিক্ষিত আমাদের প্রথম সীমান্ত মডেল। আমাদের গবেষণা মূল্যায়নে, এর গড় স্কোর GPT‑5.6 Sol এর চেয়ে 32% বেশি ছিল, যখন প্রতি প্রচেষ্টায় আনুমানিক সময় 48% কম ছিল। Ironclad এর কর্মচারী এবং Open AI এ Ironclad ব্যবহারকারী ব্যক্তিরা আমাদের গবেষকদের আইনি, বাণিজ্যিক এবং ক্রয় কাজ জুড়ে 11টি কাজ সনাক্ত করতে সাহায্য করেছেন। আমরা প্রতিটি কাজের জটিলতার উপর নির্ভর করে 8 থেকে 50টি মানদণ্ডের বিপরীতে মূল্যায়ন করেছি।
11টি গবেষণা কাজ জুড়ে, Astra এর গড় স্কোর ছিল 55.0%, তুলনায় GPT‑5.6 Sol এর 41.6%, যখন প্রতি প্রচেষ্টায় আনুমানিক গড় সময় Sol এর জন্য 37.0 মিনিট থেকে Astra এর জন্য 19.2 মিনিটে নেমে এসেছে। Astra এর উন্নয়নে ব্যবহৃত একটি অভ্যন্তরীণ মডেল এই কাজগুলিতে আরও শক্তিশালী 63.7% অর্জন করেছে এবং আমরা এই অতিরিক্ত লাভগুলি ভবিষ্যতের মডেলগুলিতে আনার লক্ষ্য রাখি।
উৎস: OpenAI Blog · সারাংশ: HeadlinesBriefing