আমরা GPT‑6.1 Sol চালু করছি, যা GPT‑6 Sol-এর একটি আপগ্রেড যা এজেন্টিক কোডিং, কম্পিউটার ব্যবহার এবং পেশাদার কাজে GPT‑6 Astra-এর বুদ্ধিমত্তার প্রায় কাছাকাছি, Astra-এর স্ট্যান্ডার্ড ইনপুট এবং আউটপুট টোকেন মূল্যের পাঁচ ভাগের এক ভাগে। ক্যাশড ইনপুট খরচ মাত্র $0.10 প্রতি মিলিয়ন টোকেন—স্ট্যান্ডার্ড ইনপুট মূল্যের চেয়ে 95% কম এবং GPT‑6 Sol-এর ক্যাশড ইনপুট মূল্যের চেয়ে 50% কম—যা ডেভেলপারদের সক্ষম এজেন্ট তৈরি এবং চালানোর জন্য আরও জায়গা দেয় যা অনুরোধের মধ্যে প্রসঙ্গ পুনঃব্যবহার করে।
GPT‑6.1 Sol গুরুত্বপূর্ণ দৈনন্দিন কাজের জন্য ক্ষমতা এবং খরচের একটি নতুন ভারসাম্য প্রদান করে। এটি জটিল পেশাদার কাজে GPT‑6 Sol-এর তুলনায় উল্লেখযোগ্য উন্নতি প্রদান করে, কোড লেখা এবং ডিবাগ করা থেকে শুরু করে ডকুমেন্ট বোঝা এবং বহু-ধাপ ব্যবসায়িক ওয়ার্কফ্লো সম্পাদন পর্যন্ত। এই মূল্যায়নগুলির মধ্যে কয়েকটিতে, এটি উল্লেখযোগ্যভাবে কম খরচে GPT‑6 Astra-এর কর্মক্ষমতার কাছাকাছি পৌঁছে।
Deep SWE v1.1-এ, GPT‑6.1 Sol প্রায় পাঁচ ভাগের এক ভাগ খরচে GPT‑6 Astra-এর সাথে মেলে, যখন GPT‑6 Sol-এর সেরা স্কোরকে 6.4 শতাংশ পয়েন্টে ছাড়িয়ে যায়। GDP.pdf-এ, এটি Opus 5.5-এর চেয়ে বেশি স্কোর করে, ফলব্যাক সহ, প্রতি কাজে অর্ধেকেরও কম খরচে। Automation Bench-এ, এটি মাঝারি যুক্তি প্রচেষ্টায় Opus 5.5-এর চেয়ে 2.2 শতাংশ পয়েন্ট বেশি স্কোর করে, প্রায় এক তৃতীয়াংশ খরচে।
GPT‑6.1 Sol কম্পিউটার ব্যবহার এবং বৈজ্ঞানিক গবেষণায়ও উল্লেখযোগ্য অগ্রগতি করে। OSWorld 2.0-এর অফলাইন সেটে, এটি অর্ধেকেরও কম খরচে GPT‑6 Sol-এর চেয়ে সাত শতাংশ পয়েন্ট ভালো করে। Terminal-Bench Science 0.1-এ, এটি প্রতি কাজে অর্ধেকেরও কম খরচে GPT‑6 Sol-এর স্কোর দ্বিগুণেরও বেশি করে। এটি তথ্যগত নির্ভুলতাও উন্নত করে, কম যুক্তি প্রচেষ্টায় ত্রুটি 11.4% থেকে 7.7% এ হ্রাস করে।