HeadlinesBriefing favicon HeadlinesBriefing.com

GPT-5.6 Luna বনাম GPT-6 Astra: $1.20 কোড রিভিউ

Hacker News •
×

GPT-5.6 Luna প্রতি মিলিয়ন ইনপুট টোকেনে $0.20 এবং প্রতি মিলিয়ন আউটপুট টোকেনে $1.20 খরচ করে। GPT-6 Astra $10 এবং $50 খরচ করে। একই pull requests-এ, একটি Luna রিভিউয়ের খরচ $0.0041 এবং একটি Astra রিভিউয়ের খরচ $0.113, যা 28x পার্থক্য। Luna 50টি pull request জুড়ে 69টি যাচাইকৃত বাগ খুঁজে পেয়েছে; Astra 92টি পেয়েছে। পুরো রানের জন্য Luna-র খরচ $0.20 এবং Astra-র খরচ $5.66। Luna বেশি ভুল ছিল, এর 93টি ফাইন্ডিংয়ের মধ্যে 24টি যাচাইকরণে ব্যর্থ হয়েছে Astra-র 96টির মধ্যে 4টির বিপরীতে, এবং এটি 24টি নিরাপত্তা বাগের মধ্যে 9টি খুঁজে পেয়েছে যেখানে Astra 19টি পেয়েছে।

আমাদের মত: Luna সেই দামে দৈনন্দিন সঠিকতা বাগের জন্য যথেষ্ট ভালো, এবং আমরা এটিকে একা প্রমাণীকরণ বা অনুমতি কোড পর্যালোচনা করতে দেব না।

আমরা Astra বনাম Sol পোস্ট থেকে সেটআপ পুনরায় ব্যবহার করেছি। pull requestsগুলি হল AI-Code-Review-Evals সংস্থার 50টি পাবলিক বেঞ্চমার্ক PR, Cal.com, Sentry, Discourse, Keycloak এবং Grafana থেকে দশটি করে। Luna এবং Astra একই diffs-এ একই প্রম্পট পেয়েছে। প্রতিটি pull request-এর জন্য, Astra, Sol, Luna এবং পাবলিক Entelligence পর্যালোচকের মন্তব্য থেকে ফাইন্ডিংগুলি একটি বেনামী তালিকায় যায়। GPT-6 Astra এবং GPT-5.6 Sol প্রত্যেকে সেই তালিকাটি diff-এর বিরুদ্ধে আলাদাভাবে বিচার করে। একটি সমস্যা শুধুমাত্র যাচাইকৃত হিসাবে গণনা করা হয় যখন উভয় বিচারক এটিকে বাস্তব বলে।

Luna Astra-র 75% যাচাইকৃত বাগ খুঁজে পেয়েছে 3.6% টাকায়। প্রতি যাচাইকৃত বাগে, Astra 20x বেশি খরচ করেছে। Luna প্রতি রিভিউয়ে Astra-র চেয়ে 3.1x বেশি আউটপুট টোকেন লিখেছে এবং তবুও অনেক সস্তা হয়েছে, কারণ এর আউটপুট মূল্য 42x কম। এটি দ্রুতও ছিল, প্রতি রিভিউয়ে 23 সেকেন্ড বনাম 36।

মূল সত্তা: কোম্পানি: OpenAI, Cal.com, Sentry, Discourse, Keycloak, Grafana, Entelligence