HeadlinesBriefing favicon HeadlinesBriefing.com

Intelligence Index v4.2 প্রকাশিত

Hacker News •
×

Artificial Analysis এর Intelligence Index v4.2 প্রকাশিত হয়েছে, যা একটি অন্তরিম আপডেট যা অগ্রসর মডেলের দ্রুত অগ্রাধিকার অনুসরণ করতে সপ্তাহিক v5 রিলিজের পরিকল্পনায় উল্লিখিত উপাদানগুলিকে ত্বরান্বিত করে। এই আপডেটটি আরও জটিল এবং বাস্তব সত্ত্বেও কাজগুলি চালু করে এবং ব্যক্তিগত, আলাদাভাবে রাখা পরীক্ষার সেটগুলিকে Index ওজনের 40% পর্যন্ত বাড়িয়ে — যা v4.1 এর চেয়ে দ্বিগুণ — যাতে মূল্যায়নকে বাধা না দিয়ে সহজে চেষ্টা করা যায়। দুটি গুরুত্বপূর্ণ মূল্যায়ন যোগ করা হয়েছে: AA-Briefcase, একটি আন্তর্নির্মিত এজেন্ট-ভিত্তিক জ্ঞান কর্ম বেঞ্চমার্ক, যার ব্যক্তিগত পরীক্ষার সেটগুলি সহায়তা করে যাদ্বার ফাইলগুলিতে হাজার হাজার সূত্র থেকে বহুসাপ্তাহিক প্রকল্পগুলি পরীক্ষা করে, এবং Surge AI-এর GDP.pdf, যা 4,592 পৃষ্ঠার PDF-এ দীর্ঘ-প্রেক্ষাপট নথি যুক্তিবিদ্যা মূল্যায়ন করে 1,275টি বিশেষজ্ঞ রচিত পরম মানদণ্ড নিয়ে। গ্রেডিং অবকাঠামোর আপগ্রেড অন্তর্ভুক্ত হয়েছে AA-LCR v1.1-এ উন্নত গ্রেডিং নির্ভুলতা, GDPval-AA v2 এবং AA-Briefcase-এর জন্য স্থিতিশীল Elo রেটিং, এবং Sci Code-এর জন্য আরও robust গ্রেডিং স্যান্ডবক্স। মূল ফলাফলগুলি দেখায় যে Anthropic-এর Claude Fable 5.1 Index-এ অগ্রণী, যাকে অনুসরণ করে Open AI-এর GPT-6 Astra, যা GPT-5.6 Sol-এর চেয়ে 4 পয়েন্ট বেশি পায়। Meta তৃতীয় স্থানে রয়েছে, যার পরে Space XAI, Moonshot/Kimi, Z.AI এবং Google অনুসরণ করে। Cost per Task প্যারেটো সীমানা Anthropic, Open AI, Meta এবং Z.AI শেয়ার করে, যেখানে GPT-6 Astra বুদ্ধিমত্ব সীমানার কাছাকাছি আউটপুট টোকেন দক্ষতা সীমানাকে ধরে রাখে।