HeadlinesBriefing favicon HeadlinesBriefing.com

GLM-5.3-Flash বুদ্ধিমত্তা কর্মক্ষমতা মূল্য

Hacker News •
×

Artificial Analysis GLM-5.3-Flash মডেল বিশ্লেষণ উপস্থাপন করে। Artificial Analysis বুদ্ধিমত্তা সূচক v4.1.1-এ 9টি মূল্যায়ন অন্তর্ভুক্ত: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, Sci Code, Humanity's Last Exam, GPQA Diamond, Crit Pt, AA-Omniscience, AA-LCR। যুক্তি মডেলগুলি একটি বাল্ব আইকন দ্বারা নির্দেশিত হয়।

বুদ্ধিমত্তা সূচকে এই মূল্যায়নগুলি অন্তর্ভুক্ত, পদ্ধতিগত বিবরণ উপলব্ধ। বাণিজ্যিক ব্যবহার সীমিত হলে মডেলগুলিকে 'বাণিজ্যিক ব্যবহার সীমাবদ্ধ' বা লাইসেন্স বাণিজ্যিক ব্যবহার নিষিদ্ধ করলে 'অ-বাণিজ্যিক' হিসাবে লেবেল করা হয়। বুদ্ধিমত্তা মূল্যায়ন Artificial Analysis দ্বারা স্বাধীনভাবে পরিমাপ করা হয়, উচ্চ স্কোর ভাল।

AA-Omniscience সূচক জ্ঞান নির্ভরযোগ্যতা এবং হ্যালুসিনেশন পরিমাপ করে। এটি সঠিক উত্তরকে পুরস্কৃত করে, হ্যালুসিনেশনকে শাস্তি দেয় এবং উত্তর দিতে অস্বীকার করার জন্য কোনো শাস্তি নেই। স্কোর -100 থেকে 100 পর্যন্ত, যেখানে 0 মানে সঠিক এবং ভুল উত্তরের সংখ্যা সমান, এবং নেতিবাচক স্কোর মানে ভুল উত্তর বেশি।

তুলনার মধ্যে রয়েছে বুদ্ধিমত্তা সূচক বনাম প্রতি কাজের খরচ, ইনপুট, ক্যাশ হিট, ক্যাশ রাইট, যুক্তি এবং উত্তর টোকেন মূল্য থেকে ওজনযুক্ত গড় খরচ ব্যবহার করে। টোকেন ব্যবহার প্রতি বুদ্ধিমত্তা সূচক কাজের আউটপুট টোকেন হিসাবে পরিমাপ করা হয়, যা প্রতি মূল্যায়ন আউটপুট টোকেনকে বেঞ্চমার্ক ওজন দ্বারা গুণ করে গণনা করা হয়।

মূল সত্তা: কোম্পানি: Artificial Analysis