HeadlinesBriefing favicon HeadlinesBriefing.com

GPT-6 Astra, লুপড ট্রান্সফরমার এবং লুকানো যুক্তি

Hacker News •
×

গত কয়েক সপ্তাহে অনেক কিছু ঘটেছে। আমি নিশ্চিত যে Open AI-এর GPT-6 Astra এখন সবার মনে শীর্ষে রয়েছে। বিশেষ করে, এর কর্মক্ষমতা, লুপড ট্রান্সফরমার/পুনরাবৃত্ত গভীরতার দিক এবং গুজব যে Astra তার যুক্তির চিহ্ন (অর্থাৎ চিন্তার শৃঙ্খল) "লুকিয়ে" রাখছে। তাই, এই নিবন্ধে, আমি Astra সম্পর্কে কিছু সংক্ষিপ্ত ছাপ এবং এই সব কোথায় যাচ্ছে সে সম্পর্কে কিছু চিন্তা দিয়ে শুরু করতে চাই। তারপর, আমি বিস্তারিত আলোচনা করব "লুপড ট্রান্সফরমার" কী, এবং এটি কীভাবে (বা বরং, যদি) চিন্তার শৃঙ্খল লুকানোর সাথে সম্পর্কিত। সবশেষে, লুপড ট্রান্সফরমারের মূল বিষয়গুলি কভার করার পরে, আমি এই বিষয়ে সাম্প্রতিক গবেষণাপত্র থেকে কিছু নতুন অন্তর্দৃষ্টি তুলে ধরতে চেয়েছিলাম।

প্রথমে প্রথম কথা। আর্কিটেকচারের গুজব এবং সম্পর্কিত গবেষণা সাহিত্যে যাওয়ার আগে, আমাকে সংক্ষেপে কিছু GPT-6 Astra পর্যবেক্ষণ এবং টিডবিটস সারসংক্ষেপ করতে দিন। গত সপ্তাহে, Open AI-এর নতুন GPT-6 Astra বড় ধুমধামের সাথে প্রকাশিত হয়েছিল। আমি গত কয়েক দিন ধরে এটি ব্যবহার করেছি, এবং এটি একটি অসাধারণ ভাল মডেল, সম্ভবত এই লেখার সময় পর্যন্ত আমি যা ব্যবহার করেছি তার মধ্যে সেরা। কিন্তু, ঠিক কী উন্নত হয়েছে, এবং কীভাবে? Astra এখন পর্যন্ত আমার ব্যবহৃত সেরা মডেল, এবং এটি 3D রেন্ডারিং এবং অ্যানিমেশন কাজে (অন্যান্য মডেলের তুলনায়) অসামঞ্জস্যপূর্ণভাবে ভাল। এর অর্থ, যদিও এটি তার GPT-5.6 পূর্বসূরিকে প্রায় সমস্ত বিভাগে (লেখা, গণিত, কোডিং এবং আরও অনেক কিছু) ছাড়িয়ে যায়, এটি বিশেষ করে গ্রাফিকাল ডেমোর ক্ষেত্রে তা করে। আমরা এটি বেঞ্চমার্কেও দেখতে পাই। উদাহরণস্বরূপ, GPT-6 Astra গণিত এবং কোডিংয়ে সত্যিই ভাল, যেমনটি নীচে দেখানো হয়েছে। হাইলাইটগুলির মধ্যে একটি (চিত্রে দেখানো হয়নি) হল যে Astra ARC-AGI-3 বেঞ্চমার্কে 99.9% অর্জন করে (GPT-5.6 Sol মাত্র 7.8%), যা যুক্তির ধাঁধা সমাধান এবং সাধারণীকরণের মিশ্রণ পরিমাপ করে। তবে, গণিত, কোডিং এবং কম্পিউটার ব্যবহারের বেঞ্চমার্কগুলি আরও আকর্ষণীয় কারণ তারা বাস্তব-বিশ্বের ব্যবহারের কাছাকাছি।

Artificial Analysis কোডিং এজেন্ট ইনডেক্স v1.4-এ ফিরে এসে (পূর্ববর্তী চিত্রের নীচে ডানদিকে), যা বেশ কয়েকটি এজেন্টিক কোডিং কাজকে মিশ্রিত করে, GPT-6 Astra স্পষ্টভাবে সীমান্তে রয়েছে, তবে এটি লাফিয়ে লাফিয়ে এগিয়ে যায় না। এটি নীচে দেখানো সাধারণ Artificial Analysis ইন্টেলিজেন্স ইনডেক্সেও দেখা যায়, যা শুধুমাত্র কোডিং কাজ নয়, বিভিন্ন ধরণের কাজকে মিশ্রিত করে। এখন, Artificial Analysis বেঞ্চমার্কগুলির বড় সুবিধা হল যে তারা স্বাধীন এবং তাই মডেল বিকাশকারীদের দ্বারা স্ব-মূল্যায়িত বেঞ্চমার্কের চেয়ে কিছুটা বেশি বিশ্বাসযোগ্য হতে পারে। হারনেস সেটআপ বেঞ্চমার্কের উপর নির্ভর করে। উদাহরণস্বরূপ, GDPval-AA এবং AA-Briefcase তাদের ওপেন-সোর্স, ন্যূনতম Stirrup হারনেস ব্যবহার করে বিভিন্ন LLM-এর তুলনা করে। উপরে দেখানো ইন্টেলিজেন্স ইনডেক্স v4.2-এ, Terminal-Bench v2.1 Terminus 2 ব্যবহার করে, এবং τ³-Banking τ-Bench হারনেস ব্যবহার করে। পৃথক কোডিং এজেন্ট ইনডেক্স বিভিন্ন কোডিং-এজেন্ট হারনেসের তুলনাও করে। যে মূল্যায়নগুলি একটি ভাগ করা হারনেস ব্যবহার করে, এটি এটিকে আরও আপেল-থেকে-আপেল তুলনা করে তোলে। একই সময়ে, মডেল প্রশিক্ষণের সময়, মডেলগুলি সাধারণত একটি প্রাথমিক হারনেসকে মাথায় রেখে বিকশিত হয় (এবং অন্যান্য হারনেসে কম ফাইন-টিউন করা হয়)। এছাড়াও, প্রাথমিক হারনেসটি প্রায়শই একটি মডেলের শক্তিগুলিকে উপযুক্ত এবং প্রশস্ত করার জন্য বিকশিত হয়। সুতরাং, কিছু এজেন্টিক মূল্যায়ন Astra তার প্রাথমিক হারনেসে কতটা ভাল পারফর্ম করে তা কম মূল্যায়ন করতে পারে। এটি তার ইন্টেলিজেন্স ইনডেক্স স্কোরকে কতটা প্রভাবিত করে তা একই কাজে হারনেস জুড়ে Astra-এর তুলনা করে পরীক্ষা করা দরকার। একটি পাশের নোট হিসাবে, যেমন একজন সহকর্মী সম্প্রতি আমাকে পরামর্শ দিয়েছেন (Claude Code লিড দ্বারাও সুপারিশ করা হয়েছে), আপনার কিছু বিদ্যমান AGENTS.md বিষয়বস্তু এবং SKILL.md ফাইল মুছে ফেলা (/আর্কাইভ করা) খারাপ ধারণা নাও হতে পারে, কারণ নতুন LLM প্রম্পট বোঝার এবং হাতের সমস্যা সমাধানে আরও দক্ষ হয়ে উঠেছে। অতিরিক্ত হাত ধরা নতুন মডেলগুলিকে অপ্রয়োজনীয়ভাবে সীমাবদ্ধ করতে পারে এবং খারাপ সমাধানের দিকে নিয়ে যেতে পারে। অবশ্যই, আমি আবার কখনও SKILL.md ফাইল ব্যবহার না করার পরামর্শ দিচ্ছি না, তবে কিছু ওয়ার্কফ্লোরের জন্য, কারণ তারা পুনরায় ব্যবহারের সময় দক্ষতা উন্নত করতে পারে, যদি...