HeadlinesBriefing favicon HeadlinesBriefing.com

ট্রান্সফর্মার সার্কিটগুলির গাণিতিক গঠন

Hacker News •
×

এই গবেষণাটি মেকানিস্টিক ইন্টারপ্রিটেবিলিটি এর মাধ্যমে ট্রান্সফর্মার ভাষা মডেলগুলির রিভার্স ইঞ্জিনিয়ারিংয়ের প্রাথমিক ধাপগুলি উপস্থাপন করে। যেমন GPT-3, LaMDA, Codex, Meena এবং Gopher এর মতো মডেলগুলি স্কেল করছে, তাদের উন্মুক্ততা অপ্রত্যাশিত ক্ষতিকর আচরণের ঝুঁকি তৈরি করে। মেকানিস্টিক ইন্টারপ্রিটেবিলিটি বিস্তারিত গণনাগুলির রিভার্স ইঞ্জিনিয়ারিং করার লক্ষ্য রাখে, যা বাইনারিক কোডকে সোর্স কোডে রিভার্স ইঞ্জিনিয়ারিং করার মতো, যা নিরাপত্তা সমস্যাগুলির জন্য সিস্টেম্যাটিক পদ্ধতি প্রদান করতে পারে।

লেখকরা শুধুমাত্র দুটি স্তর বা তার কম স্তরযুক্ত অ্যাটেনশন-অনলি ট্রান্সফর্মার অধ্যয়ন করেন, যা GPT-3-এর 96টি স্তরের সাথ অ্যাটেনশন এবং MLP ব্লকগুলি অগ্রাধিক পরিবর্তন করে। ট্রান্সফর্মার অপারেশনগুলিকে গাণিতিকভাবে সমতুল্য একটি কাঠামোতে ধারণা করে, তারা অভ্যন্তরীণ অপারেশনগুলির উপর উল্লেখযোগ্য বোঝা অর্জন করে। প্রধান্যমুল্য অবস্থানগুলির মধ্যে অন্তর্ভুক্ত হয়: শূন্য-স্তর ট্রান্সফর্মার ওজন থেকে সরাসরি অ্যাক্সেসযোগ্য bigram পরিসংখ্যান মডেল করে; এক-স্তর মডেল bigram এবং "skip-trigram" (ক্রম যেমন "A… B C") মডেলগুলির সমষ্টি, যার সরাসরি অ্যাক্সেসযোগ্য টেবিল আছে; এবং নির্দিষ্ট "ইন্ডাকশন হেডগুলি" ছোট মডেলগুলিতে ইন-কন্টেক্স্ট লার্নিং ব্যাখ্যা করে, যা কেবলমাত্র কমপক্ষে দুটি অ্যাটেনশন স্তরযুক্ত মডেলগুলিতে বিকশিত হয়।

এই কাঠামোর মধ্যে ভার্চুয়াল ওজন, যোগাযোগ চ্যানেল হিসাবে রেজিডুয়াল স্ট্রিম, স্বাধীন যোগীয় অ্যাটেনশন হেড, পাথ এক্সপানশন ট্রিক্স এবং QK/OV সার্কিট বিশ্লেষণের মতো ধারণাগুলি অন্তর্ভুক্ত আছে। যদিও এই প্রথম গবেষণাটি এখনও বড় মডেলগুলিতে প্রয়োগ করা হয়নি, ভবিষ্যৎ কাজ দেখায় যে কাঠামো এবং ইন্ডাকশন হেডগুলি বড় মডেলগুলির জন্য আংশিকভাবে প্রাসঙ্গিক থাকে, যদিও পূর্ণ রিভার্স ইঞ্জিনিয়ারিং এখনও দূরে আছে।

গুরুত্বপূর্ণ উপাদান: কোম্পানিগুলি: GPT-3, LaMDA, Codex, Meena, Gopher

প্রায়শই জিজ্ঞাসিত প্রশ্ন: ইন্ডাকশন হেডগুলি কী এবং কেন তা গুরুত্বপূর্ণ?

ইন্ডাকশন হেডগুলি নির্দিষ্ট অ্যাটেনশন হেডগুলি যা ছোট ট্রান্সফর্মার মডেলগুলিতে ইন-কন্টেক্স্ট লার্নিং ব্যাখ্যা করে। তা কেবলমাত্র কমপক্ষে দুটি অ্যাটেনশন স্তরযুক্ত মডেলগুলিতে বিকশিত হয়, যা যুক্তি দেয় যে ট্রান্সফর্মারগুলি কীভাবে প্রেক্ষাপট থেকে প্যাটার্ন কপি এবং অপূর্ণ করতে শিখেন এবং তার একটি মেকানিস্টিক ভিত্তি রয়েছে।

FAQ Q: ইন্ডাকশন হেডগুলি কী এবং কেন তা গুরুত্বপূর্ণ?

FAQ A: ইন্ডাকশন হেডগুলি নির্দিষ্ট অ্যাটেনশন হেডগুলি যা ছোট ট্রান্সফর্মার মডেলগুলিতে ইন-কন্টেক্স্ট লার্নিং ব্যাখ্যা করে। তা কেবলমাত্র কমপক্ষে দুটি অ্যাটেনশন স্তরযুক্ত মডেলগুলিতে বিকশিত হয়, যা যুক্তি দেয় যে ট্রান্সফর্মারগুলি কীভাবে প্রেক্ষাপট থেকে প্যাটার্ন কপি এবং অপূর্ণ করতে শিখেন এবং তার একটি মেকানিস্টিক ভিত্তি রয়েছে।