HeadlinesBriefing favicon HeadlinesBriefing.com

LLM केवल अगले-टोकन भविष्यवक्ता नहीं हैं

Hacker News •
×

सख्ती से कहें तो, "LLM अगले-टोकन भविष्यवक्ता हैं" यह कथन गलत नहीं है, लेकिन अधूरा है। यह एक अच्छा शून्य-क्रम अनुमान है और यह वास्तविक चीज़ पर आधारित है: ट्रांसफॉर्मर-आधारित भाषा मॉडल स्वप्रतिगामी रूप से टोकन उत्सर्जित करते हैं। पूर्व-प्रशिक्षण के दौरान, मॉडल बार-बार कुछ पिछले टोकन लेता है, उस टोकन को देखता है जो वास्तव में उनके बाद आया था, और उस टोकन को अगले नमूने के लिए अधिक संभावित बनाता है।

मुख्य बात यह है कि हर वास्तविक अगला टोकन प्रशिक्षण डेटा में मौजूद अनुक्रम से आता है। यह कहना शायद उचित है कि आधार मॉडल भी अगले-टोकन भविष्यवक्ता की तरह व्यवहार करता है। लेकिन हम जिन LLM का उपयोग करते हैं, वे केवल आधार मॉडल नहीं हैं। वे पोस्ट-प्रशिक्षित हैं, और आधुनिक पोस्ट-प्रशिक्षण का एक प्रमुख हिस्सा सत्यापन योग्य पुरस्कारों के साथ सुदृढीकरण सीखना (RLVR) है। पूर्व-प्रशिक्षण के दौरान, मॉडल केवल उन अनुक्रमों से सीखता है जो प्रशिक्षण डेटा में पहले से मौजूद हैं। RLVR के दौरान, मॉडल नए अनुक्रम उत्पन्न करके और उनके परिणामों से सीखकर अन्वेषण करता है।

शतरंज का सादृश्य इस अंतर को समझना आसान बनाता है। पहली प्रणाली ग्रैंडमास्टर खेलों के एक बड़े डेटाबेस पर प्रशिक्षित होती है और भविष्यवाणी करती है कि ग्रैंडमास्टर अगली चाल क्या खेलेगा। दूसरी एक आदर्श शतरंज इंजन है जिसने हर संभव खेल का पता लगाया है और वह चाल चुनता है जो जीतने की उच्चतम संभावना की ओर ले जाती है। दूसरी प्रणाली को "अगली-चाल भविष्यवक्ता" कहना अजीब होगा।

अन्य पोस्ट-प्रशिक्षण तकनीकें भी महत्वपूर्ण हैं। मानव प्रतिक्रिया से सुदृढीकरण सीखना (RLHF) मॉडल को एक सहायक सहायक का अनुकरण करने की ओर स्थानांतरित करता है। RLVR और आगे जाता है: यह LLM को अपने स्वयं के उत्पन्न अनुक्रमों से अन्वेषण और सीखने की अनुमति देता है।

सामान्य प्रश्न: LLM को केवल अगले-टोकन भविष्यवक्ता कहना अधूरा क्यों है?

हालांकि LLM स्वप्रतिगामी रूप से टोकन उत्सर्जित करते हैं, RLVR के साथ पोस्ट-प्रशिक्षण उन्हें अन्वेषण द्वारा उत्पन्न नए अनुक्रमों से सीखने की अनुमति देता है, न कि केवल मौजूदा डेटा से। यह उन्हें सरल भविष्यवक्ताओं की तुलना में पुरस्कारों को अनुकूलित करने वाले निर्णय-निर्माताओं की तरह बनाता है।