HeadlinesBriefing favicon HeadlinesBriefing.com

PSSA: Rust AI मॉडल ट्रांसफॉर्मर को हराता है

Hacker News •
×

PSSA (प्लास्टिक स्टेट-स्पेस आर्किटेक्चर) एक छोटा भाषा मॉडल है जो रस्ट में शुरू से लिखा गया है, बिना PyTorch या TensorFlow के। ट्रांसफॉर्मर के विपरीत जो हर टोकन जोड़े का स्कोर देते हैं, PSSA एक आवर्ती स्टेट-स्पेस लेयर और एपिसोडिक मेमोरी बैंक के माध्यम से एक टोकन प्रति समय पर टेक्स्ट प्रोसेस करता है। 12.7M टोकन के विकी टेक्स्ट-103 पर, PSSA ने 3.98 ट्रेनिंग क्रॉस-एंट्रॉपी हासिल की, जबकि ट्रांसफॉर्मर का 4.43 रहा — 0.45 नैट का अंतर। अपरिचित डेटा पर, PSSA ने 3.997 बनाम 4.429 स्कोर किया, जिसमें अगले टोकन की सटीकता 24.1% बनाम 18.0% रही। 200 टोकन उत्पन्न करने में PSSA को 226ms लगे, जबकि ट्रांसफॉर्मर को 2,735ms लगे — CPU पर 12x तेज। मुख्य विशेषताओं में सीखी गई निरंतर राज्य मैट्रिक्स, 512-स्लॉट हाइपरबोलिक मेमोरी बैंक, रिफ्रैक्टरी गेटिंग वाले प्लास्टिक वजन, और रिज रिग्रेशन के माध्यम से बंद रूप संयोजन शामिल हैं। ये 1.5M-पैरामीटर अनुसंधान प्रोटोटाइप हैं, उत्पादन मॉडल नहीं। दोनों के लिए पाठ गुणवत्ता खराब रहती है, लेकिन PSSA बेहतर सीखने की दक्षता और गति दिखाता है।

आर्किटेक्चर ट्रांसफॉर्मर से मौलिक रूप से अलग है: लागू अनुक्रम लंबाई के साथ रैखिक रूप से बढ़ती है, न कि वर्गीय रूप से, और हर चरण पर संदर्भ को फिर से पढ़ा नहीं जाता है। एक आवर्ती मॉडल निश्चित आकार की स्थिति को आगे ले जाता है, जबकि ट्रांसफॉर्मर प्रति टोकन अपने पूरे संदर्भ विंडो को फिर से पढ़ते हैं।

PSSA रस्ट में हाथ से लिखी गई रैखिक बीजगणित का उपयोग करता है, जिसमें CUDA प्रशिक्षण पथ और स्केलर CPU संदर्भ कार्यान्वयन होता है (अधिकतम ग्रेडिएंट अंतर 2.98e-8)। तुलना सीखने की दक्षता पर केंद्रित है, न कि प्रवाहाहट पर।

अक्सर पूछे जाने वाले प्रश्न: PSSA ट्रांसफॉर्मर मॉडल से कैसे अलग है?

PSSA एक आवर्ती स्टेट-स्पेस लेयर का उपयोग करता है जो एक टोकन प्रति समय पर टेक्स्ट प्रोसेस करता है, जिसमें निश्चित आकार की स्थिति, एक एपिसोडिक मेमोरी बैंक, और प्रक्रिया के दौरान लिखित होने वाले प्लास्टिक वजन शामिल हैं। ट्रांसफॉर्मर ध्यान के माध्यम से हर टोकन जोड़े का स्कोर देते हैं, जिससे लागू में वर्गीय वृद्धि होती है। PSSA तेजी से सीखता है, CPU पर 12x तेजी से उत्पन्न करता है, और अपरिचित डेटा पर बेहतर सामान्यीकरण दिखाता है, हालांकि दोनों 1.5M-पैरामीटर अनुसंधान प्रोटोटाइप हैं जिनकी पाठ गुणवत्ता खराब है।