HeadlinesBriefing favicon HeadlinesBriefing.com

TabPFN এবং TabICL বনাম টিউন করা XGBoost: যা প্রশিক্ষণ না করে মডেল ১৪/১৪ জিতেছে

Hacker News •
×

এই দাবি মাস্টার চলছে এবং এটি পরিমাপ করার জন্য যথেষ্ট সংক্ষিপ্ত: একটি টেবল ফাউন্ডেশন মডেল একটি টেবল पर बिना कभी उसे प्रशिक्षण दिए भविष्यवाणी करता है और फिर भी ट्यून किए गए बूस्टिंग को हरा देता है। यदि यह सच है, तो आधे दशक की प्रैक्टिस का आकार बदल जाता है। हाइपरपैरामीटर की खोज अनिवार्य कदम रहना बंद कर देती है और एक ऐसी विलासिता बन जाती है जो कभी-कभी लाभदायक नहीं होती। इसलिए मैंने इसे अपने włas कार्ड पर परीक्षण किया, चौदह डेटासेट, चार प्रतियोगी और सबके लिए एक ही स्टॉपवॉच के साथ। एक टेबल फाउंडेशन मॉडल लाखों संश्लेषित टेबल पर प्री-ट्रेन किया जाता है जो विशेष रूप से उत्पन्न किए गए होते हैं। जब एक नई टेबल आती है, तो वह एक भी वजन को समायोजित नहीं करती: वह ट्रेनिंग रो को संदर्भ के रूप में प्राप्त करती है और एक फॉरवर्ड पास में भविष्यवाणियां उत्पन्न करती है। यह वही इन-कॉन्टेक्स्ट लर्निंग का विचार है जो हम भाषा मॉडल से पहले से जानते हैं, बस शब्दों से कॉलम तक ले जाया गया है। यही कारण है कि क्रिया “ट्रेन” अजीब लगती है: कोड अभी भी इसे fit कहता है, लेकिन भीतर कोई ग्रेडिएंट डिसेंट नहीं है, बस कार्ड पर डेटा की एक कॉपी है। यही कारण है कि लागत ऐसी जगह दिखती है जहां आप उम्मीद नहीं करते। फिटिंग लगभग मुफ्त है और भविष्यवाणी वह है जो लागत आती है, ठीक उल्टा एक पेड़ की तरह। इसे ऐसा कहने से यह अमूर्त लगता है, इसलिए यहाँ एक पंक्ति की पूरी यात्रा है: एक अनुरोध आता है जिसमें एक खाली सेल होता है, मॉडल इसे पहले हुए सबके खिलाफ तौलता है, में एक पास में इसे हल करता है और एक भविष्य लौटाता है। मैंने मापे गए छह मामलों में से किसी एक को चुनकर उनके वास्तविक डेटा पर देखें: डिफ़ॉल्ट जोखिम, बिक्री अभियान, क्लिनिकल रीएडमिशन, पुनरावृत्ति, बिजली की मांग, आणविक स्क्रीनिंग।