HeadlinesBriefing favicon HeadlinesBriefing.com

TabPFN और TabICL बनाम ट्यून किया गया XGBoost: जो मॉडल नहीं trains करता उसने 14/14 जीता

Hacker News •
×

यह दावा महीनों से चल रहा है और यह पर्याप्त रूप से ठोस है कि इसे मापा जा सके: एक टेबल फाउंडेशन मॉडल एक टेबल पर बिना कभी उसे ट्रेन किए भविष्यवाणी करता है और फिर भी ट्यून किए गए बूस्टिंग को हरा देता है। यदि यह सच है, तो आधे दशक की प्रैक्टिस का आकार बदल जाता है। हाइपरपैरामीटर की खोज अनिवार्य कदम रहना बंद कर देती है और एक ऐसी विलासिता बन जाती है जो कभी-कभी लाभदायक नहीं होती। इसलिए मैंने इसे अपने włas कार्ड पर परीक्षण किया, चौदह डेटासेट, चार प्रतियोगी और सबके लिए एक ही स्टॉपवॉच के साथ। एक टेबल फाउंडेशन मॉडल लाखों संश्लेषित टेबल पर प्री-ट्रेन किया जाता है जो विशेष रूप से उत्पन्न किए गए होते हैं। जब एक नई टेबल आती है, तो वह एक भी वजन को समायोजित नहीं करती: वह ट्रेनिंग रो को संदर्भ के रूप में प्राप्त करती है और एक फॉरवर्ड पास में भविष्यवाणियां उत्पन्न करती है। यह वही इन-कॉन्टेक्स्ट लर्निंग का विचार है जो हम भाषा मॉडल से पहले से जानते हैं, बस शब्दों से कॉलम तक ले जाया गया है। यही कारण है कि क्रिया “ट्रेन” अजीब लगती है: कोड अभी भी इसे fit कहता है, लेकिन भीतर कोई ग्रेडिएंट डिसेंट नहीं है, बस कार्ड पर डेटा की एक कॉपी है। यही कारण है कि लागत ऐसी जगह दिखती है जहां आप उम्मीद नहीं करते। फिटिंग लगभग मुफ्त है और भविष्यवाणी वह है जो लागत आती है, ठीक उल्टा एक पेड़ की तरह। इसे ऐसा कहने से यह अमूर्त लगता है, इसलिए यहाँ एक पंक्ति की पूरी यात्रा है: एक अनुरोध आता है जिसमें एक खाली सेल होता है, मॉडल इसे पहले हुए सब कुछ के खिलाफ तौलता है, एक पास में एक पास में इसे हल करता है और एक भविष्य लौटाता है। मैंने मापे गए छह मामलों में से किसी एक को चुनकर उनके वास्तविक डेटा पर देखें: डिफ़ॉल्ट जोखिम, बिक्री अभियान, क्लिनिकल रीएडमिशन, पुनरावृत्ति, बिजली की मांग, आणविक स्क्रीनिंग।