HeadlinesBriefing favicon HeadlinesBriefing.com

TabPFN und TabICL gegenüber eingestelltem XGBoost: Das Modell, das nicht trainiert, gewann 14/14

Hacker News •
×

Diese Behauptung kursiert seit Monaten und ist konkret genug, um messbar zu sein: Ein tabulares Foundation-Modell prognostiziert auf einer Tabelle, ohne je darauf trainiert worden zu sein, und schlägt dennoch das getunte Boosting. Wenn das wahr ist, ändert sich die Form eines halben Jahrzehnts Praxis. Das Suchen nach Hyperparametern ist kein obligatorischer Schritt mehr und wird zu einem Luxus, der sich manchmal nicht auszahlt.

Deshalb habe ich es auf meiner eigenen Grafikkarte getestet, mit vierzehn Datensätzen, vier Konkurrenten und derselben Stoppuhr für alle. Ein tabulares Foundation-Modell wird auf Millionen synthetischer Tabellen vortrainiert, die speziell dafür erzeugt wurden. Wenn eine neue Tabelle eintrifft, justiert sie kein einziges Gewicht: Sie nimmt die Trainingszeilen als Kontext auf und erzeugt die Vorhersagen in einem einzigen Forward-Pass.

Es ist dieselbe Idee des In-Context-Lernens, die wir bereits aus Sprachmodellen kennen, nur übertragen von Wörtern auf Spalten. Deshalb klingt das Verb „trainen“ seltsam: Der Code ruft es immer noch fit auf, aber innen findet kein Gradientenabstieg statt, stattdessen wird eine Kopie der Daten auf die Karte gebracht. Deshalb erscheint die Kosten dort, wo man sie nicht erwartet: Das Fitten ist nahezu kostenlos und die Vorhersage ist es, was kostet — genau das Gegenteil eines Baums.

So ausgedrückt klingt das abstrakt, deshalb hier der vollständige Weg einer Zeile: Eine Anfrage kommt mit einer leeren Zelle an, das Modell wiegt sie gegen alles, was bisher passiert ist, löst sie in einem Durchgang auf und gibt eine Zukunft zurück. Wähle einen der sechs Fälle, die ich gemessen habe, um es mit ihren echten Daten zu sehen: Ausfallrisiko, Verkaufskampagne, klinische Wiederaufnahme, Rezidiv, Stromnachfrage, Molekulare Screening.