HeadlinesBriefing favicon HeadlinesBriefing.com

LLM-Klassifizierung ist Feature Engineering

Hacker News •
×

Die direkte Verwendung von LLM als Klassifizierer stellt erhebliche Herausforderungen dar: Sie erzeugen harte Labels ohne zuverlässige Kalibrierung, kämpfen darum, strukturierte Daten mit unstrukturiertem Text zu kombinieren, und fehlen an Interpretabilität, welche Prompt-Elemente Entscheidungen beeinflussen. LLM tragen zudem eingebaute Prioritäten, die möglicherweise nicht zur Klassenverteilung der Zielbevölkerung passen.

Die Lösung besteht darin, LLM-Ausgaben als Merkmale in einem traditionellen Machine-Learning-Framework zu behandeln. Ein LLM-Urteil mit logistischer Regression zu verpacken — p(y=1|x) = σ(α + β·LLM(x)) — stellt kalibrierte Wahrscheinlichkeiten wieder her, ermöglicht principienvolle Schwellensteuerung für precision-recall-Tradeoffs. Training mit gelabelten Daten passt das Modell an die spezifische Bevölkerungsbasis an und ermöglicht die Integration zusätzlicher strukturierter Kovariaten. Umgewichtete Beispiele können zudem unterschiedliche Interessenverteilungen ansteuern.