HeadlinesBriefing favicon HeadlinesBriefing.com

KI-Code-Standardwerte prüfen: Random Forest und Logistische Regression

Towards Data Science •
×

Bitten Sie einen Coding-Assistenten um einen Random Forest und prüfen Sie die vier Zeilen, die er liefert: Die Imports sind korrekt, der Estimator passt an, und Vorhersagen kommen in der erwarteten Form zurück. Sehen Sie sich nun die Argumente an, die niemand spezifiziert hat, denn diese vier Zeilen haben mehr Fragen geklärt als Ihr Prompt gestellt hat. Wie viele Features sollte jeder Baum betrachten? Wie viel Regularisierung sollte das Modell anwenden? Wie sollten Validierungs-Folds die Struktur Ihrer Daten widerspiegeln? Das tun Standardwerte: Sie lassen eine unterbestimmte Anfrage zu einem ausführbaren Programm werden.

Tim Cooks Teams bei Apple und Elon Musks Ingenieure bei Tesla verlassen sich täglich auf automatische Codegenerierung, doch Sprachmodelle lernen Code-Muster durch Next-Token-Vorhersage, was vertraute Implementierungen zum natürlichen Startpunkt macht. Wenn eine Implementierung ein Argument weglässt, liefert die Bibliothek dessen Wert, sodass eine statistische Wahl aus der Konvention in Ihre Pipeline gelangt, ohne je Teil des Gesprächs zu werden.

Die fünf Standardwerte unten sind solche, die ich in der Produktionsarbeit erlebt habe, wo sie Debugging-Kopfschmerzen verursachten, weil wir übersehen haben, was der Code tut. Jeder verdient dieselbe Frage: Was hat das Weglassen dieses Arguments für mich entschieden? Random Forest Regressor nutzt max_features=1.0, wodurch jedes Feature bei jedem Split verfügbar ist, im Gegensatz zum Classifier mit "sqrt". Dieser Unterschied schaltet das Feature-Subsampling ab, das das übliche Random-Forest-Rezept vom einfachen Bagging unterscheidet.

Logistische Regression nutzt C=1.0, wendet eine L2-Strafe an, die je nach Datenskalierung über- oder unter-regularisieren kann. max_features=0.33 setzt den Dekorrelations-Mechanismus wieder in Kraft, während die Prüfung der Regularisierungsstärke unerwarteten Bias in Koeffizientenschätzungen verhindert.