HeadlinesBriefing favicon HeadlinesBriefing.com

Vérifier les défauts du code IA : Random Forest et Régression Logistique

Towards Data Science •
×

Demandez à un assistant de codage un random forest et inspectez les quatre lignes qu'il vous donne : les imports sont corrects, l'estimateur s'ajuste, et les prédictions reviennent dans la forme attendue. Regardez maintenant les arguments que personne n'a spécifiés, car ces quatre lignes ont tranché plus de questions que votre prompt n'en posait. Combien de caractéristiques chaque arbre doit-il considérer ? Combien de régularisation le modèle doit-il appliquer ? Comment les plis de validation doivent-ils refléter la structure de vos données ? C'est ce que font les valeurs par défaut : elles permettent à une requête sous-spécifiée de devenir un programme exécutable.

Les équipes de Tim Cook chez Apple et les ingénieurs de Elon Musk chez Tesla s'appuient quotidiennement sur la génération de code automatisée, mais les modèles de langage apprennent les patterns de code par prédiction du token suivant, faisant des implémentations familières un point de départ naturel. Quand une implémentation omet un argument, la bibliothèque fournit sa valeur, laissant un choix statistique passer de la convention dans votre pipeline sans jamais faire partie de la conversation.

Les cinq valeurs par défaut ci-dessous sont celles que j'ai rencontrées en production, où elles ont causé des maux de tête de débogage car nous avons négligé ce que le code faisait. Chacune mérite la même question : qu'a décidé pour moi le fait de laisser cet argument de côté ? Random Forest Regressor utilise max_features=1.0, rendant chaque caractéristique disponible à chaque division, contrairement au classifieur avec "sqrt". Cette différence désactive le sous-échantillonnage de caractéristiques qui distingue la recette habituelle du random forest du simple bagging.

Régression Logistique utilise C=1.0, appliquant une pénalité L2 qui peut sur-régulariser ou sous-régulariser selon l'échelle de vos données. Définir max_features=0.33 restaure le mécanisme de décorrélation, tandis qu'examiner la force de régularisation empêche un biais inattendu dans les estimations de coefficients.