HeadlinesBriefing favicon HeadlinesBriefing.com

Verificar valores predeterminados en código IA: Random Forest y Regresión Logística

Towards Data Science •
×

Pida a un asistente de codificación un random forest e inspeccione las cuatro líneas que le da: las importaciones son correctas, el estimador se ajusta y las predicciones vuelven en la forma esperada. Ahora mire los argumentos que nadie especificó, porque esas cuatro líneas han resuelto más preguntas de las que su solicitud planteó. ¿Cuántas características debe considerar cada árbol? ¿Cuánta regularización debe aplicar el modelo? ¿Cómo deben reflejar los pliegues de validación la estructura de sus datos? Eso es lo que hacen los valores predeterminados: permiten que una solicitud subespecificada se convierta en un programa ejecutable.

Los equipos de Tim Cook en Apple y los ingenieros de Elon Musk en Tesla dependen de la generación automática de código a diario, pero los modelos de lenguaje aprenden patrones de código mediante predicción del siguiente token, lo que hace que las implementaciones familiares sean un punto de partida natural. Cuando una implementación omite un argumento, la biblioteca suministra su valor, permitiendo que una elección estadística pase de la convención a su canalización sin convertirse nunca en parte de la conversación.

Los cinco valores predeterminados a continuación son los que he encontrado en trabajo de producción, donde causaron dolores de cabeza de depuración porque pasamos por alto lo que el código estaba haciendo. Cada uno merece la misma pregunta: ¿qué decidió para mí dejar fuera este argumento? Random Forest Regressor usa max_features=1.0, poniendo cada característica disponible en cada división, a diferencia del clasificador con "sqrt". Esta diferencia desactiva el submuestreo de características que distingue la receta habitual de random forest del simple bagging.

Regresión Logística usa C=1.0, aplicando una penalización L2 que puede sobre-regularizar o sub-regularizar según la escala de sus datos. Establecer max_features=0.33 restaura el mecanismo de decorrelación, mientras que examinar la fuerza de regularización previene sesgos inesperados en las estimaciones de coeficientes.