HeadlinesBriefing favicon HeadlinesBriefing.com

Entrenamiento de Detección de Fraude: Mejor Modelo No Desplegado

Towards Data Science •
×

En un proyecto de último año, entrené seis modelos para detección de fraude utilizando dos conjuntos de datos públicos: PaySim (dinero móvil) e IEEE-CIS (transacciones con tarjeta). A pesar de lograr alta precisión, el modelo con mejor rendimiento no fue desplegado debido a restricciones de producción. El modelo desplegado utiliza solo tres características: monto de transacción, canal codificado one-hot y conjunto de datos de origen, porque los conjuntos de datos carecían de campos comunes.

El manejo del desequilibrio de clases requirió SMOTE, pero se utilizó un método de interpolación alternativo para el despliegue. El proyecto destacó una brecha entre métricas fuera de línea y decisiones de producción en el mundo real. El mejor modelo, probablemente XGBoost, fue superado en la práctica por un modelo más simple que generalizó mejor.

Esta experiencia me enseñó que la selección de modelos debe considerar la viabilidad de despliegue, no solo las métricas de rendimiento.