HeadlinesBriefing favicon HeadlinesBriefing.com

Détection de Fraude : Meilleur Modèle Non Déployé

Towards Data Science •
×

Dans un projet de dernière année, j'ai entraîné six modèles pour la détection de fraude en utilisant deux ensembles de données publics : PaySim (argent mobile) et IEEE-CIS (transactions par carte). Malgré une haute précision, le meilleur modèle n'a pas été déployé en raison de contraintes de production. Le modèle déployé utilise seulement trois caractéristiques : montant de transaction, canal encodé one-hot, et ensemble de données source, car les ensembles de données manquaient de champs communs.

La gestion du déséquilibre des classes a nécessité SMOTE, mais une méthode d'interpolation de secours a été utilisée pour le déploiement. Le projet a mis en évidence un écart entre les métriques hors ligne et les décisions de production réelles. Le meilleur modèle, probablement XGBoost, a été surpassé en pratique par un modèle plus simple qui généralisait mieux.

Cette expérience m'a appris que la sélection de modèles doit considérer la faisabilité du déploiement, pas seulement les métriques de performance.