HeadlinesBriefing favicon HeadlinesBriefing.com

Betrugserkennung: Bestes Modell nicht bereitgestellt

Towards Data Science •
×

In einem Abschlussprojekt habe ich sechs Modelle für Betrugserkennung mit zwei öffentlichen Datensätzen trainiert: PaySim (Mobilgeld) und IEEE-CIS (Kartentransaktionen). Trotz hoher Genauigkeit wurde das beste Modell aufgrund von Produktionsbeschränkungen nicht bereitgestellt. Das bereitgestellte Modell verwendet nur drei Merkmale: Transaktionsbetrag, One-Hot-kodierter Kanal und Quelldatensatz, da die Datensätze keine gemeinsamen Felder hatten.

Die Behandlung von Klassenungleichgewicht erforderte SMOTE, aber für die Bereitstellung wurde eine Fallback-Interpolationsmethode verwendet. Das Projekt hob eine Kluft zwischen Offline-Metriken und realen Produktionsentscheidungen hervor. Das beste Modell, wahrscheinlich XGBoost, wurde in der Praxis von einem einfacheren Modell übertroffen, das besser generalisierte.

Diese Erfahrung lehrte mich, dass die Modellauswahl die Bereitstellungsfähigkeit berücksichtigen muss, nicht nur Leistungsmetriken.