HeadlinesBriefing favicon HeadlinesBriefing.com

不正検知:最良モデルが本番展開されない理由

Towards Data Science •
×

最終年度プロジェクトで、私は2つの公開データセット(PaySim(モバイルマネー)とIEEE-CIS(カード取引))を使用して、不正検知用に6つのモデルを訓練しました。高い精度を達成したにもかかわらず、最良のモデルは本番環境の制約により展開されませんでした。展開されたモデルは、取引金額、ワンホットエンコードされたチャネル、ソースデータセットの3つの特徴のみを使用しています。これは、データセットに共通フィールドがなかったためです。クラスの不均衡を扱うにはSMOTEが必要でしたが、展開にはフォールバック補間法が使用されました。このプロジェクトは、オフラインメトリクスと実際の本番意思決定の間のギャップを浮き彫りにしました。最良のモデル(おそらくXGBoost)は、実際にはより良く汎化する単純なモデルに実践で打ち負かされました。この経験から、モデル選択はパフォーマンスメトリクスだけでなく、展開の実現可能性も考慮すべきだと学びました。