Credit Card Fraud Detection — ML Pipeline
تفاصيل العمل
المشكلة: اكتشاف المعاملات الاحتيالية في بيانات بطاقات ائتمان، حيث الاحتيال بيمثل 0.17% بس من كل المعاملات (492 من أصل 284,807) — يعني موديل بيقول "كل حاجة سليمة" هيوصل لدقة 99.8% وهو مش بيمسك ولا حالة احتيال واحدة. الحل: درّبت موديلين (Logistic Regression و Random Forest) باستخدام class-weight balancing للتعامل مع عدم توازن البيانات، وقيّمتهم بمقاييس مناسبة للمشكلة (ROC-AUC, Precision, Recall, F1) بدل الـ Accuracy اللي بتضلل هنا تمامًا. الأهم إني قارنت الموديلين مش على رقم واحد بس، لأن اللي طلع أعلى في ROC-AUC كان فعليًا الأسوأ عمليًا. النتيجة: Logistic Regression حقق ROC-AUC أعلى (0.9734) لكن بدقة 5% بس — يعني بيدي إنذار كاذب لكل حالة احتيال حقيقية بمعدل 19 مرة، وده غير قابل للاستخدام عمليًا. Random Forest بالمقابل حقق دقة 96% مع اكتشاف 74% من حالات الاحتيال الحقيقية (F1-Score 0.84 مقابل 0.10) — وهو الموديل اللي فعلاً ممكن يتنشر في الإنتاج.
مهارات العمل
بطاقة العمل
طلب عمل مماثل