بناء نموذج تصنيف نصوص باستخدام Machine Learning
تفاصيل العمل
قمت بتنفيذ مشروع متكامل لكشف رسائل البريد الإلكتروني العشوائية باستخدام لغة البرمجة بايثون وتقنيات معالجة اللغة الطبيعية. مراحل المشروع: ١- تحليل البيانات: قمت بتحليل 5171 رسالة إلكترونية منها 3672 رسالة عادية و1499 رسالة عشوائية مع رسم مخططات بيانية متنوعة والتحقق من القيم المفقودة والمكررة والشاذة. ٢- تنظيف النصوص: قمت بإزالة علامات الترقيم وكلمات التوقف وتطبيق خوارزمية التجذير واستخدام تقنية TF-IDF لتحويل النصوص إلى أرقام. ٣- اختيار الميزات: استخدمت اختبار كاي تربيع والمعلومات المتبادلة لاختيار أهم الميزات. ٤- النماذج المستخدمة: الانحدار اللوجستي | 99.5% | 98.6% شجرة القرار | 100% | 94.7% آلة المتجهات الداعمة | 99.8% | 99.0% بايز المتعدد الحدود | 96.1% | 92.5% الغابة العشوائية | 100% | 98.0% خوارزمية الجيران | 99.9% | 75.2% بايز الغاوسي | 98.7% | 94.1% أفضل نموذج: آلة المتجهات الداعمة بدقة 99% على بيانات الاختبار
مهارات العمل