نوع العمل:
بناء نموذج ذكاء اصطناعي لتحليل النصوص (NLP) ومعالجة اللغات الطبيعية لاكتشاف وتصنيف الرسائل غير المرغوب فيها (Spam) بدقة عالية.
ميزات العمل:
معالجة متقدمة للنصوص (Text Preprocessing): تنظيف البيانات وإزالة الرموز والكلمات الشائعة (Stopwords) وتجريد الكلمات (Stemming) للوصول إلى جوهر المعنى.
تحويل ذكي للبيانات: استخدام خوارزمية (TF-IDF) لتحويل النصوص إلى متجهات رقمية قابلة للفهم من قبل الآلة.
المقارنة بين النماذج: تم تدريب واختبار 4 خوارزميات مختلفة (Logistic Regression, Naive Bayes, SVM, Random Forest) والمقارنة بينهم لاختيار النموذج صاحب الدقة الأعلى (Accuracy).
تقارير بصرية دقيقة: استخراج تقارير تقييم الأداء ورسم مصفوفة الارتباك (Confusion Matrix) لتوضيح كفاءة النموذج بالأرقام.
طريقة التنفيذ:
استيراد وتنظيف البيانات: تحميل مجموعة البيانات (Dataset) وتنظيف النصوص من أي شوائب باستخدام تقنيات التعابير النمطية (Regex) ومكتبة NLTK.
استخراج الميزات (Feature Extraction): تحويل النصوص المعالجة إلى ميزات رقمية عبر TF-IDF Vectorizer.
تدريب النماذج (Model Training): تقسيم البيانات إلى مجموعات تدريب واختبار، ثم تدريب عدة خوارزميات متقدمة.
التقييم والاختبار: تقييم كل نموذج واختيار الأفضل، ثم بناء دالة (Function) لاستقبال رسائل جديدة وتصنيفها فورياً كـ Spam أو Ham.