التنبؤ بسلوك التسوّق الإلكتروني باستخدام تعلّم الآلة — تحليل وتصنيف بيانات 3,900 عميل
تفاصيل العمل
الهدف من المشروع تطوير نموذج ذكاء اصطناعي متكامل للتنبؤ بسلوك العملاء في منصات التجارة الإلكترونية، وتحديدًا: هل سيحتفظ العميل باشتراكه أم لا؟ — وذلك استنادًا إلى تحليل معمّق لأنماط سلوكه الشرائي الفعلي. المنهجية العلمية المتّبعة ١. التحليل الاستكشافي للبيانات (EDA) فحص مجموعة بيانات مكوّنة من ٣,٩٠٠ سجل عميل و١٨ متغيّرًا التحقق من سلامة البيانات: عدم وجود أي قيم مفقودة أو سجلات مكرّرة حساب الإحصاءات الوصفية الشاملة (المتوسطات، الانحرافات المعيارية، المدى) تحليل التوزيعات من خلال مخطّطات Box Plot والكشف عن القيم الشاذة ٢. هندسة السمات وتحويل البيانات (Feature Engineering) بناء مصفوفة الارتباط (Correlation Matrix) لتحديد العلاقات الخطّية بين المتغيرات اكتشاف أن الارتباطات الخطّية بين المتغيرات الرقمية وحالة الاشتراك ضعيفة جدًا (أقل من ٠.٠٤)، مما يكشف أن العلاقة غير خطّية وأن المتغيرات الفئوية هي المحرّك الأساسي للتنبؤ تحويل المتغيرات الثنائية إلى ترميز رقمي (Binary Encoding) تطبيق ترميز One-Hot Encoding على المتغيرات متعددة القيم (نوع المنتج، الموسم، طريقة الدفع، ومتغيرات أخرى) توسيع مساحة السمات من ١٧ عمودًا إلى ١٣١ عمودًا لاستخراج المعلومات الكامنة ٣. معالجة عدم توازن البيانات (Class Imbalance) تشخيص مشكلة عدم التوازن في الفئات المستهدفة: فئة المشتركين أقلّ عددًا بكثير من غير المشتركين تطبيق تقنية SMOTE (Synthetic Minority Over-sampling Technique) لتوليد عيّنات متوازنة تحقيق توزيع متوازن (٦٥% / ٣٥%) بدلاً من التوزيع الأصلي المنحاز ٤. بناء النموذج التنبؤي وتقييمه تقسيم البيانات طبقيًا (Stratified Split): ٧٠% للتدريب و٣٠% للاختبار تدريب نموذج الانحدار اللوجستي (Logistic Regression) مع ضبط المعاملات تقييم الأداء باستخدام مقاييس متعددة (Accuracy, Precision, Recall, F1-Score) النتائج المحقّقة دقة النموذج الكلّية (Accuracy): ٨٥% الدقة (Precision) لفئة غير المشتركين: ٩٤% الاسترجاع (Recall) لفئة المشتركين: ٩٠% — أي أن النموذج يكتشف ٩ من كلّ ١٠ مشتركين بشكل صحيح F1-Score: ٠.٨٨ لغير المشتركين و٠.٨٠ للمشتركين الأدوات والتقنيات المستخدمة لغة البرمجة: Python 3 بيئة التطوير: Jupyter Notebook / Google Colab المكتبات: Pandas, NumPy, Matplotlib, Seaborn, Scikit-learn, imbalanced-learn التقنيات: Exploratory Data Analysis, Correlation Analysis, One-Hot Encoding, SMOTE, Logistic Regression, Stratified Train/Test Split, Confusion Matrix القيمة التجارية يُمكّن هذا المشروع الشركات من اتخاذ قرارات تسويقية مبنية على بيانات فعلية بدلاً من التخمينات، وتوجيه حملات الاحتفاظ بالعملاء نحو الفئات الأكثر عرضة للمغادرة — مما يُقلّل التكاليف التسويقية ويزيد معدّلات الاحتفاظ.
مهارات العمل
بطاقة العمل
طلب عمل مماثل