بناء نموذج تعلم آلة متكامل (End-to-End ML Pipeline) لتسعير السيارات وتحديد فئات الجمهور المستهدف
تفاصيل العمل
في سوق السيارات، التسعير المبني على التخمين أو استهداف الجمهور بشكل عشوائي يسبب هدر ميزانيات التسويق وخسارة الأرباح بسبب عشوائية البيانات الخام. في هذا المشروع، بنيت خط تحليل وتنبؤ متكامل (ML Pipeline) يعتمد على خوارزميات تعلم الآلة لتحويل أكثر من 72 ألف سجل بيانات خام لبناء نموذج ML يتوقع الأسعار ويصنف السيارات لفئات تخدم أهداف المبيعات مباشرة. التحديات التقنية والحلول العملية المتخذة: 1- تنظيف البيانات الضخمة: تعاملت مع أكتر من 72,000 صف كان فيها قيم مفقودة بنسبة ثابتة (~3600 قيمة ناقصة في كل عمود). وعالجت المشكلة دي إحصائياً بالـ Median والـ Mode عشان نحافظ على طبيعة التوزيع وميحصلش أي انحياز للنموذج. 2- حل مشكلة الـ High Cardinality (كثرة الفئات): عمود "موديل السيارة" كان فيه مئات الأنواع الفرعية. وبما إن الموديل مبيفهمش نصوص، فالاخر الطبيعي هو (One-Hot Encoding)، بس لو عملته مباشرة، الأبعاد كانت هتتضخم والنموذج هيبقى بطيء وضعيف جداً. فعلشان أحل المشطلة دي حسبت النسبة التراكمية، وجمعت الموديلات النادرة جداً (اللي بتمثل آخر 10% من الداتا) وضمتها كلها في فئة واحدة سميتها "Other"، وبعدها طبقت الـ Encoding وأنا مطمن إن الأبعاد تحت السيطرة وكفاءة الموديل عالية. 3- موازنة الأرقام (Feature Scaling): استخدمت الـ StandardScaler لتوحيد مقاييس الأرقام (زي سعة المحرك والمسافة المقطوعة) عشان الخوارزميات متنحازش للأرقام الكبيرة وتتجاهل باقي العوامل، مع عمل كبح (Clipping) للقيم الشاذة (Outliers). 4- تقسيم شرائح السوق بدون انحياز: بدل ما أحط شروط تسعير عشوائية من عندي، استخدمت الـ Quantile Binning لتقسيم السوق لـ 3 فئات متوازنة تماماً بناءً على الداتا نفسها: (Cheap, Moderate, Expensive). التوازن ده بيضمن لفريق التسويق ميزانية إعلانات موجهة بكفاءة أعلى. النماذج والنتائج (العائد على البيزنس): 1- نموذج توقع السعر المباشر (Linear Regression): استخدمت النموذج ده لتوقع الرقم الدقيق للسعر وحقق معامل تحديد قوي R² = 0.80. وده معناه إن النموذج قادر يفسر 80% من الاختلافات والتغيرات في أسعار السيارات بناءً على مواصفاتها، وده بيساعد البيزنس في تسعير أي مخزون جديد بدقة وثقة. 2- نموذج التصنيف الذكي (KNN Classifier): لتقسيم السيارات لفئات، وهنا استخدمت الـ GridSearchCV مع الـ K-Fold Cross-Validation عشان يلف على احتمالات كتيرة ويختار أفضل عدد للجيران (Neighbors) وأنسب مقياس للمسافة (Euclidean vs. Manhattan). الموديل ده بعد الضبط حقق دقة إجمالية (Accuracy) وصلت لـ 85% في تصنيف الفئة السعرية الصح للجمهور المستهدف. الأدوات المستخدمة (Tech Stack): اللغة: Python معالجة البيانات(Data Preprocessing): Pandas, NumPy تعلم الآلة (Machine Learning): Scikit-Learn (Linear Regression, KNN, GridSearchCV, K-Fold Cross-Validation, Evaluation Metrics) التمثيل البياني (Visualization): Matplotlib,Plotly, Seaborn رابط المشروع على GitHub لمشاهدة الكود البرمجي والخطوات بالتفصيل: https://github.com/abdel7amed129/Car-Price-Prediction-ML-Pipeline/tree/main المهارات المستخدمة: Python, Data Imputation, One-Hot Encoding, Feature Scaling, Quantile Binning, Linear Regression, KNN Classifier, GridSearchCV, K-Fold Cross-Validation.
مهارات العمل
بطاقة العمل
طلب عمل مماثل