نموذج التنبؤ بأسعار العقارات في السوق المصري | Machine Learning + Streamlit Dashboard
تفاصيل العمل
تم تنفيذ المشروع بالكامل وفق جميع المتطلبات المطلوبة، وفيما يلي تفاصيل ما تم إنجازه: ───────────────────────────────────── 📦 Dataset والبيانات ───────────────────────────────────── - تم استخدام dataset حقيقية تحتوي على ~24,800 إعلان عقاري من السوق المصري - تشمل الخصائص: نوع العقار (شقة/فيلا/...)، الموقع (City)، الـ Compound، المساحة، عدد الغرف، عدد الحمامات، الطابق، التشطيب، طريقة الدفع، تاريخ التسليم ───────────────────────────────────── 🧹 Data Preprocessing ───────────────────────────────────── - تنظيف البيانات الفاسدة وإزالة القيم الشاذة (Outliers) - معالجة القيم المفقودة (Missing Values) - Frequency Encoding للـ Compound - Feature Engineering كامل: - Area_per_Room: نسبة المساحة للغرف - Total_Rooms: إجمالي الغرف - Is_Ready / Is_Cash: features ثنائية - Log_Area: تحويل لوغاريتمي للمساحة - City_Price_Tier: تصنيف المدن حسب مستوى الأسعار (4 مستويات) - Log-Transform على السعر المستهدف لتحسين توزيع البيانات ───────────────────────────────────── 🤖 Model Training والمقارنة ───────────────────────────────────── تم تدريب وتقييم 5 نماذج مختلفة: 1. Ridge Regression 2. Random Forest (200 estimators) 3. XGBoost 4. LightGBM (500 estimators) 5. CatBoost (2000 iterations مع Early Stopping) تم بناء Pipeline احترافي يشمل: - StandardScaler للـ numeric features - TargetEncoder للمدينة والـ Compound - OneHotEncoder للـ categorical features يتم اختيار النموذج الأفضل تلقائياً بناءً على R² score على الـ Test Set. ───────────────────────────────────── 📊 التقييم والـ Metrics ───────────────────────────────────── - RMSE (Root Mean Squared Error) - MAE (Mean Absolute Error) - R² Score - Actual vs Predicted Scatter Plot ───────────────────────────────────── 🧠 Feature Importance وتفسير النموذج ───────────────────────────────────── - رسم بياني لأهم 15 عامل يؤثر على السعر (Feature Importance) - SHAP Waterfall Plot لكل تنبؤ يوضح بالضبط كيف أثّر كل عام
بطاقة العمل
طلب عمل مماثل