تم تنفيذ عملية تنظيف ومعالجة بيانات باستخدام لغة Python ومكتبة Pandas بهدف تجهيز البيانات لعمليات التحليل وبناء نماذج تعلم الآلة.
شمل العمل:
معالجة القيم المفقودة (Missing Values)
اكتشاف ومعالجة القيم الشاذة (Outliers)
إزالة البيانات المكررة (Duplicate Records)
تصحيح أنواع البيانات (Data Types Conversion)
معالجة القيم غير المنطقية وغير المتناسقة
تجهيز البيانات لتصبح جاهزة للتحليل الإحصائي وبناء نماذج Machine Learning
تم الاعتماد على مكتبات:
Pandas
NumPy
Matplotlib
Scikit-learn
مع التركيز على تحسين جودة البيانات ورفع كفاءة استخدامها في المراحل اللاحقة من التحليل والتنبؤ.