تنظيف وهيكلة البيانات الضخمة لأكثر من 198 ألف سجل باستخدام Python تنظيف وهيكلة البيانات الضخمة لأكثر من 198 ألف سجل باستخدام Python تنظيف وهيكلة البيانات الضخمة لأكثر من 198 ألف سجل باستخدام Python
تفاصيل العمل

قمت بالعمل على تنظيف، تحسين، وإعادة هيكلة قاعدة بيانات ضخمة ومعقدة تحتوي على 198,900 سجل خاص بتصاريح البناء في مدينة سان فرانسيسكو (San Francisco Building Permits Dataset). الداتا الأصلية كانت تعاني من نسبة "بيانات مفقودة" ضخمة تصل إلى 26.26% وعشوائية في أنواع البيانات، وقمت بتحويلها إلى قاعدة بيانات عالية الجودة وجاهزة تماماً الأدوات والتقنيات المستخدمة: اللغة الأساسية: Python المكتبات: Pandas, Regular Expressions (Regex) المخرجات والتنسيق: XlsxWriter (Excel) خطوات العمل والحلول التقنية التي قمت بها: - تقليص الأبعاد وتصفية الضوضاء (Dimensionality Reduction): تحديد وحذف 7 أعمدة غير مفيدة تجاوزت نسبة البيانات المفقودة فيها 95%، مما ساهم في تسريع معالجة البيانات وتوفير مساحة التخزين. - المعالجة الذكية للبيانات المفقودة (Smart Imputation): بدلاً من الحذف العشوائي، استخدمت منطقاً برمجياً متقدماً لملء الفراغات:تصحيح القيم المنطقية (Boolean Correction) وتحويل عمود فارغ بنسبة 90% إلى ميزة مكتملة بنسبة 100%. - الربط التبادلي بين الأعمدة لتوقع القيم المفقودة (مثل استخدام التكلفة التقديرية لتصحيح التكلفة الفعلية). - استخدام "الوسيط الإحصائي" (Median) لمعالجة التكاليف المالية تجنباً لتأثير القيم الشاذة (مثل ناطحات السحاب مقابل المنازل الصغيرة). - تحسين البنية والتواريخ: تحويل 6 أعمدة تواريخ من نصوص عادية إلى صيغة (Datetime) لتمكين التحليل الزمني، وتحويل الأرقام العشائرية إلى أعداد صحيحة (Integers). - تأكيد الجودة الجغرافية: تصفية وفلترة السجلات وحذف البيانات المعطوبة التي تفتقد للرموز البريدية (Zipcode) لضمان دقة التحليل المكاني والخرائط. المخرجات النهائية المسلمة للعميل (Final Deliverables): توليد ملف Excel احترافي ومنسق برمجياً باستخدام (XlsxWriter) يحتوي على: ✅ أعمدة متناسقة الحجم تلقائياً (Auto-fitted Columns) لسهولة القراءة. ✅ رؤوس جداول ملونة ومميزة (Color-coded Headers). ✅ تفعيل الفلاتر التلقائية (Active Filters) وجعل الصفوف العلوية ثابتة (Frozen Panes) لتسهيل التصفح. 📈 العائد على الأعمال (Business Impact): رفع كفاءة واكتمال البيانات في الأعمدة الأساسية من 73.74% إلى 100%. أصبحت الداتا جاهزة فوراً لتحليل السلاسل الزمنية (Time-Series) والتدقيق المالي والتنبؤ الذكي. 🔗 لمشاهدة كود بايثون وهيكلة المشروع بالكامل على GitHub:[https://github.com/yehia2811ahmed-ship-it/Data-Cleaning-Projects]

شارك
بطاقة العمل
تاريخ النشر
منذ شهر
المشاهدات
49
القسم
المستقل
Yehia Ahmed
Yehia Ahmed
محلل بيانات
طلب عمل مماثل
شارك
مركز المساعدة