تنظيف و تحليل بيانات ركاب سفينة تايتانيك واستخراج الرؤى الإحصائية
تفاصيل العمل
شروع متكامل لتحليل البيانات (EDA) ومعالجتها باستخدام لغة Python، يهدف إلى دراسة العوامل المؤثرة على فرص النجاة في كارثة سفينة تايتانيك الشهيرة. يعكس هذا المشروع قدرتي على التعامل مع البيانات الخام، تنظيفها، وهندسة الميزات (Feature Engineering) لاستخراج نتائج دقيقة. أبرز المهام التي قمت بها في هذا المشروع: تنظيف ومعالجة البيانات: التعامل مع القيم المفقودة (Null Values) في أعمدة "العمر" و"المقصورة" و"جهة الصعود" باستخدام تقنيات إحصائية دقيقة مثل التجميع حسب الدرجة (Groupby Imputation). هندسة الميزات (Feature Engineering): استخراج سمات جديدة من البيانات الخام، مثل تصنيف الركاب بناءً على الألقاب (Title)، وحساب حجم العائلة (Family Size)، وتحديد فئة المقصورة (Cabin Deck). تحليل إحصائي عميق: دراسة معدلات النجاة بناءً على الحالة الاجتماعية، الهيكل العائلي، والموقع الجغرافي داخل السفينة. أهم النتائج المستخلصة: التأثير الاجتماعي: إثبات فعالية بروتوكول "النساء والأطفال أولاً" إحصائياً، حيث تجاوزت نسبة نجاة السيدات 70% مقارنة بـ 15% فقط للرجال. ديناميكيات العائلة: اكتشاف أن العائلات الصغيرة (3-4 أفراد) كانت الأكثر حظاً في النجاة، بينما واجهت العائلات الكبيرة صعوبات لوجستية أدت لخفض فرص نجاتهم. تأثير موقع المقصورة: تبين أن الركاب في الطوابق الوسطى (D و E) كانت لديهم أفضلية في الوصول إلى مخارج الطوارئ ومقاعد النجاة. الأدوات المستخدمة: Python (Pandas, Numpy) لمعالجة وتحليل البيانات الضخمة. Jupyter Notebook لتنظيم سير العمل البرمجي والتحليلي.
مهارات العمل
بطاقة العمل
طلب عمل مماثل