1. استيراد المكتبات وقراءة البيانات
تم استيراد مكتبات تحليل البيانات الأساسية في بايثون: pandas لمعالجة الجداول، numpy للعمليات الحسابية، و matplotlib مع seaborn للرسم البياني.
تم تحميل مجموعة من ملفات الـ CSV التي تمثل جداول قاعدة البيانات المختلفة، مثل بيانات العملاء blinkit_customers.csv، وبيانات أداء التوصيل blinkit_delivery_performance.csv، بالإضافة إلى بيانات المخزون (Inventory)، التسويق (Marketing)، وتفاصيل الطلبات (Order Items).
2. تنظيف ومعالجة البيانات (Data Cleaning)
هندسة الميزات (Feature Engineering): تم حذف الأعمدة غير الضرورية للتحليل لتقليل حجم البيانات، مثل حذف عمود العنوان (address) من جدول العملاء، وحذف عمود أسباب التأخير (reasons_if_delayed) من جدول التوصيل لاحتوائه على عدد كبير من القيم المفقودة.
فحص جودة البيانات: تم التأكد من عدم وجود قيم مفقودة (Nulls) باستخدام isnull().sum()، والتأكد من عدم وجود صفوف مكررة باستخدام duplicated().sum() في جداول العملاء.
تعديل أنواع البيانات (Data Types): تم تحويل أعمدة الوقت (مثل promised_time و actual_time) إلى صيغة datetime لتسهيل إجراء العمليات الحسابية الزمنية عليها.
تصحيح الأخطاء: تم استخدام الدالة المطلقة abs() لتحويل أي قيم زمنية سالبة (بالخطأ) في عمود وقت التوصيل إلى قيم موجبة.
3. استكشاف البيانات (Exploratory Data Analysis)
تم استعراض التوزيع العددي لفئات العملاء (customer_segment) لتحديد عدد العملاء المنتظمين، المميزين، الجدد، وغير النشطين.
تم استخدام الدالة describe() لعرض الإحصائيات الوصفية (المتوسط، الانحراف المعياري، القيم القصوى والدنيا)، وتم تطبيق تنسيق لوني متدرج (background_gradient) على النتائج لتسهيل قراءة الأرقام وتحليلها بصرياً.
4. دمج الجداول والتحليل النهائي (Data Merging & Visualization)
تجميع البيانات: تم ربط جميع الجداول المنفصلة (الطلبات، تفاصيل الطلبات، المنتجات، التوصيل، والعملاء) في جدول رئيسي واحد (master_df) باستخدام دالة pd.merge (عن طريق Left Join) بناءً على المفاتيح المشتركة (مثل order_id و product_id). نتج عن ذلك جدول شامل يحتوي على 5000 صف و 38 عموداً.
استخراج الرؤى برمجياً: تمت كتابة أكواد لتجميع البيانات (Grouping) وحساب الإيرادات بناءً على الكمية المضروبة في السعر (quantity * unit_price).
الرسم البياني: تم إنشاء مخططات شريطية (Bar Charts) باستخدام pandas.plot تُطابق تماماً ما رأيناه في تقرير Power BI، مثل:
إجمالي الإيرادات حسب الفئة (تصدرتها منتجات الألبان والإفطار Dairy & Breakfast بحوالي 639 ألف دولار).
أفضل 10 منتجات من حيث الإيرادات (تصدرتها الفيتامينات ومكافآت الحيوانات الأليفة).