معالجة وتحليل البيانات برمجياً (Data Preprocessing & EDA) باستخدام لغة Python معالجة وتحليل البيانات برمجياً (Data Preprocessing & EDA) باستخدام لغة Python معالجة وتحليل البيانات برمجياً (Data Preprocessing & EDA) باستخدام لغة Python معالجة وتحليل البيانات برمجياً (Data Preprocessing & EDA) باستخدام لغة Python معالجة وتحليل البيانات برمجياً (Data Preprocessing & EDA) باستخدام لغة Python معالجة وتحليل البيانات برمجياً (Data Preprocessing & EDA) باستخدام لغة Python معالجة وتحليل البيانات برمجياً (Data Preprocessing & EDA) باستخدام لغة Python معالجة وتحليل البيانات برمجياً (Data Preprocessing & EDA) باستخدام لغة Python معالجة وتحليل البيانات برمجياً (Data Preprocessing & EDA) باستخدام لغة Python معالجة وتحليل البيانات برمجياً (Data Preprocessing & EDA) باستخدام لغة Python معالجة وتحليل البيانات برمجياً (Data Preprocessing & EDA) باستخدام لغة Python معالجة وتحليل البيانات برمجياً (Data Preprocessing & EDA) باستخدام لغة Python معالجة وتحليل البيانات برمجياً (Data Preprocessing & EDA) باستخدام لغة Python معالجة وتحليل البيانات برمجياً (Data Preprocessing & EDA) باستخدام لغة Python معالجة وتحليل البيانات برمجياً (Data Preprocessing & EDA) باستخدام لغة Python معالجة وتحليل البيانات برمجياً (Data Preprocessing & EDA) باستخدام لغة Python معالجة وتحليل البيانات برمجياً (Data Preprocessing & EDA) باستخدام لغة Python
تفاصيل العمل

1. استيراد المكتبات وقراءة البيانات تم استيراد مكتبات تحليل البيانات الأساسية في بايثون: pandas لمعالجة الجداول، numpy للعمليات الحسابية، و matplotlib مع seaborn للرسم البياني. تم تحميل مجموعة من ملفات الـ CSV التي تمثل جداول قاعدة البيانات المختلفة، مثل بيانات العملاء blinkit_customers.csv، وبيانات أداء التوصيل blinkit_delivery_performance.csv، بالإضافة إلى بيانات المخزون (Inventory)، التسويق (Marketing)، وتفاصيل الطلبات (Order Items). 2. تنظيف ومعالجة البيانات (Data Cleaning) هندسة الميزات (Feature Engineering): تم حذف الأعمدة غير الضرورية للتحليل لتقليل حجم البيانات، مثل حذف عمود العنوان (address) من جدول العملاء، وحذف عمود أسباب التأخير (reasons_if_delayed) من جدول التوصيل لاحتوائه على عدد كبير من القيم المفقودة. فحص جودة البيانات: تم التأكد من عدم وجود قيم مفقودة (Nulls) باستخدام isnull().sum()، والتأكد من عدم وجود صفوف مكررة باستخدام duplicated().sum() في جداول العملاء. تعديل أنواع البيانات (Data Types): تم تحويل أعمدة الوقت (مثل promised_time و actual_time) إلى صيغة datetime لتسهيل إجراء العمليات الحسابية الزمنية عليها. تصحيح الأخطاء: تم استخدام الدالة المطلقة abs() لتحويل أي قيم زمنية سالبة (بالخطأ) في عمود وقت التوصيل إلى قيم موجبة. 3. استكشاف البيانات (Exploratory Data Analysis) تم استعراض التوزيع العددي لفئات العملاء (customer_segment) لتحديد عدد العملاء المنتظمين، المميزين، الجدد، وغير النشطين. تم استخدام الدالة describe() لعرض الإحصائيات الوصفية (المتوسط، الانحراف المعياري، القيم القصوى والدنيا)، وتم تطبيق تنسيق لوني متدرج (background_gradient) على النتائج لتسهيل قراءة الأرقام وتحليلها بصرياً. 4. دمج الجداول والتحليل النهائي (Data Merging & Visualization) تجميع البيانات: تم ربط جميع الجداول المنفصلة (الطلبات، تفاصيل الطلبات، المنتجات، التوصيل، والعملاء) في جدول رئيسي واحد (master_df) باستخدام دالة pd.merge (عن طريق Left Join) بناءً على المفاتيح المشتركة (مثل order_id و product_id). نتج عن ذلك جدول شامل يحتوي على 5000 صف و 38 عموداً. استخراج الرؤى برمجياً: تمت كتابة أكواد لتجميع البيانات (Grouping) وحساب الإيرادات بناءً على الكمية المضروبة في السعر (quantity * unit_price). الرسم البياني: تم إنشاء مخططات شريطية (Bar Charts) باستخدام pandas.plot تُطابق تماماً ما رأيناه في تقرير Power BI، مثل: إجمالي الإيرادات حسب الفئة (تصدرتها منتجات الألبان والإفطار Dairy & Breakfast بحوالي 639 ألف دولار). أفضل 10 منتجات من حيث الإيرادات (تصدرتها الفيتامينات ومكافآت الحيوانات الأليفة).

شارك
بطاقة العمل
تاريخ النشر
منذ شهرين
المشاهدات
82
القسم
المستقل
طلب عمل مماثل
شارك
مركز المساعدة