قمت بتنفيذ مشروع متكامل في مجال هندسة البيانات لبناء Data Pipeline احترافي خاص بنظام إدارة الرعاية الصحية. الهدف من المشروع كان تحويل بيانات خام ومجزأة (CSV Files) إلى نظام تحليلي منظم يعتمد على Data Warehouse بتصميم Star Schema، مما يسهل عمليات التحليل واستخراج insights دقيقة.
اعتمدت في تنفيذ المشروع على Medallion Architecture (Bronze → Silver → Gold)، حيث بدأت بمرحلة إدخال البيانات وتخزينها في Hadoop HDFS بصيغة Parquet للحفاظ على البيانات الأصلية، ثم مرحلة تنظيف ومعالجة البيانات باستخدام PySpark (إزالة التكرار، معالجة القيم الناقصة، وتوحيد الـ IDs)، وأخيرًا تحويل البيانات إلى جداول Fact و Dimension وتحميلها داخل PostgreSQL لتكون جاهزة للتحليل. كما قمت بإنشاء جدول تواريخ (dim_date) لدعم التحليلات الزمنية.
تم تشغيل الـ Pipeline بشكل أوتوماتيكي باستخدام Apache Airflow من خلال DAG منظم يضمن تنفيذ كل خطوة بالترتيب الصحيح. بالإضافة إلى ذلك، قمت باستخدام Docker و Docker Compose لتجهيز بيئة تشغيل متكاملة تشمل Hadoop و Spark و Airflow و PostgreSQL، مما يجعل المشروع قابل لإعادة التشغيل بسهولة على أي بيئة. المشروع يعكس قدرتي على تصميم وتنفيذ أنظمة Data Engineering حقيقية وقابلة للتوسع.