نظام متكامل لجودة البيانات وبناء مستودع بيانات لقطاع الرعاية الصحية باستخدام PySpark ( تنظيف بيانات + Data Warehouse + Dashboard+ Database)

نظام متكامل لجودة البيانات وبناء مستودع بيانات لقطاع الرعاية الصحية باستخدام PySpark ( تنظيف بيانات + Data Warehouse + Dashboard+ Database) نظام متكامل لجودة البيانات وبناء مستودع بيانات لقطاع الرعاية الصحية باستخدام PySpark ( تنظيف بيانات + Data Warehouse + Dashboard+ Database) نظام متكامل لجودة البيانات وبناء مستودع بيانات لقطاع الرعاية الصحية باستخدام PySpark ( تنظيف بيانات + Data Warehouse + Dashboard+ Database) نظام متكامل لجودة البيانات وبناء مستودع بيانات لقطاع الرعاية الصحية باستخدام PySpark ( تنظيف بيانات + Data Warehouse + Dashboard+ Database) نظام متكامل لجودة البيانات وبناء مستودع بيانات لقطاع الرعاية الصحية باستخدام PySpark ( تنظيف بيانات + Data Warehouse + Dashboard+ Database) نظام متكامل لجودة البيانات وبناء مستودع بيانات لقطاع الرعاية الصحية باستخدام PySpark ( تنظيف بيانات + Data Warehouse + Dashboard+ Database) نظام متكامل لجودة البيانات وبناء مستودع بيانات لقطاع الرعاية الصحية باستخدام PySpark ( تنظيف بيانات + Data Warehouse + Dashboard+ Database) نظام متكامل لجودة البيانات وبناء مستودع بيانات لقطاع الرعاية الصحية باستخدام PySpark ( تنظيف بيانات + Data Warehouse + Dashboard+ Database) نظام متكامل لجودة البيانات وبناء مستودع بيانات لقطاع الرعاية الصحية باستخدام PySpark ( تنظيف بيانات + Data Warehouse + Dashboard+ Database) نظام متكامل لجودة البيانات وبناء مستودع بيانات لقطاع الرعاية الصحية باستخدام PySpark ( تنظيف بيانات + Data Warehouse + Dashboard+ Database) نظام متكامل لجودة البيانات وبناء مستودع بيانات لقطاع الرعاية الصحية باستخدام PySpark ( تنظيف بيانات + Data Warehouse + Dashboard+ Database) نظام متكامل لجودة البيانات وبناء مستودع بيانات لقطاع الرعاية الصحية باستخدام PySpark ( تنظيف بيانات + Data Warehouse + Dashboard+ Database) نظام متكامل لجودة البيانات وبناء مستودع بيانات لقطاع الرعاية الصحية باستخدام PySpark ( تنظيف بيانات + Data Warehouse + Dashboard+ Database) نظام متكامل لجودة البيانات وبناء مستودع بيانات لقطاع الرعاية الصحية باستخدام PySpark ( تنظيف بيانات + Data Warehouse + Dashboard+ Database) نظام متكامل لجودة البيانات وبناء مستودع بيانات لقطاع الرعاية الصحية باستخدام PySpark ( تنظيف بيانات + Data Warehouse + Dashboard+ Database) نظام متكامل لجودة البيانات وبناء مستودع بيانات لقطاع الرعاية الصحية باستخدام PySpark ( تنظيف بيانات + Data Warehouse + Dashboard+ Database) نظام متكامل لجودة البيانات وبناء مستودع بيانات لقطاع الرعاية الصحية باستخدام PySpark ( تنظيف بيانات + Data Warehouse + Dashboard+ Database) نظام متكامل لجودة البيانات وبناء مستودع بيانات لقطاع الرعاية الصحية باستخدام PySpark ( تنظيف بيانات + Data Warehouse + Dashboard+ Database) نظام متكامل لجودة البيانات وبناء مستودع بيانات لقطاع الرعاية الصحية باستخدام PySpark ( تنظيف بيانات + Data Warehouse + Dashboard+ Database) نظام متكامل لجودة البيانات وبناء مستودع بيانات لقطاع الرعاية الصحية باستخدام PySpark ( تنظيف بيانات + Data Warehouse + Dashboard+ Database) نظام متكامل لجودة البيانات وبناء مستودع بيانات لقطاع الرعاية الصحية باستخدام PySpark ( تنظيف بيانات + Data Warehouse + Dashboard+ Database)
تفاصيل العمل

هذا المشروع عبارة عن نظام متكامل لمعالجة بيانات المستشفيات بداية من تحميل البيانات الخام وحتى تجهيزها للتحليل والعرض في Dashboard. تم تطوير Pipeline يهدف إلى ضمان جودة البيانات قبل استخدامها، من خلال تنفيذ مجموعة من اختبارات Data Quality، ثم تنظيم البيانات داخل Data Warehouse، وتصميم قاعدة بيانات كاملة مع ERD، وأخيرًا إعداد البيانات لعرضها في Dashboard تحليلي. أهداف المشروع تحسين جودة البيانات قبل استخدامها اكتشاف الأخطاء مثل القيم المفقودة والتكرار التأكد من صحة العلاقات بين الجداول تجهيز البيانات للتحليل واتخاذ القرار محاكاة نظام حقيقي مستخدم في شركات Data Engineering مراحل تنفيذ المشروع 1. Data Ingestion تم تحميل البيانات من ملفات CSV باستخدام PySpark وتحويلها إلى DataFrames. 2. Data Cleaning إزالة القيم الفارغة (Null Values) إزالة التكرارات (Duplicates) تصحيح أنواع البيانات (Data Types Casting) 3. Data Quality Validation تم تنفيذ مجموعة من الفحوصات لضمان جودة البيانات: Completeness: قياس نسبة القيم المفقودة Uniqueness: التحقق من عدم تكرار المفاتيح الأساسية Consistency: التحقق من العلاقات بين الجداول (Foreign Keys) 4. Data Warehouse Design تم تصميم نموذج Data Warehouse يعتمد على تقسيم البيانات إلى طبقات: Raw Layer: البيانات كما هي Clean Layer: البيانات بعد التنظيف Reporting Layer: بيانات جاهزة للتحليل 5. Database Design & ERD تم تصميم قاعدة بيانات تشمل جميع الكيانات مثل: Patients Doctors Appointments Departments وتم إنشاء ERD يوضح العلاقات بين هذه الجداول. 6. Data Transformation تم تجهيز البيانات لتكون مناسبة للتحليل من خلال: توحيد الصيغ تحسين الهيكل تجهيز الجداول التحليلية 7. Reporting & Dashboard تم إنتاج تقرير جودة بيانات يحتوي على: عدد الأخطاء لكل جدول أنواع المشاكل (Nulls, Duplicates, FK errors) ويمكن استخدام البيانات الناتجة في إنشاء Dashboard باستخدام Power BI أو Databricks SQL. مخرجات المشروع PySpark Notebook منظم Data Quality Report Data Warehouse Structure Database Schema ERD Diagram Dataset جاهز للتحليل إمكانية بناء Dashboard الأدوات المستخدمة PySpark Databricks SQL Power BI (اختياري) فكرة المشروع باختصار المشروع يقوم ببناء Pipeline لمعالجة البيانات يبدأ من البيانات الخام، ثم تنظيفها، والتحقق من جودتها، ثم تنظيمها داخل Data Warehouse، وأخيرًا تجهيزها للاستخدام في التحليل واتخاذ القرار. هذا المشروع يحاكي بيئة عمل حقيقية في مجال هندسة البيانات، حيث يتم بناء نظام متكامل لضمان جودة البيانات قبل استخدامها في التحليل أو الأنظمة الذكية.

شارك
بطاقة العمل
تقييم المستقل
تاريخ النشر
منذ شهرين
المشاهدات
53
القسم
المستقل
Shimaa Elzaidey
Shimaa Elzaidey
مهندس بيانات
طلب عمل مماثل
شارك
مركز المساعدة