تصميم وبناء خط بيانات فوري (Real-Time Data Pipeline) باستخدام Kafka و Spark
تفاصيل العمل

مشروع متكامل لتصميم وتنفيذ بنية تحتية لتدفق البيانات ومعالجتها في الوقت الفعلي (Real-Time Streaming Architecture). تم بناء النظام بشكل مجزأ وموزع لضمان السرعة وتحمل الأخطاء (Fault Tolerance) باستخدام التقنيات التالية: جلب البيانات والجدولة: استخدام Apache Airflow لإدارة وجدولة تدفق البيانات القادمة من الـ API، مع الاعتماد على PostgreSQL لتخزين البيانات التعريفية أو كقاعدة بيانات أساسية. إدارة التدفق الفوري: الاعتماد على Apache Kafka و ZooKeeper كمنصة رئيسية لإرسال واستقبال الرسائل (Message Broker)، مع ربطها بـ Schema Registry و Control Center للمراقبة. المعالجة الموزعة: استخدام بيئة Apache Spark (Master/Workers Clusters) لمعالجة وتحليل البيانات الضخمة المتدفقة فورياً بكفاءة عالية. التخزين النهائي: حفظ البيانات المعالجة في قاعدة بيانات Apache Cassandra لضمان استرجاع وقراءة البيانات بسرعة فائقة (NoSQL). البيئة والتشغيل: تم تغليف وتشغيل جميع هذه الخدمات والبيئات داخل حاويات Docker لضمان سهولة النشر والاستقرار.

شارك
بطاقة العمل
تقييم المستقل
تاريخ النشر
منذ 4 أسابيع
المشاهدات
25
المستقل
طلب عمل مماثل
شارك
مركز المساعدة