خط إنتاج بيانات مؤتمت (ETL Pipeline) لسحب وتحليل بيانات الابتوبات من أمازون
تفاصيل العمل
مشروع متكامل لرصد وتحليل بيانات سوق اللابتوبات على منصة أمازون (Amazon). يعتمد المشروع على بناء خط إنتاج بيانات مؤتمت بالكامل (Automated ETL Pipeline) يقوم بسحب البيانات وتنظيفها وتحويلها تلقائياً، ثم تخزينها ومعالجتها لعرض إحصائيات وتوجهات السوق عبر لوحة تحكم تفاعلية (Interactive Dashboard). (مراحل عمل المشروع - ETL) 1- السحب الأوتوماتيكي: إطلاق مسار جلب البيانات تلقائياً عبر عقد أتمتة نصوص. التكرار الحلقي (Looping) على صفحات المنتجات واستخراج كود الـ HTML لكل صفحة بشكل استباقي. 2- التنظيف والمعالجة: استخلاص تفاصيل المنتجات الأساسية (العنوان، السعر، التقييم، سعة الـ RAM، وحالة التوفر Available / UnAvailable). تنظيف النصوص وتحويل القيم المالية والتقييمات إلى أنماط رقمية قابلة للحساب. هيكلة البيانات وتصفيتها من الحقول الزائدة وإعدادها بتنسيق جدول قياسي. 3- التخزين: إرسال البيانات المجهزة تلقائياً وتحديثها في جدول Google Sheets / BigQuery. 4- التحليل والعرض: ربط قاعدة البيانات بـ Looker Studio لتغذية اللوحة التفاعلية. 5- حساب مؤشرات الأداء الرئيسية (KPIs) مثل: نسبة توفر المنتجات (Stock Availability %)، متوسط الأسعار بحسب الماركة وسعة الـ RAM، وتحليل التقييمات عبر مقاييس فئوية حصرية (Rating Tiers).
مهارات العمل