نظام ذكي متطور لـ كشط وتصفية المقالات الإخبارية والمحتوى الرقمي (News Article Scraper)
تفاصيل العمل
نظام برمجى متكامل واحترافي تم بناؤه بلغة بايثون (Python) لاستخراج ونحت محتوى المقالات من المواقع الإخبارية بشكل ذكي ونظيف تماماً. يتميز النظام بقدرته على فصل متن المقال الأساسي عن "الضوضاء" المحيطة به مثل الإعلانات، القوائم الجانبية، أشرطة التنقل، وصناديق التعليقات، مما يجعله مثالياً لجمع البيانات وتغذية نماذج الذكاء الاصطناعي (AI Training & NLP). أبرز المميزات والحلول التقنية في المشروع: آلية كشط ثنائية النمط (Dual-Mode Scraping): النمط السريع المتخفف (Primary): يعتمد على بروتوكول HTTP ومكتبة BeautifulSoup لمعالجة المواقع التقليدية بسرعة فائقة واستهلاك أقل للموارد. النمط الاحتياطي الذكي (Selenium Fallback): يتحول النظام تلقائياً وبشكل صامت إلى متصفح خفي (Headless Chrome) عند اكتشاف مواقع تعتمد كلياً على الجافا سكريبت (JavaScript-heavy) أو تقنية التحميل الكسول (Lazy-loading) لضمان عدم فقدان أي بيانات. تصفية ذكية للمحتوى (+50 Pattern): يمتلك النظام خوارزمية لتقييم كثافة النصوص (Content Density Analysis) وفحص دلالات الأكواد (Semantic HTML) لتصفية أكثر من 50 نمطاً من العناصر غير المرغوبة (كالإعلانات، الروابط المقترحة، نوافذ الاشتراك بالنشرات البريدية، ووسائل التواصل الاجتماعي). نظام استرجاع متطور (Widget-Based Recovery): في حال وجود حماية أو تداخل في الحاويات البرمجية للموقع، يقوم النظام تلقائياً بتخفيف قواعد التصفية بشكل تدريجي (Multi-level retry) لإنقاذ النص الأصلي دون التأثير على جودة المخرجات. هيكلة البيانات وتصديرها: يستخرج النظام 6 حقول أساسية بدقة (الرابط، العنوان، الوصف، نص المقال بالكامل، تاريخ النشر، وقت الكشط) ويقوم بتصديرها بصيغ منظمة مثل JSON و CSV لتكون جاهزة فوراً للتحليل أو التخزين. معالجة قوية للأخطاء: يتضمن النظام تقنيات تمنع انهيار البرنامج عند انقطاع الشبكة، مع تحديد مهلة زمنية ذكية (Timeout) وإستراتيجيات إعادة محاولة مرنة.
مهارات العمل