استخراج وهيكلة القوانين المصرية (أكثر من 1500 ملف) باستخدام الذكاء الاصطناعي (Qwen3) و Web Scraping (AI-Powered Web Scraping & Structuring for Egyptian Laws using Local LLM)

استخراج وهيكلة القوانين المصرية (أكثر من 1500 ملف) باستخدام الذكاء الاصطناعي (Qwen3) و Web Scraping (AI-Powered Web Scraping & Structuring for Egyptian Laws using Local LLM) استخراج وهيكلة القوانين المصرية (أكثر من 1500 ملف) باستخدام الذكاء الاصطناعي (Qwen3) و Web Scraping (AI-Powered Web Scraping & Structuring for Egyptian Laws using Local LLM) استخراج وهيكلة القوانين المصرية (أكثر من 1500 ملف) باستخدام الذكاء الاصطناعي (Qwen3) و Web Scraping (AI-Powered Web Scraping & Structuring for Egyptian Laws using Local LLM)
تفاصيل العمل

في هذا المشروع، قمت بهندسة وبناء قاعدة بيانات دقيقة وشاملة للتشريعات والقوانين المصرية من خلال دمج تقنيات استخراج البيانات (Web Scraping) مع قوة الذكاء الاصطناعي (LLMs). قمت بسحب البيانات من مصادر حكومية رسمية، ثم استخدمت نموذج Qwen3 30B محلياً (Locally) لتحليل النصوص القانونية المعقدة وغير المهيكلة، وتحويلها إلى بيانات (JSON) فائقة الدقة جاهزة لتدريب نماذج تعلم الآلة أو الاستخدام المباشر. أبرز ما تم إنجازه في المشروع: استخراج بيانات ضخمة: سحب ومعالجة أكثر من 1500 ملف قانوني من مختلف الفئات عبر عناكب شبكية (Spiders) مخصصة للتعامل مع مواقع رسمية متعددة. هيكلة ذكية مدعومة بالذكاء الاصطناعي (AI-Powered Structuring): بدلاً من الاعتماد على الطرق التقليدية (Regex)، قمت بتشغيل نموذج Qwen3 30B محلياً لمعالجة النصوص الخام بذكاء، حيث قام النموذج بـ: استخراج البيانات الوصفية (Metadata) بدقة (مثل: اسم القانون، تاريخ النشر، وحالة التعديل). تفكيك القانون إلى مواده الفردية (Articles Level)، مع تحديد (رقم المادة، الباب، والفصل). استخراج وتوليد الكلمات المفتاحية (Keywords) لكل مادة لتعزيز محركات البحث داخل قاعدة البيانات. العمل محلياً (Local Processing): تشغيل نموذج بـ 30 مليار معلمة (30B Parameters) محلياً لضمان الخصوصية التامة للبيانات، وتجنب تكاليف الـ APIs الخارجية، مع تسريع عملية المعالجة. التحديات التقنية وحلولها (Problem Solving): التحدي الأول (ملفات PDF التالفة والصورية): واجهت ملفات لا يمكن قراءة نصوصها. قمت ببرمجة أداة فحص آلية باستخدام pdfplumber لاستخراج النصوص من الملفات السليمة، وعزل الملفات الصورية آلياً في مجلد مخصص (need_ocr) لمعالجتها بتقنية التعرف البصري (OCR). التحدي الثاني (عشوائية النصوص القانونية): النصوص المستخرجة كانت متداخلة وغير منتظمة. تم حل ذلك عن طريق هندسة الأوامر (Prompt Engineering) الموجهة لنموذج Qwen3 ليقوم بتنظيف البيانات وهيكلتها في نسق JSON دقيق ومنظم بنسبة 100%. التقنيات والأدوات المستخدمة (Tech Stack): الذكاء الاصطناعي: Qwen3 30B (Local LLM), Prompt Engineering لغة البرمجة: Python أدوات الاستخراج: Scrapy, BeautifulSoup معالجة الملفات: pdfplumber تنسيق البيانات: JSON (AI Data Parsing) معاينة حية للمشروع (Live Preview): جزء من حزمة البيانات التي تم هيكلتها بالذكاء الاصطناعي تم رفعه كمفتوح المصدر على منصة Hugging Face، يمكن الاطلاع على هيكل البيانات على Hugging Face في HazemShoaib/Egypt_Laws

شارك
بطاقة العمل
تاريخ النشر
منذ 3 أشهر
المشاهدات
102
المستقل
Hazem Shoaib
Hazem Shoaib
مهندس برمجيات
طلب عمل مماثل
شارك
مركز المساعدة