مشروع Reinforcement Learning — تدريب وضبط وكيل ذكاء اصطناعي للعب Breakout باستخدام PPO و HuggingFace
تفاصيل العمل
تم تنفيذ مشروع متكامل في مجال Reinforcement Learning باستخدام خوارزمية PPO (Proximal Policy Optimization) لتدريب وكيل ذكاء اصطناعي قادر على لعب لعبة Breakout الكلاسيكية من Atari بأداء شبه مثالي. ما تم تنفيذه: • تحميل نموذج PPO مدرب مسبقاً من HuggingFace Hub (sb3/ppo-BreakoutNoFrameskip-v4) • إعداد بيئة Atari كاملة: FrameStack (4 frames)، Grayscale، 8 Vectorized Environments • تحليل معمّق لمعمارية الشبكة: CNN Feature Extractor + MLP Policy + Value Network • استعراض كامل للـ Hyperparameters الأصلية (gamma, gae_lambda, clip_range, lr...) • تسجيل فيديو لأداء النموذج قبل الـ Fine-tuning • Fine-tuning احترافي للنموذج مع تعديلات دقيقة على الـ Hyperparameters: - Learning Rate: 2.5e-4 ← 2.5e-5 (÷10 للحفاظ على الأوزان) - n_steps: 128 ← 256 - batch_size: 256 ← 512 - n_epochs: 4 ← 6 - clip_range: 0.1 ← 0.05 • بناء Custom Callback (EarlyStoppingBestWeights) بنظامَي حماية مزدوجَين: - Early Stopping بناءً على Patience - Floor Protection لمنع تدهور الأداء - استعادة تلقائية لأفضل أوزان عند التوقف • تقييم النموذج قبل وبعد الـ Fine-tuning (20 episodes) • إنتاج فيديو مقارنة جنباً إلى جنب بين النموذج الأصلي والمُضبَّط • نشر النموذج عبر Flask API مع CORS النتيجة: وكيل يحقق أداء قريباً من المثالي على Breakout مع استقرار وقوة في مواجهة تنويعات البيئة.
مهارات العمل
بطاقة العمل
طلب عمل مماثل