مشروع Reinforcement Learning — تدريب وضبط وكيل ذكاء اصطناعي للعب Breakout باستخدام PPO و HuggingFace

مشروع Reinforcement Learning — تدريب وضبط وكيل ذكاء اصطناعي للعب Breakout باستخدام PPO و HuggingFace مشروع Reinforcement Learning — تدريب وضبط وكيل ذكاء اصطناعي للعب Breakout باستخدام PPO و HuggingFace مشروع Reinforcement Learning — تدريب وضبط وكيل ذكاء اصطناعي للعب Breakout باستخدام PPO و HuggingFace مشروع Reinforcement Learning — تدريب وضبط وكيل ذكاء اصطناعي للعب Breakout باستخدام PPO و HuggingFace مشروع Reinforcement Learning — تدريب وضبط وكيل ذكاء اصطناعي للعب Breakout باستخدام PPO و HuggingFace مشروع Reinforcement Learning — تدريب وضبط وكيل ذكاء اصطناعي للعب Breakout باستخدام PPO و HuggingFace مشروع Reinforcement Learning — تدريب وضبط وكيل ذكاء اصطناعي للعب Breakout باستخدام PPO و HuggingFace مشروع Reinforcement Learning — تدريب وضبط وكيل ذكاء اصطناعي للعب Breakout باستخدام PPO و HuggingFace مشروع Reinforcement Learning — تدريب وضبط وكيل ذكاء اصطناعي للعب Breakout باستخدام PPO و HuggingFace
تفاصيل العمل

تم تنفيذ مشروع متكامل في مجال Reinforcement Learning باستخدام خوارزمية PPO (Proximal Policy Optimization) لتدريب وكيل ذكاء اصطناعي قادر على لعب لعبة Breakout الكلاسيكية من Atari بأداء شبه مثالي. ما تم تنفيذه: • تحميل نموذج PPO مدرب مسبقاً من HuggingFace Hub (sb3/ppo-BreakoutNoFrameskip-v4) • إعداد بيئة Atari كاملة: FrameStack (4 frames)، Grayscale، 8 Vectorized Environments • تحليل معمّق لمعمارية الشبكة: CNN Feature Extractor + MLP Policy + Value Network • استعراض كامل للـ Hyperparameters الأصلية (gamma, gae_lambda, clip_range, lr...) • تسجيل فيديو لأداء النموذج قبل الـ Fine-tuning • Fine-tuning احترافي للنموذج مع تعديلات دقيقة على الـ Hyperparameters: - Learning Rate: 2.5e-4 ← 2.5e-5 (÷10 للحفاظ على الأوزان) - n_steps: 128 ← 256 - batch_size: 256 ← 512 - n_epochs: 4 ← 6 - clip_range: 0.1 ← 0.05 • بناء Custom Callback (EarlyStoppingBestWeights) بنظامَي حماية مزدوجَين: - Early Stopping بناءً على Patience - Floor Protection لمنع تدهور الأداء - استعادة تلقائية لأفضل أوزان عند التوقف • تقييم النموذج قبل وبعد الـ Fine-tuning (20 episodes) • إنتاج فيديو مقارنة جنباً إلى جنب بين النموذج الأصلي والمُضبَّط • نشر النموذج عبر Flask API مع CORS النتيجة: وكيل يحقق أداء قريباً من المثالي على Breakout مع استقرار وقوة في مواجهة تنويعات البيئة.

مهارات العمل
شارك
بطاقة العمل
تقييم المستقل
تاريخ النشر
منذ شهرين
المشاهدات
30
المستقل
طلب عمل مماثل
مهارات العمل
شارك
مركز المساعدة