تطبيق خوارزمية PPO مع Fine-Tuning لحل مسألة Lunar Lander باستخدام Reinforcement Learning
تفاصيل العمل
يهدف هذا المشروع إلى بناء وكيل ذكاء اصطناعي قادر على التحكم في مركبة فضائية وإهباطها بأمان في بيئة محاكاة LunarLander-v2 من مكتبة Gymnasium. يعتمد المشروع على خوارزمية Proximal Policy Optimization (PPO) — إحدى أقوى خوارزميات التعلم المعزز — مع إجراء مقارنة شاملة بين أداء النموذج الأساسي (Baseline) وأداؤه بعد تطبيق Fine-Tuning على الـ Hyperparameters، وقياس أثر ذلك على المكافأة والكفاءة الزمنية. أهداف المشروع بناء بيئة محاكاة Lunar Lander وتدريب وكيل PPO عليها من الصفر. تطبيق Fine-Tuning على الـ Hyperparameters (learning rate, clip range, entropy) لتحسين الأداء. تحقيق أعلى متوسط مكافأة (Reward) وأقل عدد خطوات (Steps) للهبوط. إجراء مقارنة كمية موثقة بين النموذجين قبل وبعد الضبط. تسجيل فيديو للأداء وعرضه في داشبورد تفاعلي احترافي. مؤشرات الأداء المستهدفة +200 Avg Reward مستهدف 600k إجمالي Timesteps 80%+ نسبة نجاح الهبوط < 350 متوسط خطوات الهبوط المنهجية والخطوات المرحلة 1 — Baseline Training: تدريب PPO لمدة 300,000 timestep بـ Hyperparameters افتراضية على 4 بيئات متوازية (VecEnv). المرحلة 2 — Fine-Tuning: تحميل النموذج المدرَّب وإعادة التدريب 300,000 timestep إضافية بضبط learning rate (3e-4 → 1e-4)، clip range (0.2 → 0.1)، وent_coef (0.01 → 0.005). المرحلة 3 — التقييم: تشغيل 10 episodes لكل نموذج وحساب avg/max/min reward ونسبة النجاح ومتوسط الخطوات. المرحلة 4 — التوثيق: تسجيل فيديو الأداء باستخدام RecordVideo wrapper، وعرض النتائج في داشبورد HTML/CSS تفاعلي.
بطاقة العمل
طلب عمل مماثل