تخصيص موارد المستشفيات تحت الضغط بالتعلم المعزز (Reinforcement Learning)
تفاصيل العمل
السؤال اللي بيفرق بين حل قوي وحل عشوائي مش "هل الموديل بيشتغل؟"، لكن "هل ده فعلاً أنسب حل للمشكلة دي؟" تخصيص الموارد في المستشفيات وقت الضغط مش مشكلة سهلة: كل قرار قبول أو تأجيل مريض له تكلفة، والقرار الصحيح بيتغيّر حسب الضغط اللي النظام تحته في اللحظة دي. سياسات القبول التقليدية (Greedy) بسيطة، لكنها بتفشل في التعامل مع التوازن الدقيق بين استغلال الموارد وحماية الحالات الأولى بالرعاية. السؤال البحثي هنا كان: هل نموذج تعلم معزز (Reinforcement Learning) يقدر يتعلم سياسة قبول أفضل من الأسلوب التقليدي، تحت مستويات ضغط مختلفة، ومن غير ما يضحّي بجودة القرار الطبي؟ المنهجية: بنينا بيئة محاكاة مخصصة (Gymnasium) تمثل قسم استقبال مستشفى بالكامل — سراير ICU، سراير عادية، أجهزة تنفس، وشيفتات الطاقم — بمعايير كل واحدة فيها (نسبة الحالات الحرجة، معدل استخدام أجهزة التنفس، مدة الإقامة) مبنية على أبحاث طبية منشورة، مش أرقام افتراضية. قارنّا 3 خوارزميات (PPO, DQN, A2C) عبر 86 تجربة منظمة في 12 مجموعة، شملت: مقارنة أساسية، حساسية معدل الوصول، تصميمات مختلفة لدالة الأجر، سعة الموارد، البنية والمعاملات، وإعادة تجارب بـ seeds مختلفة للتحقق من استقرار النتائج. اكتشاف مهم أثناء التطوير: لقينا 4 مشاكل حقيقية في البيئة كانت بتُبطّل كل النتائج الأولى — الأخطر كانت غياب آلية "خروج المريض من السرير"، اللي كانت بتجمّد النظام بعد 30 خطوة بس (كل التجارب الأولى كانت بتوقف عمليًا عند نفس النقطة من غير ما نلاحظ). بعد التصحيح، أعدنا تشغيل كل التجارب من الصفر. النتائج الأساسية: - DQN كانت الأقوى بشكل واضح: تفوقت على الـ baseline بنسبة 52.8% وقت الضغط الشديد (λ=4.5)، 23.3% في الأحمال المنخفضة، و9.5% في الحالة المعيارية — وثبتت الأفضلية دي عبر فحص متعدد الـ seeds (تباين أقل من 5% مقارنة بفروق تفوق 100 نقطة بين الخوارزميات). - PPO كانت الأفضل فقط في حالة الضغط المتوسط (+41.9% عند λ=4.5)، وA2C فشلت بشكل بنيوي في كل الحالات — أثبتنا إن ده مش مشكلة ضبط معاملات (hyperparameters)، لأن 4 محاولات ضبط مختلفة + تشغيل 8 بيئات متوازية كلهم أدّوا لنفس النتيجة الضعيفة بالضبط. - اكتشاف يستحق الذكر: قياس الأداء برقم واحد (الأجر) مش كافي لتقييم قرارات طبية. لما درسنا معدل الوفيات تحديدًا، لقينا إن رفع "عقوبة" الوفاة في دالة الأجر (من δ=2 لـ δ=10) خفّض معدل الوفيات للنص لكل الخوارزميات، مع تغيّر طفيف جدًا في الأجر الكلي — يعني الأجر لوحده كان ممكن يخبي نتيجة طبية أهم بكتير. أدوات: Python, Gymnasium, Stable-Baselines3 (PPO, DQN, A2C).
مهارات العمل