التنبؤ بمسارات الشركات الناشئة من تخارج واستحواذ وخروج من السوق
تفاصيل العمل
1. الإطار العام للمشروع الموقف (Situation): يحتاج المستثمرون وأصحاب المصلحة إلى رؤى قائمة على البيانات لتقييم احتمالية النجاح، أو الاستحواذ، أو الفشل للشركات الناشئة الصاعدة المهمة (Task): كان الهدف هو تحليل مجموعة بيانات تتضمن خصائص الشركات الناشئة والنتائج التاريخية من أجل بناء نموذج تنبؤي موثوق الإجراء (Action): قمت بتنظيف ومعالجة ملف `startup_success_dataset.csv`، وهندسة الميزات (Feature Engineering) لإبراز مقاييس الأعمال الحيوية[cite: 1]. بعد ذلك، قمت بتدريب وتقييم خوارزميات التعلم الآلي في بيئة "Jupyter Notebook" للتنبؤ بسيناريوهات التخارج للشركات (Exit events). النتيجة (Result):تُوج المشروع بإطار عمل تنبؤي قوي يُصنف مسارات الشركات الناشئة، مما أثبت كفاءتي في استخدام لغة بايثون (Python)، ومعالجة البيانات، والتحليل الاستكشافي، والنمذجة التنبؤية --- 2. التفاصيل التقنية الدقيقة (من الأكواد والرسوم البيانية المعروضة في الشريحة): توضح لقطات الشاشة المرفقة في ملف العرض المهارات التقنية التي تم تطبيقها فعلياً لتنفيذ المشروع: أ. تحويل البيانات وتوزيعها (Data Transformation & Distribution): يوضح المقطع البرمجي استخدامك للتحويلات اللوغاريتمية الرياضية (`np.log10` و `np.log1p`) لمعالجة توزيع البيانات (لتخفيف حدة الانحراف - Skewness). تم تطبيق هذا التحويل على أربعة مقاييس أعمال رئيسية ومؤثرة في الشركات الناشئة: حجم السوق بالملايين (`market_size_million`)، مدى جذب المنتج للمستخدمين (`product_traction_users`)، معدل حرق الأموال بالملايين (`burn_rate_million`)، والإيرادات بالملايين (`revenue_million`) قمت بكتابة كود برمجي باستخدام مكتبتي `seaborn` و `matplotlib` لرسم منحنى الكثافة (KDE plot) الذي يوضح التوزيع الطبيعي الجديد والمحسن لهذه المتغيرات الأربعة بعد تطبيق المعالجة اللوغاريتمية ب. اختيار الميزات باستخدام تحليل المكونات الرئيسية (PCA for Feature Selection): يحتوي الكود على تعليق توضيحي هام يشير إلى نهجك المميز: "استخدام PCA ليس لتحويل البيانات، بل لاختيار البيانات الأكثر أهمية" تضمنت هذه العملية عدة خطوات تقنية دقيقة: 1. توحيد أو تقييس البيانات (Scaling) باستخدام أداة `StandardScaler` لضمان توازن المتغيرات 2. تطبيق خوارزمية تحليل المكونات الرئيسية `PCA` وتحديد استخراج أفضل 5 مكونات/ميزات رئيسية (`n_components=5`) 3. عزل أهم الميزات المستخرجة وفلترتها برمجياً، ثم إعادة دمجها مع مجموعة البيانات الأصلية (`df_train` و `df_test`) لتجهيز بيانات التدريب النهائية (`X_train` و `X_test`) التي سيُبنى عليها النموذج التنبؤي
مهارات العمل
بطاقة العمل
طلب عمل مماثل