الاحتمالات هي اللغة التي تتحدث بها النماذج عن عدم اليقين. عندما يتنبأ نموذج بأن احتمال هذا البريد المزعج هو 0.95، أو أن احتمال هذا المريض مصاب بمرض معين هو 0.7 — هذه أرقام احتمالية. هذه الصفحة تشرح الأساسيات العملية بدون الدخول في تعريفات أكاديمية ثقيلة.
ما هو الاحتمال؟
الاحتمال (Probability) = رقم بين 0 و1 يعبّر عن فرصة وقوع حدث ما.
0= الحدث مستحيل.1= الحدث مؤكد.0.5= فرصة 50/50.
أمثلة عملية في الذكاء الاصطناعي
| الموقف | ما يحسبه النموذج |
|---|---|
| مصنّف بريد مزعج | احتمال أن يكون البريد مزعجًا (مثلًا 0.92). |
| تشخيص طبي | احتمال أن يكون المريض مصابًا بمرض معين. |
| توقع الطقس | احتمال هطول الأمطار غدًا. |
| نموذج لغوي | احتمال الكلمة التالية في الجملة. |
القاعدة الأساسية للجمع (احتمال A أو B)
إذا كان الحدثان A و B متنافيين (لا يمكن أن يحدثا معًا):
P(A أو B) = P(A) + P(B)
مثال: احتمال ظهور 1 أو 2 على نرد = 1/6 + 1/6 = 1/3.
قاعدة الضرب (احتمال A و B معًا)
إذا كان A و B مستقلّين (لا يؤثّر أحدهما على الآخر):
P(A و B) = P(A) × P(B)
مثال: احتمال ظهور 1 على النرد و صورة على العملة = (1/6) × (1/2) = 1/12.
الاحتمال الشرطي (Conditional Probability)
الاحتمال الشرطي = احتمال حدث ما بمعلومية حدث آخر:
P(A | B) = P(A و B) / P(B)
الرمز | يعني "بشرط أن" أو "بمعلومية".
مثال من الذكاء الاصطناعي
لتشخيص طبي:
- P(مريض) = 0.01 (1% من الناس مصابون)
- P(اختبار_موجب | مريض) = 0.95 (الاختبار يلتقط 95% من المرضى)
- P(اختبار_موجب | غير_مريض) = 0.05 (5% false positives)
السؤال: إذا كانت نتيجة الاختبار إيجابية، فما احتمال أن يكون المريض فعلًا مصابًا؟
الإجابة المباشرة (المُضِلّة): 95%. لكن الجواب الصحيح مختلف جدًا — وهذا ما يحلّه نظرية بايز.
نظرية بايز (Bayes' Theorem)
P(A | B) = [P(B | A) × P(A)] / P(B)
التطبيق على المثال الطبي
- P(مصاب | اختبار_موجب) = [P(اختبار_موجب | مصاب) × P(مصاب)] / P(اختبار_موجب)
- = (0.95 × 0.01) / P(اختبار_موجب)
- = 0.0095 / P(اختبار_موجب)
لحساب P(اختبار_موجب)، نستخدم قانون الاحتمال الكلي:
P(اختبار_موجب) = P(موجب|مصاب) × P(مصاب) + P(موجب|غير_مصاب) × P(غير_مصاب)
= (0.95 × 0.01) + (0.05 × 0.99)
= 0.0095 + 0.0495
= 0.059
إذن:
P(مصاب | اختبار_موجب) = 0.0095 / 0.059 ≈ 0.16
فقط 16% من الذين نتيجتهم إيجابية مصابون فعلًا! هذا لأن المرض نادر (1%) والـ false positives تتراكم.
هذه نتيجة counter-intuitive لكنها حاسمة في تعلّم الآلة — كثير من المشاكل "تبدو سهلة" لأن الإيجابيات الكاذبة تسيطر على التنبؤات عندما يكون الحدث نادرًا.
التوزيعات الاحتمالية (Probability Distributions)
دالّة تربط كل قيمة محتملة باحتمالها. أشهر التوزيعات في ML:
التوزيع الطبيعي (Normal / Gaussian)
- منحنى الجرس الكلاسيكي.
- كثير من الظواهر الطبيعية تتبعه (الطول، الوزن، أخطاء القياس...).
- معلمتان: المتوسط (μ) والانحراف المعياري (σ).
import numpy as np
samples = np.random.normal(loc=100, scale=15, size=1000)
# 1000 عيّنة من توزيع طبيعي، متوسط 100 وانحراف معياري 15
توزيع برنولي (Bernoulli)
- نتيجتان فقط: 0 أو 1.
- مثل: عملة (وجه/ظهر)، نتيجة Spam/Not Spam.
# عيّنة من توزيع برنولي
outcomes = np.random.binomial(1, 0.3, size=10) # 10 تجارب، احتمال نجاح 30%
التوزيع الفئوي (Categorical)
- أكثر من فئتين (مثل فئات تصنيف صورة: قطة، كلب، سيارة...).
- يعمّم برنولي.
توزيع بواسون (Poisson)
- عدد الأحداث في فترة زمنية (مثل عدد الزوار في الدقيقة).
- معلمته: معدّل الحدوث (λ).
الإنتروبيا (Entropy)
الإنتروبيا = مقياس عدم اليقين في توزيع احتمالي.
- إنتروبيا صفر = النتيجة مؤكّدة (لا عدم يقين).
- إنتروبيا عالية = النتيجة عشوائية جدًا.
الصيغة:
H(P) = -Σ P(x) × log(P(x))
لماذا تهمّ في تعلّم الآلة؟
- شجرة القرار (Decision Tree) تختار السمة التي تقلل الإنتروبيا أكثر عند كل تقسيم.
- Cross-Entropy Loss هو دالّة الفقد القياسية في التصنيف.
# حساب الإنتروبيا لتوزيع
import numpy as np
def entropy(p):
p = np.asarray(p)
return -np.sum(p * np.log2(p + 1e-12))
print(entropy([1.0, 0.0])) # 0 — مؤكد
print(entropy([0.5, 0.5])) # 1.0 — عشوائي بالكامل بين فئتين
print(entropy([0.9, 0.1])) # 0.469 — شبه مؤكد
الاستقلال والارتباط
- مستقلّان: تعلّم A لا يغيّر معرفتك بـ B.
- مرتبطان: تعلّم A يغيّر معرفتك بـ B.
في تعلّم الآلة:
- الافتراض الكلاسيكي Naive Bayes يفترض أن الميزات مستقلة (تبسيط قوي لكن فعّال).
- Multicollinearity (في Linear Regression) مشكلة لأن الميزات مترابطة → تقدير غير مستقر.
كيف تظهر الاحتمالات في مشاريع AI؟
- Logistic Regression = نموذج ينتج احتمال أن العينة إيجابية.
- Naive Bayes = تطبيق مباشر لقاعدة بايز.
- Softmax (في الشبكات العصبية) = توزيع احتمالي على عدّة فئات.
- Cross-Entropy Loss = مقياس "بعد التوزيع المُتنبّأ به عن الحقيقي".
- Bayesian Networks = شبكات احتمالية للنمذجة في عدم اليقين.
أخطاء شائعة
- "95% دقّة" تعني 95% من المرضى مصابون: لا! هذا ما يفسّره بايز — الدقّة في الاختبار ليست احتمال الإصابة بعد الاختبار.
- خلط الاحتمال بالتردد: الاحتمال مفهوم نظري، التردد نسبي. هما قريبان لكن ليسا نفس الشيء في الرياضيات الصارمة.
- تجاهل الاحتمال المرجعي (Prior): في Bayes، الـ prior يهمّ كثيرًا. تجاهله يعني نتائج مضلّلة.
الخطوات التالية
- الإحصاء — تقييم النماذج وفهم البيانات.
- نظرة على أنواع التعلّم — كيف تستخدم هذه المفاهيم في ML.
- المتجهات والمصفوفات — الأساس الرياضي.