تخطَّ إلى المحتوى

🤖 شرح الذكاء الاصطناعي وتعلّم الآلة

Generative AI — ما هو الذكاء الاصطناعي التوليدي؟

الدرس 47 من 65· ⏱ 5 دقائق قراءة

بعد معمارية Transformers والتعلّم العميق، تتّسع الصورة لتشمل الذكاء الاصطناعي التوليدي — المجال الذي بنى عليه الموجة الحالية من المنتجات. هذه الصفحة مدخل مفاهيمي: ما هي النماذج التوليدية، ما الذي يميّزها عن النماذج التمييزية، وأين تقف النماذج اللغوية الكبيرة (LLMs) داخل هذا الإطار.

النماذج التمييزية مقابل النماذج التوليدية

النموذج التمييزي (Discriminative) يتعلّم حدودًا فاصلة بين الأصناف في البيانات:

Discriminative:   P(label | input)
                  "لو أعطيتك صورة، ما احتمال أنّها قطة؟"

النموذج التوليدي (Generative) يتعلّم توزيع البيانات نفسه — كيف تبدو البيانات الحقيقية، وكيف يمكنه إنتاج عيّنات جديدة منها:

Generative:       P(input)
                  أو  P(next token | previous tokens)
                  أو  P(pixels of a plausible image)

تطبيقات عملية لكلا النوعين:

النماذج التمييزيةالنماذج التوليدية
مصنّف بريد مزعجإكمال جملة
تشخيص طبي (مرض / سليم)توليد صورة من وصف نصّي
تحليل المشاعركتابة كود من تعليمات
كشف الاحتيالتلخيص نصّ وإعادة صياغته

النماذج اللغوية الكبيرة هي نماذج توليدية تخصّ النصّ: تتعلّم P(token التالي | الرموز السابقة) على نصوص ضخمة، ثم تستخدم هذا التوزيع لتوليد نصّ جديد.

ما الذي تتعلّمه النماذج التوليدية؟

لا تتعلّم "حفظ" قاعدة بيانات نصّية. تتعلّم:

  • أنماط إحصائية (أيّ كلمة تأتي عادةً بعد أخرى).
  • بنية لغوية (قواعد، ترتيب، علامات ترقيم).
  • علاقات دلالية (تشابه المعاني، السياق).
  • ارتباطات معرفية ضمن بيانات التدريب.

النتيجة: نموذج يحسب احتمالات لرموز جديدة. النصّ المولّد ينبثق من اختيار متتالي لهذه الاحتمالات — لا من استرجاع حرفي من corpus.

التشبيه العملي:
  النحوذج التمييزي مثل طالب حفظ خريطة: "هذا شارع، ذاك نهر".
  النموذج التوليدي مثل طالب حفظ إحصائيات المدن: تعلّم شكل المدينة فيتكوّن
  لديه إحساس بما "يُشبه" مدينة حقيقية، فيستطيع رسم مدينة جديدة.

التوليد ليس بحثًا في قاعدة بيانات

هذا أهمّ ما يجب فهمه:

❌  "النموذج يحفظ ويبحث"        — لا، النموذج يحسب احتمالات.
✅  "النموذج يتعلّم أنماطًا"    — يولّد نصًّا يتوافق مع ما رآه.

الآثار العملية:

  • الاسترجاع الحرفي غير مضمون. قد "يختلق" النموذج اقتباسًا يبدو صحيحًا لكنه غير موجود فعلًا في بيانات التدريب.
  • التشابه مع بيانات التدريب ممكن، خاصة في حالات نادرة أو شائعة جدًا.
  • الإبداع المحدود ينبع من احتمالات: تركيبات جديدة لم تكن في corpus، لكن مفرداتها وعلاقاتها مألوفة.

هذا أحد مصادر ما يُسمّى hallucination (الهلوسة): النموذج يولّد نصًّا "محتملًا لغويًا" دون أيّ التزام بأنّه صحيح واقعيًا. سنتعرّف على التعامل معه في الدروس التالية.

deterministic vs probabilistic

البرمجيات التقليدية حتمية: نفس المُدخل + نفس الكود → نفس المخرج.

النماذج التوليدية احتمالية: نفس المُدخل قد يعطي مخرجات مختلفة عبر تشغيلات متتالية، لأن الخطوة التالية تُختار من توزيع احتمالي (مع بعض العشوائية المتحكَّم بها — انظر درس Decoding و Sampling).

حتمية:    input → model → output      (نفس output كل مرة)
احتمالية: input → model → distribution → sample → output
                                          ↑
                                     هذا الجزء هو الذي يدخل التباين

أين تقع النماذج اللغوية الكبيرة؟

LLMs هي حالة خاصة من النماذج التوليدية، حيث:

  • المجال: نصّ لغوي.
  • البنية: مبنية على Transformer decoder.
  • الهدف: P(الرمز التالي | السياق).
  • التدريب: على كميات هائلة من النصّ.
  • التطبيقات: محادثة، تلخيص، استخراج، توليد كود، ترجمة، وغير ذلك.

ليست كل النماذج التوليدية LLM. هناك نماذج توليدية للصور، للصوت، للكود (متخصّصة)، للبروتينات... كلها تتشارك الفلسفة العامة (تعلّم توزيع البيانات) لكن بأهداف ومعماريات مختلفة.

نقاط القوة والقيود

نقاط القوة

  • المرونة: نموذج واحد يمكنه تنفيذ مهام متعددة لم يُدرَّب عليها صراحة.
  • التفاعل باللغة الطبيعية: لا حاجة لواجهة برمجية صارمة لكل مهمة.
  • النقل بين المهام: ما يتعلّمه النموذج في سياق يُساعده في سياقات أخرى.
  • السرعة: توليد مسوّدة أولى أسرع من البدء من الصفر.

القيود

  • غير حتمي: لا يضمن نفس الجواب لكل مرّة.
  • حدود السياق: نافذة سياق محدودة (انظر Context Windows).
  • Hallucination: قد يولّد معلومات غير صحيحة بثقة.
  • يحتاج تحققًا بشريًا: خاصة في السياقات الحسّاسة (قانوني، طبي، مالي).
  • يحتاج موارد حسابية: تكلفة الاستدعاء أعلى من البحث في قاعدة بيانات.

متى لا تستخدم LLM؟

  • إذا كانت المهمة حتمية بحتة (حساب، تحويل صيغة، استعلام قاعدة بيانات) — استخدم كودًا عاديًا.
  • إذا كانت الإجابة مضمونة في قاعدة بيانات موجودة عندك — استخرجها بالاستعلام العادي.
  • إذا كانت لديك قواعد واضحة صارمة (regex، parser مخصّص) — هذه أسرع وأدقّ.

القاعدة العملية: استخدم LLM حيث تحتاج فهمًا لغويًا أو توليدًا أو مرونة. تجنّبه حيث الدقة الصارمة أهمّ من المرونة.

أخطاء شائعة

  • "الذكاء الاصطناعي التوليدي = ChatGPT": لا، هو فلسفة أعمّ تشمل توليد الصور والصوت والكود. ChatGPT تطبيق تجاري فوق نموذج لغوي كبير.
  • "النموذج يبحث في الإنترنت": لا، النماذج اللغوية في شكلها الأساسي لا تبحث — تولد. بعض المنتجات تُضيف بحثًا كخطوة منفصلة (RAG) لكنها ليست جزءًا من النموذج نفسه.
  • "Hallucination = النموذج يكذب": ليس قصدًا. النموذج لا "يكذب" ولا "يعرف الحقيقة" — يولّد نصًّا ذا احتمالية عالية دون التحقّق من صحّته الواقعية.
  • "نموذج أكبر = أفضل دائمًا": ليس بالضرورة. يعتمد على المهمة، البيانات المتاحة، التكلفة، الكمون. النماذج الأصغر المحسّنة قد تتفوق على نماذج أكبر في مهمّات محدّدة.

الخطوات التالية

ملاحظة النطاق: هذا الدرس حدّه التوليدي المفاهيمي. RAG، والوكلاء، و MLOps، وأمن الـ LLM تُغطّى في الموجات التالية.

شرح Generative AI — ما هو الذكاء الاصطناعي التوليدي؟ — الذكاء الاصطناعي وتعلّم الآلة بالعربي
Generative AI — ما هو الذكاء الاصطناعي التوليدي؟الذكاء الاصطناعي وتعلّم الآلة بالعربي · The Code Fix

📚 لمزيد من التعمّق في الذكاء الاصطناعي وتعلّم الآلة، راجِع توثيق scikit-learn الرسمي.

هل كان هذا الدرس مفيدًا؟