الانتقال إلى المحتوى الرئيسي

الأساسيات

ما هي التضمينات (Embeddings)؟

يحوّل التضمين النص إلى متجه أرقام يمثّل معناه، وهذا ما يجعل البحث بالمعنى بدل الصياغة الحرفية ممكنًا. كيف يُقاس التشابه، ولماذا لا تُمزج تضمينات نماذج مختلفة.

كل الشروحات · آخر مراجعة:

قائمة أرقام تنوب عن المعنى

يقرأ نموذج التضمين جزءًا من النص — كلمة أو جملة أو فقرة، وأحيانًا مستندًا كاملًا — ويُخرج متجهًا بطول ثابت: قائمة مرتبة من الأرقام، عادةً بطول مئات أو آلاف العناصر. هذا المتجه ليس ملخصًا يقرؤه إنسان؛ إنه موضع في فضاء رياضي تعلّمه النموذج أثناء التدريب، مرتّب بحيث تقع النصوص ذات المعنى المرتبط قريبة من بعضها.

ما يقع قريبًا هو المعنى المتشابه، لا التهجئة المتشابهة

جملتان لا تشتركان في كلمات تقريبًا لكنهما تعنيان الشيء نفسه تقريبًا يمكن أن تنتجا متجهين متقاربين، لأن نموذج التضمين تعلّم أثناء التدريب ارتباطات بين المفاهيم، لا فقط الحروف الظاهرة. وعلى العكس، جملتان تشتركان في كلمات كثيرة لكن معناهما مختلف قد ينتهي بهما المطاف بعيدتين جدًا. هذا هو الفارق الجوهري بين البحث القائم على التضمين والمطابقة بالكلمات المفتاحية الحرفية.

القرب يُقاس، لا يُقدَّر بالعين

بمجرد تمثيل النص كمتجهات، يصبح مقارنة المعنى مسألة هندسية: درجة تشابه تُحسب بين متجهين، غالبًا حسب مدى تقاربهما في الاتجاه نفسه. البحث في مجموعة كبيرة يعني حساب تلك الدرجة بين متجه الاستعلام وكل متجه مخزَّن، ثم إعادة أقرب التطابقات — العملية نفسها سواء ضمّت المجموعة مئة عنصر أو مئة مليون.

تضمينات النماذج المختلفة لا تُمزج

مثل مفردات المُرمِّز، فضاء متجهات نموذج تضمين خاص بذلك النموذج وبطريقة تدريبه. المتجه الذي ينتجه نموذج تضمين لا يُقارَن بمعنى مفيد بمتجه أنتجه نموذج آخر، حتى لو تساوى عدد أبعاد المتجهين. تبديل نموذج التضمين يعني إعادة تضمين كل ما هو مخزَّن بالفعل، لا المحتوى الجديد فقط من تلك اللحظة فصاعدًا.

عمل نموذج التضمين يختلف عن عمل نموذج اللغة

يولّد نموذج اللغة نصًا، رمزًا بعد رمز، انطلاقًا من مطالبة. أما نموذج التضمين فلا يولّد شيئًا — يحوّل النص إلى متجه ويتوقف عند ذلك. تستخدم بعض الأنظمة النموذج الأساسي نفسه للمهمتين، وأخرى تستخدم نموذجين منفصلين تمامًا؛ وفي الحالتين، المتجه الناتج عن خطوة التضمين ليس إجابة بحد ذاته، بل مجرد شيء يمكن لخطوة بحث أو مطابقة أن تقارنه.

أين يظهر هذا عمليًا

التضمينات هي ما يجعل التوليد المعزَّز بالاسترجاع ممكنًا — انظر صفحة ما هو RAG؟ لمعرفة كيف يتكامل الاسترجاع مع نموذج اللغة — لكن التقنية نفسها تقوم أيضًا خلف البحث الدلالي في تذاكر الدعم أو التوثيق، ومطابقة محادثات سابقة مشابهة، وإزالة المحتوى شبه المتطابق، وتجميع العناصر المرتبطة من دون أن يصنّف أحد الفئات يدويًا.

أسئلة يطرحها الناس

هل التضمين هو نفسه الرمز (token)؟
لا. الرمز وحدة نص منفصلة يقرؤها نموذج اللغة أو يكتبها واحدة تلو الأخرى. أما التضمين فهو متجه مستمر يمثّل معنى جزء أكبر من النص، تنتجه خطوة منفصلة لا تولّد شيئًا.
هل يمكنني مقارنة تضمينات من نموذجين مختلفين؟
ليس بمعنى مفيد. كل نموذج تضمين يحدّد فضاء متجهاته الخاص أثناء التدريب، فالمسافة التي تعني "متشابه جدًا" في فضاء نموذج ما ليس لها معنى محدد في فضاء نموذج آخر، حتى مع تساوي طول المتجهات.
هل متجه التضمين الأكبر يعني بحثًا أفضل؟
ليس بمفرده. الأبعاد الأكثر قد تلتقط فروقًا أدق، لكن الجودة تعتمد على البيانات التي دُرِّب عليها النموذج ومدى ملاءمتها لمحتواك، لا على عدد الأبعاد وحده.
هل يستطيع أحد استرجاع النص الأصلي من تضمين؟
الاسترجاع الدقيق غير عملي عمومًا، لكن التضمين ما زال مشتقًا مباشرة من محتواك ويمكن أن يسرّب معلومات ذات دلالة عنه في بعض الهجمات. عامل تضمينات النص الحساس المخزَّنة بالحذر نفسه الذي تعامل به النص نفسه، لا وكأنها مجهولة الهوية بالفعل.

جرّبه بدل أن تقرأ عنه

تولّد ميزتا الذاكرة وحزم السياق في ClawAI التضمينات محليًا عبر Ollama وتخزّنها في قاعدة بيانات متجهات للبحث بالتشابه، بدلًا من إرسال محتواك إلى واجهة برمجة تضمين سحابية منفصلة لهذا الغرض.