تحوّل التضمينات النص إلى متجهات تلتقط المعنى، وتشغّل البحث الدلالي و RAG. تعرّف على كيفية عمل التضمينات ولماذا هي مهمة لـ GEO.

التضمينات هي تمثيلات رقمية تحوّل البيانات المعقّدة، وعادة ما تكون نصًا، إلى مصفوفات متعددة الأبعاد من الأرقام العشرية (floating-point)، مرتّبة بحيث تقترب العناصر ذات المعنى المتشابه من بعضها في فضاء متجهي مشترك. وهي الآلية التي تتيح للحاسوب اعتبار كلمتي 'سيارة' و'مركبة' مرتبطتين، مع إبقاء 'سيارة' و'موز' بعيدتين عن بعضهما، رغم أن الكلمتين لا تشتركان في أي حرف.
تُعد التضمينات أساسية للبحث الحديث القائم على AI. فهي تشغّل البحث الدلالي، وretrieval augmented generation، والطريقة التي تحدد بها نماذج اللغة الكبيرة المصادر ذات الصلة بالاستعلام. فهم التضمينات يوضح لماذا يظهر المحتوى الواضح والمنظّم جيدًا ويُقتبس منه، ولماذا أصبحت المطابقة الدقيقة للكلمات المفتاحية أقل أهمية بكثير مما كانت عليه.
يقوم التضمين بترميز محتوى كلمة أو جملة أو مستند كمتجه، وهو قائمة من الأرقام تلتقط المعنى. لا يحمل أي إحداثي منفرد تفسيراً يمكن للإنسان قراءته؛ بل مجموع الإحداثيات كلها هو ما يعكس دلالة الكائن. والنتيجة أن المعنى يتحول إلى رياضيات، ويتحول التشابه في المعنى إلى قرب في الفضاء.
لهذا السبب تجمّع التضمينات المفاهيم المرتبطة معًا. فكلمات مثل 'شجرة' و'نبات' تقع بالقرب من الفكرة الأوسع 'الطبيعة'، بينما تكون 'قطة' و'كلب' أقرب إلى بعضهما من 'قطة' و'سيارة'. ومن خلال تحويل اللغة إلى فضاء هندسي، تمنح التضمينات الآلات طريقة للاستدلال حول المعنى لم تستطع مطابقة الكلمات المفتاحية تحقيقها قط.
يتم إنتاج التضمينات بواسطة نماذج تعلّم آلي مدرَّبة على كميات كبيرة من البيانات. تتمثل العملية العامة في اختيار نوع البيانات، ومعالجتها مسبقًا لتقليل التشويش، وتمريرها عبر نموذج تضمين مناسب، ثم تقييم النتيجة وتحسينها. يتعلّم النموذج من الأنماط في بيانات التدريب أي الكلمات والأفكار تميل إلى الظهور في سياقات متشابهة، ويرمّز تلك العلاقات داخل المتجهات.
تناسب نماذج مختلفة بيانات مختلفة. بالنسبة للنص، تشمل الخيارات الشائعة BERT وWord2Vec وGloVe، ونماذج مركّزة على الجمل مثل Sentence-BERT، بينما تستخدم الصور الشبكات الالتفافية (convolutional networks) ومحوّلات الرؤية (vision transformers). يمكن تدريب التضمينات مسبقًا للاستخدام العام، أو ضبطها بدقة لمجال محدد، أو بناؤها من الصفر، وتقوم نفس عائلة التقنيات على أساس بنية المحوّل (transformer) التي تقف خلف نماذج اللغة اليوم.
بمجرد تضمين المحتوى، تقارن الآلات المتجهات باستخدام مقاييس المسافة. الأكثر شيوعًا هو تشابه جيب التمام (cosine similarity)، الذي يقيس الزاوية بين متجهين بدلاً من طولهما، مما يجعله يلتقط القرب الدلالي بغض النظر عن الحجم. المسافة الإقليدية خيار آخر. في كلتا الحالتين، تعني المسافة الأصغر أو الزاوية الأصغر أن قطعتي المحتوى أكثر تشابهًا في المعنى.
يستخدم البحث الدلالي هذا في خطوتين. أولاً، يتم تحويل الاستعلام والمستندات المرشّحة إلى تضمينات باستخدام نفس النموذج. ثم يحسب النظام التشابه بين متجه الاستعلام وكل متجه مستند، ويرتّب الأقرب في المرتبة الأعلى. هذا هو المحرك داخل البحث الدلالي، حيث تكون النية أهم من الصياغة الدقيقة.
على نطاق واسع، تُخزَّن التضمينات في قواعد بيانات متجهية متخصصة تفهرس ملايين المتجهات لإتاحة بحث سريع. ونظرًا لأن مقارنة استعلام بكل متجه مخزَّن مكلفة، تستخدم هذه الأنظمة خوارزميات الجار الأقرب التقريبي (approximate nearest neighbor) مثل HNSW وIVF وproduct quantization للعثور بسرعة على أقرب التطابقات دون حساب كل مسافة على حدة.
يظل التدفق الشامل ثابتًا: تُحوَّل البيانات إلى تضمينات، وتفهرسها قاعدة بيانات متجهية، ويُضمَّن الاستعلام الوارد، ويُعيد بحث الجار الأقرب التقريبي أقرب التطابقات. يشكّل هذا المسار أساس البحث المتجهي وطبقة الاسترجاع التي تغذّي العديد من مساعدي AI.
تُعد التضمينات محورية في كيفية استرجاع أنظمة AI للمحتوى واقتباسه. في retrieval augmented generation، يقوم المساعد بتضمين سؤال المستخدم، ويجد أكثر أجزاء المحتوى تشابهًا من الناحية الدلالية، ويبني إجابته عليها. فإذا كان محتواك مضمَّنًا بالقرب من الأسئلة التي يطرحها الناس، فمن الأرجح بكثير أن يُستَخرج في الإجابة ويُقتَبَس منه.
يعيد هذا صياغة التحسين ليدور حول المعنى بدلاً من الكلمات المفتاحية. لم تعد بحاجة إلى عبارة الاستعلام الدقيقة في الصفحة؛ بل تحتاج إلى محتوى يعبّر عن المفهوم بوضوح وشمولية، بحيث يقع تضمينه بالقرب من تضمينات الأسئلة التي تريد الفوز بها. هذا هو السبب التقني وراء كون العمق الموضوعي والوضوح يدفعان الظهور في بحث AI.
اكتب بوضوح وغطِّ المفاهيم بشكل كامل، باستخدام لغة طبيعية والمصطلحات التي يستخدمها جمهورك فعلياً، بما في ذلك المرادفات والأفكار المرتبطة. ولأن التضمينات تلتقط المعنى، فإن شرح موضوع ما بشكل شامل يساعد محتواك على مطابقة مجموعة واسعة من الصياغات لنفس النية. نظّم الصفحات في أقسام واضحة ومستقلة بذاتها بحيث يُضمَّن كل جزء بشكل جيد بمفرده.
عزّز التغطية الموضوعية عبر موقعك بحيث تعزّز الصفحات المرتبطة بعضها البعض في الفضاء المتجهي، وحافظ على تركيز المحتوى بحيث تعبّر كل صفحة عن فكرة واضحة بدلاً من خليط غير مرتب. اقتران ذلك مع بحث الكلمات المفتاحية وتخطيط المحتوى المنضبط يساعدك على رسم خريطة للمفاهيم والأسئلة التي ينبغي أن تكون تضميناتك قريبة منها.
إلى جانب البحث الدلالي، تشغّل التضمينات أنظمة التوصية التي تقترح منتجات أو محتوى مشابهًا، وأنظمة الإجابة على الأسئلة التي تسترجع مقاطع ذات صلة، وكشف الشذوذ أو الاحتيال الذي يحدد المتجهات البعيدة عن الأنماط الطبيعية. كما أنها العمود الفقري للاسترجاع في العديد من روبوتات الدردشة والمساعدين الذين يحتاجون إلى تأسيس إجاباتهم على قاعدة معرفة.
بالنسبة لجهات التسويق، أكثر حالات الاستخدام صلة هي البحث الدلالي وretrieval augmented generation، لأنهما يحدّدان ما إذا كان محتواك يُعثَر عليه ويُقتَبَس عندما يسأل شخص ما AI سؤالاً. فنفس التضمينات التي تنظّم موجز التوصيات هي التي تقرر أيضًا أي المصادر يثق بها المساعد بما يكفي ليقتبس منها.
لا تكون التضمينات أفضل من النموذج والبيانات التي تقف خلفها. فالنموذج المدرَّب على بيانات متحيّزة أو قديمة قد يرمَّز تلك العيوب، والتضمينات من نماذج مختلفة غير قابلة للمقارنة المباشرة، لذا يجب أن تستخدم الاستعلامات والمستندات نفس النموذج. كما يمكن أن تكون المتجهات ذات الأبعاد العالية جدًا مكلفة حسابيًا من حيث التخزين والبحث على نطاق واسع.
تلتقط التضمينات أيضًا المعنى، لا الحقيقة. يمكن أن تكون عبارتان متقاربتين دلاليًا بينما تكون إحداهما دقيقة والأخرى خاطئة، لذا لا يزال الاسترجاع القائم على التشابه بحاجة إلى محتوى عالي الجودة وتحقق إضافي. القرب في الفضاء المتجهي يخبرك بما هو مرتبط، وليس بما هو صحيح.
تحوّل التضمينات اللغة إلى هندسة، مما يتيح للآلات مقارنة المحتوى حسب المعنى واسترجاع أقرب التطابقات لاستعلام ما. وهي المحرك الصامت وراء البحث الدلالي وقواعد البيانات المتجهية وretrieval augmented generation، وهذا ما يجعلها مهمة جدًا لكي يتم العثور على المحتوى واقتباسه من قبل AI. الدرس العملي هو كتابة محتوى واضح وشامل ومنظّم جيدًا، يقع معناه بالقرب من الأسئلة التي تريد الإجابة عنها.
للمضي قدمًا، اربط هذا بـالبحث الدلالي والبحث المتجهي، واستخدم أدوات بحث الكلمات المفتاحية وتخطيط المحتوى من Sorank لرسم خريطة المفاهيم التي ينبغي أن يطابقها محتواك. المصادر: Meilisearch وKeymakr.
التضمين هو طريقة لتحويل النص أو بيانات أخرى إلى قائمة من الأرقام، تُسمّى متجهًا، تلتقط معناها. يحصل المحتوى ذو المعنى المتشابه على متجهات تقع قريبة من بعضها في فضاء مشترك، بحيث يستطيع الحاسوب معرفة أن 'سيارة' و'مركبة' مرتبطتان حتى لو كانت الكلمتان مختلفتين. هكذا تقارن الآلات المعنى بدلاً من مجرد مطابقة الكلمات نفسها.
يُضمّن البحث الدلالي كلاً من الاستعلام والمستندات المرشحة بنفس النموذج، ثم يقيس التشابه، غالبًا باستخدام تشابه جيب التمام، لترتيب أقرب التطابقات. في retrieval augmented generation، يقوم مساعد AI بتضمين السؤال، ويجد أكثر أجزاء المحتوى تشابهًا، ويبني إجابته عليها. المحتوى المضمّن بالقرب من الأسئلة التي يطرحها الناس أكثر عرضة للاسترجاع والاقتباس.
اكتب بوضوح وغطِّ المفهوم بشكل شامل باستخدام لغة طبيعية ومصطلحات مرتبطة، بحيث يطابق محتواك العديد من صياغات نفس النية. نظّم الصفحات في أقسام واضحة ومستقلة بذاتها بحيث يُضمَّن كل جزء بشكل جيد. ابنِ عمقًا موضوعيًا عبر الصفحات المرتبطة، واجعل كل صفحة مركّزة على فكرة واحدة واضحة، واستخدم تخطيط الكلمات المفتاحية والمحتوى لرسم خريطة الأسئلة التي ينبغي أن تكون تضميناتك قريبة منها.