يؤسس التوليد المعزز بالاسترجاع (RAG) إجابات LLM على بيانات مسترجعة. تعرفوا على البنية المعمارية، التجزئة، التضمينات، وخط أنابيب الاسترجاع.

التوليد المعزز بالاسترجاع (RAG) هو إطار عمل يربط نموذج لغة كبيرًا (LLM) بقاعدة معرفة خارجية بحيث تكون إجاباته مؤسسة على معلومات مسترجعة ومحدّثة بدلاً من بيانات التدريب وحدها. وبدلاً من مطالبة النموذج باستدعاء الحقائق من أوزانه، يبحث نظام RAG أولاً في مخزن المستندات، ويجد المقاطع الأكثر صلة بالسؤال، ويُدخلها في الموجه كسياق. بعد ذلك يصوغ النموذج إجابة من تلك الأدلة، غالبًا مع استشهادات يمكن للإنسان التحقق منها.
هذا المقال هو غوص عميق في كيفية بناء RAG فعليًا. للحصول على نظرة عامة أقصر وبلغة مبسطة عن المفهوم، راجعوا مدخل RAG المرافق. هنا يكون التركيز على البنية المعمارية: خط أنابيب الفهرسة، والتجزئة، والتضمينات، ومخزن المتجهات، والاسترجاع وإعادة الترتيب، وما تعنيه كل خيار تصميمي بالنسبة للدقة والظهور في بحث AI.
RAG هو تصميم نظام تسبق فيه خطوةُ التوليد في LLM خطوةُ استرجاع تجلب مستندات ذات صلة من قاعدة معرفة خارجية وتُدخلها في الموجه. وفقًا لـ Weka، قدّم باحثون في Meta نظام RAG في ورقة بحثية عام 2020 لمعالجة قيود النماذج التي تعتمد فقط على بيانات تدريب ثابتة، من خلال الجمع بين دقة الاسترجاع وسلاسة التوليد. والنتيجة هي نظام هجين يُعمل التفكير على أدلة استرجعها للتو.
الدافع بسيط. المعرفة البارامترية للنموذج مجمّدة عند وقت التدريب ولا يمكنها تغطية بيانات المؤسسة الخاصة أو أخبار الأمس. يسد RAG هذه الفجوة دون إعادة تدريب. تفيد Databricks بأن أكثر من 60 بالمئة من المؤسسات تبني أدوات RAG تحديدًا لأنها تحتاج إلى إجابات موثوقة مؤسسة على معلومات خاصة أو حالية بدلاً من تخمينات ملفّقة.
على مستوى عام، يعمل نظام RAG على مرحلتين. أولاً، الاسترجاع: يُرمّز سؤال المستخدم، ويبحث النظام في قاعدة معرفة خارجية عن محتوى مشابه دلاليًا، ويُعيد المقاطع الأكثر صلة. ثانيًا، التوليد: تُدمج هذه المقاطع مع الاستعلام الأصلي وتُرسل إلى نموذج اللغة، الذي يركّب إجابة مؤسسة. هذا النمط هو ما يميز RAG عن نموذج عادي يكتفي بالتنبؤ من الذاكرة.
في بيئة الإنتاج، ينقسم هذا إلى مسارين متمايزين. يستوعب خط أنابيب فهرسة غير متصل المستندات في قاعدة بيانات متجهية مسبقًا، بينما يقوم خط أنابيب استعلام متصل بالاسترجاع وتركيب السياق لحظة وصول السؤال. إبقاء العمل الثقيل خارج الاتصال هو ما يتيح حدوث الاسترجاع خلال أجزاء من الثانية عندما يطرح المستخدم سؤالاً فعليًا.
يُجهّز خط الأنابيب غير المتصل معرفتكم للبحث السريع. ووفقًا لـ BigData Boutique، يتكون من ثلاث مراحل. تُجزّأ المستندات إلى مقاطع، عادة بين 256 و 1024 رمزًا. يُحوّل كل مقطع إلى متجه كثيف باستخدام نموذج تضمين، مثل نموذج تضمين حديث من OpenAI أو Cohere. بعد ذلك تُخزّن المتجهات في قاعدة بيانات مثل Pinecone أو Weaviate أو Qdrant أو OpenSearch أو Elasticsearch، إلى جانب بيانات وصفية مثل صفحة المصدر.
القيام بهذا مرة واحدة، مسبقًا، هو مصدر الكفاءة الأساسي. فبدلاً من مسح مستندات كاملة وقت الاستعلام، يكون النظام قد قسّم كل شيء بالفعل إلى قطع صغيرة ومفهرسة، بحيث عندما يطرح المستخدم سؤالاً يبحث النظام فقط في الأجزاء الأكثر صلة خلال أجزاء من الثانية. تحدد جودة خط الأنابيب هذا إلى حد كبير جودة كل إجابة تليه.
التجزئة هي الرافعة الأكثر تقديرًا بأقل من قيمتها في خط أنابيب RAG الإنتاجي. فإذا قطعت حدود المقاطع المعنى، سيواجه حتى أفضل نموذج تضمين صعوبة في استرجاع السياق الصحيح. النهج الأكثر شيوعًا هو التجزئة المسبقة، التي تقسّم المستندات إلى قطع ثابتة قبل التضمين، وتتطلب قرارات مسبقة بشأن حجم المقطع والتداخل بينها، لكنها تتيح استرجاعًا سريعًا لأن كل شيء محسوب مسبقًا.
المقاطع ذات الحجم الثابت ليست سوى نقطة انطلاق. تشير BigData Boutique إلى أن التجزئة الدلالية، واستراتيجيات الأصل والفرع، والنوافذ المنزلقة مع التداخل تحل بشكل متزايد محل التقسيمات الثابتة الساذجة للحفاظ على سياق المستند وتقليل أخطاء الاسترجاع. تعتمد الاستراتيجية الصحيحة على المحتوى الخاص بكم: المستندات التقنية الطويلة، ومقالات الدعم القصيرة، والبيانات الجدولية تستفيد كل منها من حدود مختلفة. تجزئة المحتوى الجيدة هي حيث تُكسب أو تُفقد جودة الاسترجاع.
التضمينات هي الجسر بين اللغة والبحث. يُحوّل نموذج التضمين النص إلى تمثيل رقمي عالي الأبعاد يلتقط المعنى الدلالي، بحيث تقع المقاطع التي تتناول نفس الفكرة قريبة من بعضها في الفضاء المتجهي حتى عند استخدام كلمات مختلفة. تشير Weka إلى أن هذه المتجهات غالبًا ما تُنتج بواسطة نماذج قائمة على المحولات (transformer) مثل BERT أو SBERT، وهي نفس عائلة التقنيات وراء البحث الدلالي.
تعيش هذه التضمينات في قاعدة بيانات متجهية مبنية لعمليات بحث التشابه على نطاق واسع. تفهرس أنظمة مثل FAISS وPinecone وElasticsearch ملايين المتجهات وتُعيد أقرب التطابقات بسرعة باستخدام البحث التقريبي عن أقرب الجيران. هذه هي البنية التحتية التي تشغّل البحث المتجهي، وهي ما يتيح لـ RAG إيجاد سياق ذي صلة دون الاعتماد على تطابقات الكلمات المفتاحية الدقيقة.
وقت الاستعلام، يعكس التدفق عملية الإدخال. يُطبّع نص المستخدم ويُضمّن باستخدام نفس النموذج المستخدم في الفهرسة، ثم يُعيد البحث التقريبي عن أقرب الجيران أفضل k مقطع (top-k) الأكثر تشابهًا، غالبًا بين خمسة وعشرة. تضيف الأنظمة المتقدمة خطوة إعادة ترتيب، حيث تُقيّم هذه المرشحات باستخدام cross-encoder لدفع المقاطع ذات الصلة الحقيقية إلى الأعلى قبل وصول أي شيء إلى النموذج.
تتراكم التحسينات. تفيد BigData Boutique بأن البحث الهجين الذي يجمع بين BM25 القائم على الكلمات المفتاحية والمتجهات الكثيفة يحقق تحسنًا بنسبة 15 إلى 30 بالمئة في معدل الاسترجاع، ما يرفعه من نحو 0.72 إلى 0.91، بينما تضيف إعادة الترتيب بواسطة cross-encoder دقة إضافية بنسبة 5 إلى 15 بالمئة. تُدرج بعد ذلك المقاطع المختارة في الموجه، ويولّد النموذج استجابة مؤسسة، ويُفضّل أن يذكر المصادر التي استخدمها.
غالبًا ما يُقارَن RAG بالضبط الدقيق، لكنهما يحلّان مشكلتين مختلفتين. يغيّر الضبط الدقيق أوزان النموذج لتعليمه أسلوبًا أو تنسيقًا أو مهارات ضيقة، وهو مكلف التكرار كلما تغيّرت الحقائق. يترك RAG النموذج دون تغيير ويستبدل المعرفة وقت الاستعلام، وهو ما تصفه Weka بأنه أكثر مرونة وأكثر كفاءة من حيث التكلفة وأنسب للمجالات المتطورة مثل الأخبار والعلوم والتكنولوجيا.
نوافذ السياق الطويل هي بديل آخر، إذ يمكن لبعض النماذج الآن قراءة مستندات كبيرة جدًا مباشرة. لكن حشو كل شيء في الموجه مكلف ويُضعف التركيز، بينما يسترجع RAG فقط ما هو ذو صلة. عمليًا، تمزج أنظمة كثيرة بين النهجين، بل إن التصاميم الحديثة تتعامل مع الاسترجاع كأداة يمكن لعامل (agent) استدعاؤها، وهو تطور يربط RAG بـالبحث الوكيلي.
RAG هو البنية المعمارية وراء معظم محركات الإجابة القائمة على AI، ما يجعله محوريًا لتحسين محركات التوليد. عندما يجيب مساعد على سؤال، فإنه عادة يسترجع مقاطع من مكان ما ويؤسس إجابته عليها. المحتوى الذي يُسترجَع ويُستشهد به هو المحتوى الذي يراه جمهوركم فعليًا، لذا أصبحت القابلية للاسترجاع هي الترتيب الجديد.
هذا يعيد تشكيل تصميم المحتوى حول المقطع. لتكونوا المقطع الذي يسحبه نظام RAG، تحتاج صفحاتكم إلى عبارات واضحة وقائمة بذاتها، وحقائق دقيقة، وبنية تصمد أمام التجزئة والتضمين. يفضّل التأصيل عبر AI القوي المصادر السهلة الاستخراج والتحقق، لذا فإن الجمع بين محتوى نظيف وذري وبحث الكلمات المفتاحية وتخطيط المحتوى المنضبط يحسّن مباشرة فرصكم في أن تكونوا المصدر المُستشهد به.
الفائدة الرئيسية لـ RAG هي التأصيل. من خلال ربط الإجابات بمحتوى محدّث تم استرجاعه، يقلّل من احتمال هلوسة AI، وهو أمر مهم بشكل خاص في المجالات عالية الدقة مثل الرعاية الصحية والقانون والدعم المؤسسي. ولأن المخرجات يمكن أن تتضمّن استشهادات، يمكن للبشر التحقق من الادعاءات بدلاً من الثقة العمياء بالنموذج.
تنبع حالات الاستخدام بشكل طبيعي. تشير Databricks إلى روبوتات دردشة لدعم العملاء تجيب بمعرفة خاصة بالشركة، ومحركات داخلية لأسئلة الموارد البشرية والامتثال، وتعزيز البحث الذي يقرن إجابات AI بالنتائج. في كل حالة، يتيح RAG للمؤسسة تشغيل بياناتها الخاصة والحالية دون تكلفة وتأخير إعادة تدريب نموذج.
RAG قوي لكنه ليس مجانيًا. يضيف الاسترجاع زمن استجابة، لذا يجب ضبط خط الأنابيب لتجنب إبطاء الإجابات، وتعتمد جودة الإجابة بشكل كبير على حداثة قاعدة المعرفة واكتمالها. المدخلات الرديئة تعني مخرجات رديئة: إذا أظهر الاسترجاع مقاطع ضعيفة أو غير ذات صلة، لا يزال بإمكان النموذج إنتاج إجابة واثقة لكنها خاطئة.
توجد أيضًا أنماط فشل أكثر دقة. يمكن للاستعلامات الغامضة أن تسترجع سياقًا خاطئًا، وتتطلب البيانات الحساسة تشفيرًا وضوابط وصول، وحدود المقاطع التي تقسّم المعنى تضعف النتائج بصمت. يخفف RAG الهلوسة بدلاً من القضاء عليها تمامًا، لذا تبقى جودة الاسترجاع والتقييم والإشراف البشري أجزاءًا أساسية من أي نشر جاد.
يؤسس التوليد المعزز بالاسترجاع مخرجات نموذج اللغة على أدلة مسترجعة من خلال الجمع بين خط أنابيب فهرسة غير متصل وتدفق استرجاع وتوليد متصل. تعتمد جودته على هندسة عملية: تجزئة معقولة، وتضمينات قوية، ومخزن متجهات سريع، واسترجاع وإعادة ترتيب ذكيين. عند تنفيذه بشكل جيد، ينتج إجابات دقيقة وحديثة وقابلة للاستشهاد لا يستطيع نموذج عادي تحقيقها.
لنظرة عامة أخف، اقرأوا مدخل RAG المرافق، واربطوه بـالتضمينات والبحث المتجهي لإكمال الصورة. استخدموا أدوات البحث وتخطيط المحتوى من Sorank لكتابة المحتوى القابل للاستخراج الذي تسترجعه هذه الأنظمة. المصادر المرجعية: BigData Boutique، وDatabricks، وWEKA.
يُدمج الضبط الدقيق معرفة جديدة في أوزان النموذج من خلال تدريب إضافي، وهو أمر مكلف ويصبح قديمًا مع تغيّر الحقائق. أما RAG فيترك النموذج كما هو ويزوّده بمستندات حديثة تم استرجاعها وقت الاستعلام، بحيث يمكن تحديث قاعدة المعرفة دون إعادة التدريب. الضبط الدقيق هو الأفضل لتعليم الأسلوب أو التنسيق، بينما RAG هو الأفضل للمعرفة الحالية والواقعية والخاصة.
لا، بل يقلّلها. من خلال تأسيس الإجابات على نص المصدر المسترجَع وتمكين الاستشهادات، يمنح RAG النموذج أدلة حقيقية بدلاً من إجباره على الاعتماد على الذاكرة. لكن النموذج لا يزال بإمكانه إساءة قراءة مقطع، أو مزج المصادر بشكل غير صحيح، أو الهلوسة عندما يُعيد الاسترجاع مقاطع ضعيفة أو غير ذات صلة. تبقى جودة الاسترجاع والتجزئة والتحقق البشري كلها مهمة.
RAG هو البنية المعمارية وراء معظم محركات الإجابة القائمة على AI، لذا فإن المحتوى الذي تسترجعه وتستشهد به هو المحتوى الذي يراه جمهوركم. لتكونوا المقطع الذي يسحبه نظام RAG، تحتاج صفحاتكم إلى مقاطع واضحة وقائمة بذاتها، وحقائق دقيقة، وبنية نظيفة تصمد أمام التجزئة والتضمين. كتابة محتوى قابل للاستخراج ومنظم جيدًا تحسّن مباشرة فرصكم في أن تُسترجعوا ويُستشهد بكم.