يقيس تقييم الاسترجاع مدى نجاح نظام RAG في العثور على السياق الصحيح واستخدامه. تعرفوا على المقاييس، وثالوث RAG، وأفضل الممارسات.

تقييم الاسترجاع هو الانضباط المعني بقياس ما إذا كان نظام الاسترجاع يُظهر المعلومات الصحيحة، وما إذا كانت الإجابة المُولَّدة تستخدمها فعليا بشكل جيد. في خط معالجة retrieval augmented generation، تعتمد الإجابة الجيدة على أمرين يجب أن يسيرا بشكل صحيح: عثور جهاز الاسترجاع على سياق ذي صلة، والتزام النموذج بذلك السياق. يضع تقييم الاسترجاع أرقاما لكلا الجانبين حتى تتمكن الفرق من تشخيص الأعطال وتحسين الجودة بدلا من التخمين.
هذا الأمر مهم لأن نظام RAG يمكن أن يفشل بصمت. قد تبدو الإجابة سلسة لكنها تستند إلى مقاطع غير صحيحة، أو قد يُفوّت جهاز الاسترجاع مصادر أساسية كان النموذج بحاجة إليها. بالنسبة لكل من يبني أنظمة RAG، أو يحاول أن يكون المصدر الذي تستشهد به، فإن فهم كيفية تقييم هذه الأنظمة يكشف بالضبط كيف يبدو المحتوى الجيد القابل للاسترجاع.
يقيّم تقييم الاسترجاع نصفي خط معالجة RAG كلا على حدة ومعا. يتساءل نصف الاسترجاع عما إذا كان النظام قد وجد معلومات ذات صلة دلاليا. ويتساءل نصف التوليد عما إذا كانت الاستجابة ذات معنى، ومؤسَّسة (grounded)، ومتعلقة بالموضوع. تقييمهما بشكل منفصل هو ما يتيح التمييز بين مشكلة في الاسترجاع ومشكلة في التوليد، وهي الخطوة الأولى لإصلاح أي منهما.
إنه فرع متخصص من تقييم LLM. بينما قد يحكم التقييم العام للنموذج على السلاسة أو الاستدلال، يركز تقييم الاسترجاع على الأدلة: هل تم استرجاع السياق الصحيح، وهل احترمه النموذج. ولأن جودة إجابات RAG لا تتجاوز جودة المقاطع التي تقف خلفها، فإن هذه النظرة المتمحورة حول الأدلة ضرورية لبناء أنظمة يمكن للناس الوثوق بها.
هناك أربعة مقاييس تشكل ركيزة جانب الاسترجاع. Recall at k هو نسبة جميع المستندات ذات الصلة الموجودة ضمن أفضل k نتيجة، حيث تقترح langcopilot هدفا لا يقل عن 80 بالمئة في الاستعلامات الحرجة. Precision at k هو الجزء من أفضل k نتيجة الذي يكون ذا صلة فعلا، حيث تعني دقة أعلى ضوضاء أقل بالنسبة للنموذج. يشكل هذان المقياسان ركيزة قياس تغطية الاسترجاع والجودة.
يهم موضع الترتيب أيضا. يحسب Mean Reciprocal Rank، أو MRR، متوسط الرتبة العكسية لأول نتيجة ذات صلة، ليسجل 1.0 عندما تكون في المرتبة الأولى، و0.5 عندما تكون الثانية، وقريبا من الصفر عندما تكون مدفونة، مع أهداف تفوق 0.7 في مهام الإجابة عن الأسئلة. يتعامل Normalized Discounted Cumulative Gain، أو NDCG، مع الصلة المتدرجة ويخصم من النتائج حسب الرتبة بحيث يُحتسب العنصر ذو الصلة في المرتبة الأولى أكثر من نظيره في المرتبة العاشرة، مع ذكر langcopilot لأهداف تفوق 0.85 في المجالات المحددة جيدا. يُعد NDCG الخيار الطبيعي عند تقييم ترتيب المقاطع ذات الإجابات المتعددة ذات الصلة.
يذهب الاسترجاع الجيد سدى إذا أساء النموذج استخدامه، لذا فإن جانب التوليد له مقاييسه الخاصة. يقيس Faithfulness مدى التزام الإجابة بالأدلة المسترجعة دون إدخال ادعاءات غير مدعومة، ويُحسب غالبا كنسبة العبارات المدعومة بالسياق. في المجالات عالية الحساسية مثل الرعاية الصحية والقانون، يقترب الهدف من 100 بالمئة، لأن الادعاء غير المدعوم هو هلوسة AI محتملة.
تتساءل صلة الإجابة عما إذا كانت الاستجابة تعالج السؤال فعلا وتبقى ضمن الموضوع، وغالبا ما تُقاس من خلال تشابه embeddings بين الإجابة والاستعلام أو عبر نموذج لغوي يعمل كحَكَم. تُكمل تغطية الاستشهادات، أي ما إذا كانت الادعاءات مدعومة بمصادر، هذه الصورة. معا، تضمن هذه المقاييس ألا يكتفي النظام بالاسترجاع الجيد، بل ينتج أيضا إجابات مؤسَّسة ومفيدة مع استشهاد بالمصادر سليم.
طريقة عملية للبدء هي ثالوث RAG، الذي تصفه Qdrant بأنه فعالية الاسترجاع، وصلة الاستجابة، والاتساق، وتعبر عنه أدلة أخرى بصلة السياق وFaithfulness وصلة الإجابة. الفكرة هي أن هذه الفحوصات الثلاثة ترصد أنماط الفشل الأكثر شيوعا: الاسترجاع السيئ، والتوليد المشوب بالهلوسة، والإجابات الخارجة عن الموضوع.
قراءة هذه المقاييس معا هي عملية تشخيصية. فإذا كانت صلة السياق منخفضة، تكون المشكلة في جهاز الاسترجاع. وإذا كان السياق جيدا لكن Faithfulness منخفضا، يكون النموذج قد ابتعد عن أدلته. وإذا كان كلاهما جيدا لكن صلة الإجابة منخفضة، يكون النظام مؤسَّسا لكنه يفتقد النية الفعلية للمستخدم. هذا الفصل هو ما يجعل الثالوث عدسة أولى مفيدة قبل إضافة مقاييس أكثر تفصيلا.
هناك مقاربتان واسعتان. يبني تقييم Ground-Truth أزواج أسئلة وأجوبة من المستندات المصدرية، ثم يقارن الاستجابات المُولَّدة بالإجابات المتوقعة باستخدام درجات التشابه والصحة على مقياس من صفر إلى واحد. هذه المقاربة دقيقة لكنها تتطلب جهدا كبيرا، إذ يتعين على شخص ما وسم ما يُعد ذا صلة وصحيحا.
البديل هو استخدام نموذج لغوي كحَكَم. تُقيّم أطر العمل Faithfulness والصلة وجودة السياق تلقائيا، وهو ما يتوسع بشكل أفضل بكثير من المراجعة اليدوية. تصف Qdrant منهجيات LLM-as-a-judge لتقييم جودة الاستجابة، وفي الممارسة العملية، غالبا ما تجمع الفرق بين الأسلوبين: مجموعة أساسية موسومة لتوفير معايير موثوقة، إلى جانب تقييم آلي لتغطية واسعة ومتكررة.
RAGAS هو إطار عمل مفتوح المصدر شائع بُني خصيصا لتقييم RAG. يوفر مقاييس لا تتطلب مرجعا (reference-free) تشمل Context Precision وContext Recall وFaithfulness وAnswer Relevancy، تُحسب باستخدام نماذج لغوية تعمل كحكام، بحيث لا تحتاجون غالبا إلى Ground Truth موسوم. يعمل مباشرة دون إعداد إضافي، بل يمكنه توليد استعلامات اختبار اصطناعية من مستنداتكم، مما يخفض عتبة التقييم المنهجي.
تكمن طريقته في تفكيك الإجابة إلى عبارات أولية والتحقق من كل واحدة مقابل السياق المسترجع، وهذه هي الطريقة التي يقيّم بها Faithfulness بهذه الدقة. وفقا لـ langcopilot، أظهرت مقاييس RAGAS ارتباطا جيدا مع الحكم البشري، متفوقة على التقييم البسيط zero-shot الصادر عن نموذج عام. هذه الموثوقية هي السبب في أنه أصبح نقطة انطلاق افتراضية للعديد من الفرق التي تُضفي طابعا رسميا على عملية تقييمها.
تصف المقاييس التي تُقيّم أنظمة RAG أيضا كيفية اكتشاف محتواكم واستخدامه من قبل محركات الإجابة المعتمدة على AI. يكافئ Faithfulness المصادر التي يمكن لمحرك ما أن يؤسس عليها ادعاءاته بثقة، بينما تكافئ مقاييس الترتيب مثل MRR وNDCG المحتوى الذي يظهر مبكرا وبوضوح. فهم ما تُحسِّنه هذه الأنظمة يكشف لكم كيف يبدو من الداخل المحتوى القابل للاستخلاص والموثوق.
هذا يجعل من تقييم الاسترجاع مخططا صامتا لـ generative engine optimization. إذا أردتم أن تكونوا المقطع المُستشهَد به، اكتبوا محتوى يحصل على درجة جيدة في الفحوصات الضمنية للمحرك: دقيق، ومكتفٍ ذاتيا (self-contained)، وسهل النسب إليه. الجمع بين هذا التفكير وبحث الكلمات المفتاحية وتخطيط المحتوى المنضبط يساعدكم على استهداف الاستعلامات التي تفوز فيها الأدلة القوية بالاستشهادات.
التقييم لا يتجاوز جودة بياناته. وسوم Ground-Truth مكلفة وذاتية، ويمكن لمجموعة اختبار ضعيفة أو منحازة أن تنتج درجات مُرضية تخفي مشكلات حقيقية. تقلل نماذج اللغة العاملة كحكام من هذه التكلفة لكنها تُدخل تحيزاتها الخاصة، لذا يجب فحص أحكامها دوريا مقابل مراجعة بشرية.
لا يروي رقم واحد القصة كاملة أيضا. يمكن لنظام أن يسجل Recall مرتفعا لكن Faithfulness منخفض، أو Faithfulness قويا على إجابة غير ذات صلة، وهذا هو السبب في استخدام هذه المقاييس كلوحة مقاييس مجتمعة وليس كنتيجة وحيدة. يواجه المجال الأوسع لـمعايير AI نفس هذا الحذر: توجه المقاييس التحسين لكن يجب تفسيرها معا والحفاظ على مصداقيتها عبر إشراف بشري.
يقيس تقييم الاسترجاع في آن واحد ما إذا كان نظام RAG يجد السياق الصحيح وما إذا كان يستخدم ذلك السياق بأمانة، من خلال الجمع بين مقاييس الاسترجاع مثل Recall وPrecision وMRR وNDCG ومقاييس التوليد مثل Faithfulness وصلة الإجابة. يقدم ثالوث RAG تشخيصا أوليا سريعا، بينما تجعل أطر عمل مثل RAGAS التقييم المنهجي في متناول الجميع.
للتعمق أكثر، اربطوا هذا الموضوع بـتغطية الاسترجاع وبمعمارية retrieval augmented generation الأوسع، واستخدموا أدوات البحث وتخطيط المحتوى الخاصة بـSorank لبناء محتوى تسترجعه هذه الأنظمة وتثق به. مصادر مرجعية: Qdrant، وLangCopilot، وRedis.
في جانب الاسترجاع، المقاييس الأساسية هي Recall at k (هل تم العثور على المستندات ذات الصلة)، وPrecision at k (هل النتائج المسترجعة ذات صلة)، وMRR (هل تحتل أول نتيجة ذات صلة ترتيبا مبكرا)، وNDCG (الصلة المتدرجة موزونة حسب الموضع). أما في جانب التوليد، فإن Faithfulness وصلة الإجابة هما الأكثر أهمية. تبدأ فرق كثيرة بثالوث RAG: صلة السياق وFaithfulness وصلة الإجابة.
RAGAS هو إطار عمل مفتوح المصدر بُني خصيصا لتقييم أنظمة RAG. يوفر مقاييس لا تتطلب مرجعا مثل Context Precision وContext Recall وFaithfulness وAnswer Relevancy، تُحسب باستخدام نماذج لغوية تعمل كحكام، بحيث لا تحتاجون غالبا إلى Ground Truth موسوم. يعمل مباشرة دون إعداد إضافي ويمكنه توليد أسئلة اختبار اصطناعية من مستنداتكم، وقد أظهرت درجاته ارتباطا جيدا مع الحكم البشري.
تسترجع محركات الإجابة المعتمدة على AI المحتوى وتركّبه، وتصف المقاييس ذاتها التي تُقيّم خطوط معالجتها كيفية العثور على محتواكم واستخدامه. يكافئ Faithfulness المحتوى الذي يمكن لمحرك أن يؤسس عليه ادعاءاته، وتكافئ مقاييس الترتيب المحتوى الذي يظهر مبكرا وبوضوح. فهم التقييم يساعدكم على كتابة صفحات قابلة للاستخلاص، دقيقة، وجيدة البنية، تزداد احتمالية استرجاعها والاستشهاد بها.