التفضيلات

خصوصيتك مهمة بالنسبة لنا، لذلك لديك خيار تعطيل أنواع معينة من التخزين التي قد لا تكون ضرورية للوظائف الأساسية للموقع. قد يؤثر حظر الفئات على تجربتك في الموقع. مزيد من المعلومات

قبول جميع ملفات تعريف الارتباط

تقييم الاسترجاع: كيفية قياس جودة RAG وإجابات AI الموثوقة في 2026

يقيس تقييم الاسترجاع مدى نجاح نظام RAG في العثور على السياق الصحيح واستخدامه. تعرفوا على المقاييس، وثالوث RAG، وأفضل الممارسات.

Man with dark hair and beard wearing a light brown shirt speaks in front of a microphone on a podcast or recording setup.Portrait of a man with short dark hair wearing a white shirt and dark jacket, looking directly at the camera with a neutral expression.Man with short dark hair, beard, and clear glasses wearing a black t-shirt with a white circular logo, standing in front of a stone wall.Celio fabianoSmiling young woman with long brown hair wearing a red top and necklace, outdoors in a tree-filled background.photo de profil du client Xavier Breull
+ 9,000 مشترك
لوحة تحكم للتقييم تعرض مقاييس الاسترجاع مثل Recall وPrecisionوMRR ودرجات Faithfulness لنظام RAG.
عنصر واجهة المستخدم للرفع
تيبو بيسون-ماجدلين مؤسس سورانك

عن المؤلف

تيبو بيسون-ماجدلين

مؤسس سورانك، أكثر من 5 سنوات خبرة في تحسين محركات البحث (SEO)، ومتحمس للجغرافيا.
لخص باستخدام
شارك على

ملخص: تقييم الاسترجاع هو ممارسة قياس مدى نجاح نظام الاسترجاع في العثور على المستندات الصحيحة، ومدى التزام النموذج بها بأمانة، باستخدام مقاييس مثل Recall at k وPrecision at k وMRR وNDCG وFaithfulness للحكم على جودة خط معالجة RAG.

تقييم الاسترجاع هو الانضباط المعني بقياس ما إذا كان نظام الاسترجاع يُظهر المعلومات الصحيحة، وما إذا كانت الإجابة المُولَّدة تستخدمها فعليا بشكل جيد. في خط معالجة retrieval augmented generation، تعتمد الإجابة الجيدة على أمرين يجب أن يسيرا بشكل صحيح: عثور جهاز الاسترجاع على سياق ذي صلة، والتزام النموذج بذلك السياق. يضع تقييم الاسترجاع أرقاما لكلا الجانبين حتى تتمكن الفرق من تشخيص الأعطال وتحسين الجودة بدلا من التخمين.

هذا الأمر مهم لأن نظام RAG يمكن أن يفشل بصمت. قد تبدو الإجابة سلسة لكنها تستند إلى مقاطع غير صحيحة، أو قد يُفوّت جهاز الاسترجاع مصادر أساسية كان النموذج بحاجة إليها. بالنسبة لكل من يبني أنظمة RAG، أو يحاول أن يكون المصدر الذي تستشهد به، فإن فهم كيفية تقييم هذه الأنظمة يكشف بالضبط كيف يبدو المحتوى الجيد القابل للاسترجاع.

ما هو تقييم الاسترجاع؟

يقيّم تقييم الاسترجاع نصفي خط معالجة RAG كلا على حدة ومعا. يتساءل نصف الاسترجاع عما إذا كان النظام قد وجد معلومات ذات صلة دلاليا. ويتساءل نصف التوليد عما إذا كانت الاستجابة ذات معنى، ومؤسَّسة (grounded)، ومتعلقة بالموضوع. تقييمهما بشكل منفصل هو ما يتيح التمييز بين مشكلة في الاسترجاع ومشكلة في التوليد، وهي الخطوة الأولى لإصلاح أي منهما.

إنه فرع متخصص من تقييم LLM. بينما قد يحكم التقييم العام للنموذج على السلاسة أو الاستدلال، يركز تقييم الاسترجاع على الأدلة: هل تم استرجاع السياق الصحيح، وهل احترمه النموذج. ولأن جودة إجابات RAG لا تتجاوز جودة المقاطع التي تقف خلفها، فإن هذه النظرة المتمحورة حول الأدلة ضرورية لبناء أنظمة يمكن للناس الوثوق بها.

مقاييس الاسترجاع: Recall وPrecision وMRR وNDCG

هناك أربعة مقاييس تشكل ركيزة جانب الاسترجاع. Recall at k هو نسبة جميع المستندات ذات الصلة الموجودة ضمن أفضل k نتيجة، حيث تقترح langcopilot هدفا لا يقل عن 80 بالمئة في الاستعلامات الحرجة. Precision at k هو الجزء من أفضل k نتيجة الذي يكون ذا صلة فعلا، حيث تعني دقة أعلى ضوضاء أقل بالنسبة للنموذج. يشكل هذان المقياسان ركيزة قياس تغطية الاسترجاع والجودة.

يهم موضع الترتيب أيضا. يحسب Mean Reciprocal Rank، أو MRR، متوسط الرتبة العكسية لأول نتيجة ذات صلة، ليسجل 1.0 عندما تكون في المرتبة الأولى، و0.5 عندما تكون الثانية، وقريبا من الصفر عندما تكون مدفونة، مع أهداف تفوق 0.7 في مهام الإجابة عن الأسئلة. يتعامل Normalized Discounted Cumulative Gain، أو NDCG، مع الصلة المتدرجة ويخصم من النتائج حسب الرتبة بحيث يُحتسب العنصر ذو الصلة في المرتبة الأولى أكثر من نظيره في المرتبة العاشرة، مع ذكر langcopilot لأهداف تفوق 0.85 في المجالات المحددة جيدا. يُعد NDCG الخيار الطبيعي عند تقييم ترتيب المقاطع ذات الإجابات المتعددة ذات الصلة.

مقاييس التوليد: Faithfulness وصلة الإجابة

يذهب الاسترجاع الجيد سدى إذا أساء النموذج استخدامه، لذا فإن جانب التوليد له مقاييسه الخاصة. يقيس Faithfulness مدى التزام الإجابة بالأدلة المسترجعة دون إدخال ادعاءات غير مدعومة، ويُحسب غالبا كنسبة العبارات المدعومة بالسياق. في المجالات عالية الحساسية مثل الرعاية الصحية والقانون، يقترب الهدف من 100 بالمئة، لأن الادعاء غير المدعوم هو هلوسة AI محتملة.

تتساءل صلة الإجابة عما إذا كانت الاستجابة تعالج السؤال فعلا وتبقى ضمن الموضوع، وغالبا ما تُقاس من خلال تشابه embeddings بين الإجابة والاستعلام أو عبر نموذج لغوي يعمل كحَكَم. تُكمل تغطية الاستشهادات، أي ما إذا كانت الادعاءات مدعومة بمصادر، هذه الصورة. معا، تضمن هذه المقاييس ألا يكتفي النظام بالاسترجاع الجيد، بل ينتج أيضا إجابات مؤسَّسة ومفيدة مع استشهاد بالمصادر سليم.

ثالوث RAG

طريقة عملية للبدء هي ثالوث RAG، الذي تصفه Qdrant بأنه فعالية الاسترجاع، وصلة الاستجابة، والاتساق، وتعبر عنه أدلة أخرى بصلة السياق وFaithfulness وصلة الإجابة. الفكرة هي أن هذه الفحوصات الثلاثة ترصد أنماط الفشل الأكثر شيوعا: الاسترجاع السيئ، والتوليد المشوب بالهلوسة، والإجابات الخارجة عن الموضوع.

قراءة هذه المقاييس معا هي عملية تشخيصية. فإذا كانت صلة السياق منخفضة، تكون المشكلة في جهاز الاسترجاع. وإذا كان السياق جيدا لكن Faithfulness منخفضا، يكون النموذج قد ابتعد عن أدلته. وإذا كان كلاهما جيدا لكن صلة الإجابة منخفضة، يكون النظام مؤسَّسا لكنه يفتقد النية الفعلية للمستخدم. هذا الفصل هو ما يجعل الثالوث عدسة أولى مفيدة قبل إضافة مقاييس أكثر تفصيلا.

كيف يتم تقييم الاسترجاع

هناك مقاربتان واسعتان. يبني تقييم Ground-Truth أزواج أسئلة وأجوبة من المستندات المصدرية، ثم يقارن الاستجابات المُولَّدة بالإجابات المتوقعة باستخدام درجات التشابه والصحة على مقياس من صفر إلى واحد. هذه المقاربة دقيقة لكنها تتطلب جهدا كبيرا، إذ يتعين على شخص ما وسم ما يُعد ذا صلة وصحيحا.

البديل هو استخدام نموذج لغوي كحَكَم. تُقيّم أطر العمل Faithfulness والصلة وجودة السياق تلقائيا، وهو ما يتوسع بشكل أفضل بكثير من المراجعة اليدوية. تصف Qdrant منهجيات LLM-as-a-judge لتقييم جودة الاستجابة، وفي الممارسة العملية، غالبا ما تجمع الفرق بين الأسلوبين: مجموعة أساسية موسومة لتوفير معايير موثوقة، إلى جانب تقييم آلي لتغطية واسعة ومتكررة.

إطار عمل RAGAS

RAGAS هو إطار عمل مفتوح المصدر شائع بُني خصيصا لتقييم RAG. يوفر مقاييس لا تتطلب مرجعا (reference-free) تشمل Context Precision وContext Recall وFaithfulness وAnswer Relevancy، تُحسب باستخدام نماذج لغوية تعمل كحكام، بحيث لا تحتاجون غالبا إلى Ground Truth موسوم. يعمل مباشرة دون إعداد إضافي، بل يمكنه توليد استعلامات اختبار اصطناعية من مستنداتكم، مما يخفض عتبة التقييم المنهجي.

تكمن طريقته في تفكيك الإجابة إلى عبارات أولية والتحقق من كل واحدة مقابل السياق المسترجع، وهذه هي الطريقة التي يقيّم بها Faithfulness بهذه الدقة. وفقا لـ langcopilot، أظهرت مقاييس RAGAS ارتباطا جيدا مع الحكم البشري، متفوقة على التقييم البسيط zero-shot الصادر عن نموذج عام. هذه الموثوقية هي السبب في أنه أصبح نقطة انطلاق افتراضية للعديد من الفرق التي تُضفي طابعا رسميا على عملية تقييمها.

لماذا يهم تقييم الاسترجاع في SEO وGEO

تصف المقاييس التي تُقيّم أنظمة RAG أيضا كيفية اكتشاف محتواكم واستخدامه من قبل محركات الإجابة المعتمدة على AI. يكافئ Faithfulness المصادر التي يمكن لمحرك ما أن يؤسس عليها ادعاءاته بثقة، بينما تكافئ مقاييس الترتيب مثل MRR وNDCG المحتوى الذي يظهر مبكرا وبوضوح. فهم ما تُحسِّنه هذه الأنظمة يكشف لكم كيف يبدو من الداخل المحتوى القابل للاستخلاص والموثوق.

هذا يجعل من تقييم الاسترجاع مخططا صامتا لـ generative engine optimization. إذا أردتم أن تكونوا المقطع المُستشهَد به، اكتبوا محتوى يحصل على درجة جيدة في الفحوصات الضمنية للمحرك: دقيق، ومكتفٍ ذاتيا (self-contained)، وسهل النسب إليه. الجمع بين هذا التفكير وبحث الكلمات المفتاحية وتخطيط المحتوى المنضبط يساعدكم على استهداف الاستعلامات التي تفوز فيها الأدلة القوية بالاستشهادات.

التحديات والقيود

التقييم لا يتجاوز جودة بياناته. وسوم Ground-Truth مكلفة وذاتية، ويمكن لمجموعة اختبار ضعيفة أو منحازة أن تنتج درجات مُرضية تخفي مشكلات حقيقية. تقلل نماذج اللغة العاملة كحكام من هذه التكلفة لكنها تُدخل تحيزاتها الخاصة، لذا يجب فحص أحكامها دوريا مقابل مراجعة بشرية.

لا يروي رقم واحد القصة كاملة أيضا. يمكن لنظام أن يسجل Recall مرتفعا لكن Faithfulness منخفض، أو Faithfulness قويا على إجابة غير ذات صلة، وهذا هو السبب في استخدام هذه المقاييس كلوحة مقاييس مجتمعة وليس كنتيجة وحيدة. يواجه المجال الأوسع لـمعايير AI نفس هذا الحذر: توجه المقاييس التحسين لكن يجب تفسيرها معا والحفاظ على مصداقيتها عبر إشراف بشري.

الخلاصة

يقيس تقييم الاسترجاع في آن واحد ما إذا كان نظام RAG يجد السياق الصحيح وما إذا كان يستخدم ذلك السياق بأمانة، من خلال الجمع بين مقاييس الاسترجاع مثل Recall وPrecision وMRR وNDCG ومقاييس التوليد مثل Faithfulness وصلة الإجابة. يقدم ثالوث RAG تشخيصا أوليا سريعا، بينما تجعل أطر عمل مثل RAGAS التقييم المنهجي في متناول الجميع.

للتعمق أكثر، اربطوا هذا الموضوع بـتغطية الاسترجاع وبمعمارية retrieval augmented generation الأوسع، واستخدموا أدوات البحث وتخطيط المحتوى الخاصة بـSorank لبناء محتوى تسترجعه هذه الأنظمة وتثق به. مصادر مرجعية: Qdrant، وLangCopilot، وRedis.

الأسئلة المتكررة

ما هي أهم مقاييس تقييم الاسترجاع؟

في جانب الاسترجاع، المقاييس الأساسية هي Recall at k (هل تم العثور على المستندات ذات الصلة)، وPrecision at k (هل النتائج المسترجعة ذات صلة)، وMRR (هل تحتل أول نتيجة ذات صلة ترتيبا مبكرا)، وNDCG (الصلة المتدرجة موزونة حسب الموضع). أما في جانب التوليد، فإن Faithfulness وصلة الإجابة هما الأكثر أهمية. تبدأ فرق كثيرة بثالوث RAG: صلة السياق وFaithfulness وصلة الإجابة.

ما هو إطار عمل RAGAS؟

RAGAS هو إطار عمل مفتوح المصدر بُني خصيصا لتقييم أنظمة RAG. يوفر مقاييس لا تتطلب مرجعا مثل Context Precision وContext Recall وFaithfulness وAnswer Relevancy، تُحسب باستخدام نماذج لغوية تعمل كحكام، بحيث لا تحتاجون غالبا إلى Ground Truth موسوم. يعمل مباشرة دون إعداد إضافي ويمكنه توليد أسئلة اختبار اصطناعية من مستنداتكم، وقد أظهرت درجاته ارتباطا جيدا مع الحكم البشري.

لماذا يهم تقييم الاسترجاع بالنسبة لـGEO؟

تسترجع محركات الإجابة المعتمدة على AI المحتوى وتركّبه، وتصف المقاييس ذاتها التي تُقيّم خطوط معالجتها كيفية العثور على محتواكم واستخدامه. يكافئ Faithfulness المحتوى الذي يمكن لمحرك أن يؤسس عليه ادعاءاته، وتكافئ مقاييس الترتيب المحتوى الذي يظهر مبكرا وبوضوح. فهم التقييم يساعدكم على كتابة صفحات قابلة للاستخلاص، دقيقة، وجيدة البنية، تزداد احتمالية استرجاعها والاستشهاد بها.

مدونتنا للشركات الطموحة