העדפות

הפרטיות חשובה לנו, ולכן יש לך אפשרות להשבית סוגים מסוימים של אחסון שייתכן שאינם נחוצים לתפקוד הבסיסי של האתר. חסימת קטגוריות עלולה להשפיע על חווית השימוש שלך באתר. מידע נוסף

קבל את כל קובצי ה-Cookie

הערכת אחזור מידע: איך למדוד את איכות ה-RAG ותשובות AI אמינות ב-2026

הערכת אחזור מידע מודדת עד כמה מערכת RAG מוצאת ומשתמשת בהקשר הנכון. להכיר את המדדים, את שלישיית ה-RAG ואת השיטות המומלצות.

Man with dark hair and beard wearing a light brown shirt speaks in front of a microphone on a podcast or recording setup.Portrait of a man with short dark hair wearing a white shirt and dark jacket, looking directly at the camera with a neutral expression.Man with short dark hair, beard, and clear glasses wearing a black t-shirt with a white circular logo, standing in front of a stone wall.Celio fabianoSmiling young woman with long brown hair wearing a red top and necklace, outdoors in a tree-filled background.photo de profil du client Xavier Breull
+ 9,000 מנויים
לוח בקרה להערכה המציג מדדי אחזור כמו Recall, Precision, MRR וציוני נאמנות (Faithfulness) עבור מערכת RAG.
רכיב ממשק משתמש להעלאה
תיבו בסון-מגדלן, מייסד סורנק

אודות המחבר

תיבו בסון-מגדלן

מייסד סורנק, עם למעלה מ-5 שנות ניסיון ב-SEO, חובב GEO.
סכם באמצעות
שתף ב-

סיכום: הערכת אחזור מידע היא הפרקטיקה של מדידת מידת ההצלחה של מערכת אחזור במציאת המסמכים הנכונים, ומידת הנאמנות של המודל בשימוש בהם, באמצעות מדדים כמו Recall at k,‏ Precision at k,‏ MRR,‏ NDCG ו-Faithfulness כדי לשפוט את איכות צינור העבודה (pipeline) של RAG.

הערכת אחזור מידע היא הדיסציפלינה שבודקת אם מערכת אחזור מעלה את המידע הנכון, ואם התשובה שנוצרה אכן משתמשת בו היטב. בצינור עבודה של retrieval augmented generation, תשובה טובה תלויה בשני דברים שצריכים לעבוד כשורה: מנגנון האחזור מוצא הקשר רלוונטי, והמודל נשאר נאמן לאותו הקשר. הערכת אחזור מידע נותנת מספרים לשני הגורמים כדי שצוותים יוכלו לאבחן כשלים ולשפר את האיכות במקום לנחש.

לעניין הזה יש חשיבות כי מערכת RAG יכולה להיכשל בשקט. תשובה יכולה להישמע שוטפת אך להתבסס על הקטעים הלא נכונים, או שמנגנון האחזור עלול לפספס מקורות מרכזיים שהמודל היה זקוק להם. עבור כל מי שבונה מערכות RAG, או מנסה להיות המקור שהן מצטטות, הבנת האופן שבו מערכות אלה מדורגות חושפת בדיוק איך נראה תוכן טוב וניתן לאחזור.

מהי הערכת אחזור מידע?

הערכת אחזור מידע בוחנת את שני חלקיו של צינור העבודה של RAG בנפרד וביחד. חלק האחזור בודק אם המערכת מצאה מידע רלוונטי מבחינה סמנטית. חלק היצירה בודק אם התשובה משמעותית, מבוססת (grounded) ורלוונטית לנושא. הערכה נפרדת של כל חלק היא מה שמאפשר להבחין בין בעיית אחזור לבין בעיית יצירה, וזהו הצעד הראשון לתיקון של כל אחת מהן.

מדובר בענף מתמחה של הערכת LLM. בעוד שהערכת מודל כללית עשויה לשפוט שטף לשוני או יכולת היגיון, הערכת אחזור מידע מתמקדת בראיות: האם ההקשר הנכון אוחזר, והאם המודל כיבד אותו. מכיוון שתשובות RAG טובות רק כמו הקטעים שעומדים מאחוריהן, נקודת מבט זו הממוקדת בראיות היא חיונית לבניית מערכות שאנשים יכולים לסמוך עליהן.

מדדי אחזור: Recall,‏ Precision,‏ MRR ו-NDCG

ארבעה מדדים מהווים את עמוד השדרה של צד האחזור. Recall at k הוא היחס בין כלל המסמכים הרלוונטיים לבין אלו שנמצאים ב-k התוצאות המובילות, כאשר langcopilot ממליצה על יעד של לפחות 80 אחוז בשאילתות קריטיות. Precision at k הוא החלק מתוך ה-k התוצאות המובילות שהן אכן רלוונטיות, כאשר Precision גבוה יותר משמעו פחות רעש עבור המודל. שני המדדים הללו הם עמוד השדרה של מדידת כיסוי אחזור ואיכות.

גם מיקום הדירוג חשוב. Mean Reciprocal Rank, או MRR, מחשב ממוצע של הדירוג ההופכי של התוצאה הרלוונטית הראשונה, כשהציון הוא 1.0 כאשר היא נמצאת במקום הראשון, 0.5 כאשר היא שנייה, וקרוב לאפס כאשר היא קבורה עמוק, כאשר יעדים למענה על שאלות עומדים מעל 0.7. Normalized Discounted Cumulative Gain, או NDCG, מטפל ברלוונטיות מדורגת ומנכה מהתוצאות לפי הדירוג כך שפריט רלוונטי במקום הראשון נחשב יותר מפריט במקום העשירי, כאשר langcopilot מציינת יעדים מעל 0.85 בתחומים מוגדרים היטב. NDCG הוא ההתאמה הטבעית בעת הערכת דירוג קטעים עם מספר תשובות רלוונטיות.

מדדי יצירה: Faithfulness ורלוונטיות התשובה

אחזור טוב יורד לטמיון אם המודל עושה בו שימוש לא נכון, ולכן לצד היצירה יש מדדים משלו. Faithfulness מודד עד כמה התשובה נצמדת לראיות שאוחזרו בלי להכניס טענות לא מבוססות, ולרוב מחושב כאחוז ההיגדים שמגובים בהקשר. בתחומים בעלי סיכון גבוה כמו רפואה ומשפט, היעד הוא קרוב ל-100 אחוז, כי טענה לא מבוססת היא הזיית AI פוטנציאלית.

רלוונטיות התשובה בודקת אם התגובה אכן עונה על השאלה ונשארת בנושא, ולעיתים קרובות נמדדת באמצעות דמיון embeddings בין התשובה לבין השאילתה, או באמצעות מודל שפה שמשמש כשופט. כיסוי ציטוטים, כלומר האם הטענות מגובות במקורות, משלים את התמונה. יחד, מדדים אלה מבטיחים שהמערכת לא רק מאחזרת היטב אלא גם מפיקה תשובות מבוססות ושימושיות עם ציטוט מקורות תקין.

שלישיית ה-RAG (RAG Triad)

דרך מעשית להתחיל היא שלישיית ה-RAG, שאותה Qdrant מגדירה כיעילות אחזור, רלוונטיות תשובה וקוהרנטיות, ושמדריכים אחרים מנסחים כרלוונטיות הקשר, Faithfulness ורלוונטיות תשובה. הרעיון הוא ששלוש הבדיקות הללו תופסות את מצבי הכשל הנפוצים ביותר: אחזור גרוע, יצירה עם הזיות ותשובות שאינן בנושא.

קריאה משותפת של המדדים הללו היא אבחנתית. אם רלוונטיות ההקשר נמוכה, מנגנון האחזור הוא הבעיה. אם ההקשר טוב אך ה-Faithfulness נמוך, המודל סוטה מהראיות שלו. אם שני אלה תקינים אך רלוונטיות התשובה נמוכה, המערכת מבוססת אך מפספסת את הכוונה האמיתית של המשתמש. הפרדה זו היא מה שהופך את השלישייה לעדשה ראשונית שימושית כל כך לפני הוספת מדדים מפורטים יותר.

איך מבצעים הערכת אחזור מידע

קיימות שתי גישות רחבות. הערכת Ground-Truth בונה זוגות של שאלה ותשובה ממסמכי מקור, ולאחר מכן משווה בין התשובות שנוצרו לבין התשובות הצפויות באמצעות ציוני דמיון ונכונות בסולם שבין אפס לאחת. הגישה הזו קפדנית אך גוזלת עבודה רבה, מכיוון שמישהו צריך לתייג מה נחשב רלוונטי ונכון.

החלופה היא שימוש במודל שפה כשופט (LLM-as-a-judge). מסגרות עבודה מדרגות Faithfulness, רלוונטיות ואיכות הקשר באופן אוטומטי, מה שמתרחב הרבה יותר טוב מבדיקה ידנית. Qdrant מתארת מתודולוגיות של LLM-as-a-judge להערכת איכות התשובה, ובפועל צוותים רבים משלבים בין השתיים: קבוצת ליבה מתויגת עבור אמות מידה אמינות, יחד עם שיפוט אוטומטי לכיסוי רחב ותכוף.

מסגרת העבודה RAGAS

RAGAS היא מסגרת עבודה פופולרית בקוד פתוח שנבנתה במיוחד להערכת RAG. היא מספקת מדדים ללא צורך בהתייחסות (reference-free) הכוללים Context Precision,‏ Context Recall,‏ Faithfulness ו-Answer Relevancy, המחושבים באמצעות שופטי מודל שפה, כך שלרוב אין צורך ב-Ground Truth מתויג. היא עובדת מיד עם ההתקנה ואף יכולה לייצר שאילתות בדיקה סינתטיות מהמסמכים שלכם, מה שמוריד את המחסום להערכה שיטתית.

השיטה שלה היא לפרק תשובה להיגדים אטומיים ולבדוק כל אחד מהם מול ההקשר שאוחזר, וכך היא מדרגת את ה-Faithfulness בדיוק רב. לפי langcopilot, מדדי RAGAS הראו קורלציה טובה עם שיפוט אנושי, והציגו ביצועים טובים יותר מדירוג zero-shot נאיבי ממודל כללי. אמינות זו היא הסיבה לכך שהיא הפכה לנקודת מוצא ברירת מחדל עבור צוותים רבים המפרמלים את תהליך ההערכה שלהם.

למה הערכת אחזור מידע חשובה עבור SEO ו-GEO

המדדים שמדרגים מערכות RAG מתארים גם איך התוכן שלכם מתגלה ומשמש מנועי תשובה מבוססי AI. Faithfulness מתגמל מקורות שמנוע יכול לבסס עליהם טענות בביטחון, בעוד מדדי דירוג כמו MRR ו-NDCG מתגמלים תוכן שעולה מוקדם ובבהירות. הבנת מה שהמערכות הללו מייעלות אליו מגלה לכם איך נראה מבפנים תוכן שניתן לחילוץ ואמין.

זה הופך את הערכת אחזור המידע לתוכנית עבודה שקטה עבור generative engine optimization. אם אתם רוצים להיות הקטע המצוטט, כתבו תוכן שמקבל ציון גבוה בבדיקות הסמויות של המנוע: מדויק, עצמאי (self-contained) וקל לייחוס. שילוב גישה זו עם מחקר מילות מפתח ותכנון תוכן ממושמעים עוזר לכם למקד את השאילתות שבהן ראיות חזקות זוכות בציטוטים.

אתגרים ומגבלות

הערכה טובה רק כמו הנתונים שעליהם היא מתבססת. תיוגי Ground-Truth יקרים וסובייקטיביים, וקבוצת בדיקה דלה או מוטה עלולה להפיק ציונים מחמיאים שמסתירים בעיות אמיתיות. שופטי מודל שפה מפחיתים את העלות הזו אך מכניסים הטיות משלהם, ולכן יש לבדוק את פסיקותיהם מעת לעת מול בדיקה אנושית.

גם מספר בודד אינו מספר את כל הסיפור. מערכת יכולה להציג Recall גבוה אך Faithfulness נמוך, או Faithfulness חזק על תשובה לא רלוונטית, וזו הסיבה שבגללה משתמשים במדדים אלה כפאנל ולא כלוח תוצאות. התחום הרחב יותר של אמות מידה של AI ניצב בפני אותה זהירות: מדדים מנחים שיפור אך יש לפרש אותם יחד ולשמור על יושרתם באמצעות פיקוח אנושי.

סיכום

הערכת אחזור מידע מודדת גם אם מערכת RAG מוצאת את ההקשר הנכון וגם אם היא משתמשת בו בנאמנות, תוך שילוב מדדי אחזור כמו Recall,‏ Precision,‏ MRR ו-NDCG עם מדדי יצירה כמו Faithfulness ורלוונטיות התשובה. שלישיית ה-RAG מציעה אבחון ראשוני ומהיר, ומסגרות עבודה כמו RAGAS הופכות הערכה שיטתית לנגישה.

כדי להעמיק, כדאי לחבר את הנושא הזה עם כיסוי אחזור ועם ארכיטקטורת retrieval augmented generation הרחבה יותר, ולהשתמש בכלי המחקר ותכנון התוכן של Sorank כדי לבנות תוכן שהמערכות הללו מאחזרות וסומכות עליו. מקורות התייחסות: Qdrant,‏ LangCopilot, וכן Redis.

שאלות נפוצות

מהם מדדי הערכת האחזור החשובים ביותר?

בצד האחזור, המדדים המרכזיים הם Recall at k (האם נמצאו המסמכים הרלוונטיים), Precision at k (האם התוצאות שאוחזרו רלוונטיות), MRR (האם התוצאה הרלוונטית הראשונה מדורגת מוקדם) ו-NDCG (רלוונטיות מדורגת המשוקללת לפי מיקום). בצד היצירה, Faithfulness ורלוונטיות התשובה הם החשובים ביותר. צוותים רבים מתחילים עם שלישיית ה-RAG: רלוונטיות ההקשר, Faithfulness ורלוונטיות התשובה.

מהי מסגרת העבודה RAGAS?

RAGAS היא מסגרת עבודה בקוד פתוח שנבנתה במיוחד להערכת מערכות RAG. היא מספקת מדדים ללא צורך בהתייחסות, כמו Context Precision,‏ Context Recall,‏ Faithfulness ו-Answer Relevancy, המחושבים באמצעות מודלי שפה המשמשים כשופטים, כך שלרוב אין צורך ב-Ground Truth מתויג. היא עובדת מיד עם ההתקנה ויכולה לייצר שאלות בדיקה סינתטיות מהמסמכים שלכם, והציונים שלה הראו קורלציה טובה עם שיפוט אנושי.

למה הערכת אחזור מידע חשובה עבור GEO?

מנועי תשובה מבוססי AI מאחזרים ומרכיבים תוכן, והמדדים שמדרגים את צינורות העבודה שלהם מתארים גם איך התוכן שלכם נמצא ומשמש. Faithfulness מתגמל תוכן שמנוע יכול לבסס עליו טענות, ומדדי דירוג מתגמלים תוכן שעולה מוקדם ובבהירות. הבנת ההערכה עוזרת לכם לכתוב עמודים ניתנים לחילוץ, מדויקים ומובנים היטב, שסיכוייהם גבוהים יותר להיות מאוחזרים ומצוטטים.

הבלוג שלנו לחברות שאפתניות