يربط تأصيل AI إجابات نموذج اللغة بمصادر واقعية يمكن التحقق منها للحد من الهلوسة. تعرفوا على كيفية عمله ولماذا هو مهم.

تأصيل AI هو ممارسة إرساء إجابات النموذج في معلومات ملموسة وموثوقة بدلاً من تركه يجيب فقط من ذاكرته. يتنبأ نموذج اللغة بمفرده بنص معقول استناداً إلى الأنماط التي تعلمها أثناء التدريب، وهو ما قد ينتج تصريحات واثقة لكنها خاطئة. يمنح التأصيل النموذج إمكانية الوصول إلى مصادر حقيقية، مستندات الشركة، صفحات ويب حديثة، بيانات منظمة، بحيث يمكنه استرجاع الحقائق واستخدامها لدعم ما يقوله.
هذا مهم لأن الموثوقية هي العامل الحاسم لاستخدام AI في العمل الجاد. لا يمكن الوثوق بنموذج يختلق التفاصيل لأغراض البحث أو الدعم أو اتخاذ القرارات، والتأصيل هو التقنية الأساسية التي تربط بين القدرة اللغوية المجردة والواقع القابل للتحقق.
يعني تأصيل AI ربط المعرفة المجردة داخل النموذج ببيانات ملموسة من العالم الواقعي ذات صلة بالمهمة المطروحة. وبدلاً من الاعتماد فقط على الأنماط المكتسبة من التدريب، يدمج النموذج المؤصَّل معلومات مُشار إليها بشكل صريح عند توليد الإجابة. والنتيجة هي إبقاء المخرجات متجذرة في الواقع من خلال توفير ارتباط بحقائق يمكن التحقق منها.
وهو موجود لحل ثلاث ثغرات ملموسة. تمتلك النماذج معرفة قديمة لأن التدريب له تاريخ توقف ثابت، وتفتقر إلى إمكانية الوصول إلى بيانات خاصة أو خاصة بالشركة، وهي عرضة لهلوسة AI عندما تضطر إلى التخمين. يعالج التأصيل الثغرات الثلاث جميعها من خلال توفير مواد حديثة وذات صلة وموثوقة وقت الإجابة.
يعمل التأصيل كجسر: فهو يربط بين اللغة التي يفهمها النموذج وبين أحداث ومستندات ومواقف ملموسة. عند وصول استعلام، يجلب النظام المعلومات ذات الصلة من مصدر متصل، ثم يُدرج تلك المواد ضمن الطلب بحيث يستدل النموذج استناداً إلى حقائق حقيقية بدلاً من افتراضاته الخاصة. لم يعد النموذج مضطراً للاختلاق عندما لا يعرف؛ بل يمكنه البحث عن الأمر.
التطبيق الأكثر شيوعاً هو التوليد المعزز بالاسترجاع، حيث يُقترن LLM بنظام استرجاع، غالباً ما يُبنى على تضمينات متجهية (vector embeddings)، يسحب المحتوى من مصدر بيانات. تسترجع الأنواع المتقدمة بيانات منظمة وغير منظمة في الوقت الفعلي وتوحدها حول كيان محدد، مثل عميل أو منتج، لإثراء الطلب بسياق دقيق وذي صلة.
التأصيل و RAG مرتبطان ارتباطاً وثيقاً لكنهما ليسا متطابقين. التأصيل هو الهدف، أي إبقاء الإجابات مرتبطة بحقائق يمكن التحقق منها، بينما RAG هي الطريقة الأكثر شيوعاً لتحقيقه. في خط أنابيب RAG، يعثر الاسترجاع على المستندات الصحيحة ويولّد النموذج إجابة مقيدة بها، وهذا هو التأصيل في الممارسة.
توجد أيضاً طرق تأصيل أخرى، بما في ذلك ربط النموذج ببيانات الويب المباشرة من أجل الحداثة أو بأنظمة داخلية من أجل المعرفة الخاصة بالملكية. ما تشترك فيه هو نفس المبدأ: توفير معلومات خارجية موثوقة بحيث يكون استدلال النموذج مؤصَّلاً. يعتمد اختيار الطريقة على ما إذا كانت الأولوية للأحداث الجارية أو البيانات الخاصة أو مزيج من الاثنين.
يقلل التأصيل الهلوسة بشكل كبير لأن النموذج يمكنه استرجاع حقائق حقيقية واستخدامها لدعم استدلاله بدلاً من التخمين. عندما تكون المعلومات ذات الصلة أمامه، تقل احتمالية اختلاق النموذج بشكل كبير، وتُرفق أنظمة كثيرة أيضاً استشهاداً بالمصدر بحيث يمكن للمستخدم التحقق من كل ادعاء مقابل أصله.
تنبيه مهم: التأصيل ضروري لكنه غير كافٍ. لا يزال بإمكان النموذج إساءة فهم مقطع تم استرجاعه، أو الجمع بين المصادر بشكل غير صحيح، أو الهلوسة حول حواف ما وجده. يقلل التأصيل الخطر بشكل كبير، لكنه لا يلغيه، ولهذا يظل التحقق البشري مهماً بالنسبة للمخرجات ذات المخاطر العالية.
التأصيل هو الآلية التي تحوّل المحتوى الخاص بكم إلى إجابات AI. عندما يؤصل المساعد إجابة في صفحات ويب تم استرجاعها، فإن المصادر التي يسحبها هي التي يتم الاستشهاد بها، لذا فإن كونكم قابلين للاسترجاع وموثوقين هو ما يكسبكم مكاناً في الإجابة. الصفحات التي يمكن للنموذج أن يؤصل عليها هي، في الواقع، الصفحات التي تفوز بالظهور.
هذا يعيد صياغة التحسين حول كونكم مصدراً نظيفاً وقابلاً للاستشهاد به. المحتوى ذو البنية الجيدة، الدقيق من الناحية الواقعية، وسهل الاستخلاص، أكثر عرضة للاختيار أثناء التأصيل، وهذه هي الصلة العملية بين التأصيل وتحسين محركات التوليد. الأسئلة التي يحاول النموذج تأصيلها غالباً ما تكون استعلامات تأصيل، والإجابة عنها بوضوح هي كيفية إدراجكم.
ابدؤوا بالدقة والوضوح. تؤصل النماذج بشكل أفضل على المحتوى الذي يذكر حقائق يمكن التحقق منها بوضوح، لذا ابدؤوا بإجابات مباشرة، واستشهدوا بمصادركم الخاصة، وتجنبوا الادعاءات الغامضة أو المتناقضة. تأكدوا من أن الصفحة قابلة للوصول إليها من قبل زواحف AI، لأن المحتوى غير القابل للاسترجاع لا يمكن التأصيل عليه.
ثم قوموا ببناء الهيكل من أجل الاستخلاص باستخدام عناوين واضحة وفقرات قصيرة وأسماء كيانات متسقة بحيث يتمكن نظام الاسترجاع من عزل المقطع الصحيح. حافظوا على حداثة المعلومات، لأن التأصيل غالباً ما يفضل البيانات الحالية على الصفحات القديمة. مواءمة ذلك مع بحث الكلمات المفتاحية وتخطيط المحتوى المنضبط يضمن أن الحقائق التي تنشرونها تطابق الأسئلة التي يحاول المساعدون تأصيلها.
القيد الأول هو جودة الاسترجاع. التأصيل جيد بقدر جودة المصدر الذي يسحبه، لذا إذا أظهرت خطوة الاسترجاع مستنداً ضعيفاً أو خاطئاً، فإن الإجابة المؤصَّلة ترث ذلك الخلل. بيانات العالم الواقعي أيضاً فوضوية، مليئة بالغموض وعدم الاتساق والتنسيقات المختلطة، مما يجعل التأصيل الموثوق أصعب مما يبدو.
الثاني هو أن التأصيل لا يضمن الحقيقة. لا يزال النموذج يفسر ما يسترجعه ويمكن أن يخطئ، لذا يقلل التأصيل من الحاجة إلى الإشراف لكنه لا يلغيها. بناء استرجاع جيد، وتنسيق مصادر موثوقة، والتحقق من المخرجات المهمة، كلها جزء من جعل التأصيل موثوقاً بالفعل.
يربط تأصيل AI إجابات النموذج ببيانات واقعية يمكن التحقق منها بحيث يستدل استناداً إلى الحقائق بدلاً من التخمين، وهو خط الدفاع الرئيسي ضد الهلوسة. يُنفَّذ في الغالب باستخدام RAG، وهو يُغذي الاستشهادات التي يعتمد عليها المستخدمون، وهو ضروري لكنه غير كافٍ بمفرده. بالنسبة للناشرين، التأصيل هو الطريق الذي يصبح من خلاله المحتوى الدقيق والقابل للاسترجاع المصدر الذي تستشهد به إجابة AI.
للتعمق أكثر، اربطوا هذا بـهلوسة AI والتوليد المعزز بالاسترجاع، واستخدموا أدوات بحث الكلمات المفتاحية وتخطيط المحتوى الخاصة بـ Sorank لنشر الحقائق الواضحة والدقيقة التي تؤصل عليها النماذج. المصادر المرجعية: K2view وMoveworks.
التأصيل هو هدف إبقاء إجابات النموذج مرتبطة بحقائق يمكن التحقق منها، بينما التوليد المعزز بالاسترجاع، أو RAG، هو الطريقة الأكثر شيوعاً المستخدمة لتحقيقه. في خط أنابيب RAG، يسترجع النظام المستندات ذات الصلة ويولّد النموذج إجابة مقيدة بها. إذن RAG هي إحدى طرق تأصيل النموذج، والتأصيل هو ما تحققه RAG.
لا. يقلل التأصيل الهلوسة بشكل كبير لأن النموذج يمكنه استرجاع حقائق حقيقية بدلاً من التخمين، لكنه ضروري وليس كافياً. لا يزال بإمكان النموذج إساءة فهم مقطع تم استرجاعه، أو الجمع بين المصادر بشكل غير صحيح، أو الاختلاق حول الحواف. يقلل التأصيل الخطر بشكل كبير، لكن التحقق البشري لا يزال مهماً بالنسبة للإجابات ذات المخاطر العالية.
عندما يؤصّل مساعد AI إجابة في صفحات ويب تم استرجاعها، فإن المصادر التي يسحبها هي التي يستشهد بها. لذا فإن جعل محتواكم دقيقاً وقابلاً للاسترجاع وسهل الاستخلاص يزيد من فرصة اختياره أثناء التأصيل. البنية الواضحة والحقائق القابلة للتحقق وأسماء الكيانات المتسقة وقابلية الزحف كلها تساعد النموذج على تأصيل إجابته على صفحتكم.