AI benchmarks هي اختبارات موحدة تقيّم نماذج اللغة في المعرفة والاستدلال والبرمجة. تعرفوا على كيفية عملها وما الذي تثبته.

AI benchmarks هي الاختبارات الموحدة لعالم النماذج. كل benchmark هو مجموعة ثابتة من المهام ذات إجابات صحيحة معروفة، بحيث يمكن تشغيل أي نموذج مقابل نفس الأسئلة وتقييمه بنفس الطريقة. هذا المقياس المشترك هو ما يتيح للمشتري مقارنة إجابة نموذج ما بإجابة نموذج آخر دون الاعتماد على ادعاءات كل مزود على حدة. تغطي الاختبارات مهارات ضيقة مثل رياضيات المرحلة الابتدائية ومهارات واسعة مثل الاستدلال عبر 57 مادة أكاديمية.
تكتسب هذه الاختبارات أهميتها لأن كل مزود يدّعي الريادة بينما يقيس كل واحد أشياء مختلفة. تستبدل الاختبارات الحدس بالأرقام، لكن من السهل إساءة تفسير هذه الأرقام. النتيجة لا تكون ذات معنى إلا عند معرفة الاختبار الذي أنتجها، ومدى تشبّع ذلك الاختبار، وما إذا كانت الأسئلة قد تسربت إلى بيانات التدريب. يشرح هذا المقال كيفية عمل الاختبارات، وفئاتها الرئيسية، ولماذا أصبحت تشكّل بشكل متزايد الظهور في بحث AI وفي البحث التوليدي بالذكاء الاصطناعي.
AI benchmark هو مجموعة بيانات منسّقة من المهام مقترنة بطريقة تقييم. قد تكون المهام أسئلة اختيار من متعدد، أو مسائل برمجية، أو أهدافاً بحثية متعددة الخطوات. ينتج النموذج الإجابات، ويقارنها مقيّم آلي بالحلول المرجعية، وتُبلّغ النتيجة كنسبة مئوية واحدة أو تصنيف. ولأن مجموعة البيانات وطريقة التقييم ثابتتان، يمكن ترتيب نموذجين تم اختبارهما بنفس الطريقة أحدهما مقابل الآخر.
التقييم الحديث ليس رقماً واحداً بل تسلسلاً هرمياً من التقييمات المتخصصة، كل منها يقيس قدرة مختلفة. لا يعكس أي benchmark بمفرده الأداء في العالم الحقيقي، لذا فإن التعامل مع أي منها كمقياس نهائي للجودة يؤدي إلى خيارات ضعيفة. هذه هي نفس العقلية القائمة على الأدلة وراء تقييم LLM، حيث يتم الجمع بين إشارات عديدة بدلاً من الاعتماد على نتيجة واحدة.
الآلية بسيطة من حيث المبدأ. يقدّم الـ benchmark موجّهاً (prompt)، يستجيب النموذج، ويتحقق مقيّم من صحة الإجابة. في الاختبارات ذات الاختيار من متعدد، يتحقق المقيّم من الحرف المختار. أما في اختبارات البرمجة، فيقوم بتشغيل الكود المُولَّد مقابل اختبارات وحدة مخفية ويسجّل ما إذا كان ناجحاً. الرقم الرئيسي عادة ما يكون نسبة دقة، أو بالنسبة للكود، معدل النجاح من المحاولة الأولى الذي يُكتب pass@1.
المشكلة أن نفس أوزان النموذج تماماً يمكن أن تنتج نتائج مختلفة جداً حسب إطار الاختبار المحيط بها. يحصل Claude Opus 4.5 على 80.9 بالمئة في SWE-bench Verified لكن فقط 45.9 بالمئة في SWE-bench Pro الأصعب، وهي فجوة 35 نقطة لنفس النموذج بالضبط. بالنسبة للمهام الوكيلية (agentic)، يمكن للبنية الداعمة مثل حدود المحاولات والأدوات المتاحة أن تُحرّك النتائج بين 10 و20 نقطة مئوية. الرقم المجرد بدون تفاصيل إطار الاختبار لا يعني الكثير.
أشهر اختبار للمعرفة هو MMLU، الذي يختبر 57 مادة أكاديمية عبر العلوم والتقنية والهندسة والرياضيات، والعلوم الإنسانية، والمجالات المهنية باستخدام 14,042 سؤال اختيار من متعدد. كان في السابق معيار الصناعة، لكن النماذج المتقدمة تتجمع الآن حول 87 إلى 92 بالمئة، لذا أصبح حداً أدنى أساسياً وليس عامل تمييز. يرفع MMLU-Pro مستوى الصعوبة بتوفير 10 خيارات إجابة بدلاً من أربعة، مما يخفّض نتائج النماذج المتقدمة إلى حوالي 70 إلى 80 بالمئة.
للاستدلال الحقيقي، يقدّم GPQA أسئلة فيزياء وأحياء وكيمياء بمستوى الدراسات العليا مصممة لمقاومة البحث. يحصل الخبراء في المجال على نتيجة حوالي 65 بالمئة بينما يحصل غير الخبراء على نحو 34 بالمئة، مما يجعل النتيجة المرتفعة للنموذج إشارة ثقة قوية. تكافئ هذه الاختبارات العمق، تماماً مثل نماذج الاستدلال التي تعمل على حل المشكلة خطوة بخطوة بدلاً من استرجاع حقيقة من الذاكرة.
HumanEval هو الاختبار الكلاسيكي للبرمجة: 164 مسألة Python مقيّمة عبر pass@1، حيث تحقق النماذج المتقدمة في 2026 نسبة 90 إلى 95 بالمئة. لكنه يختبر فقط دوال معزولة. أما SWE-bench فيطلب من النموذج حل مشكلات GitHub حقيقية تتطلب فهم مستودع كامل، وأفضل الأنظمة لا تحل سوى 40 إلى 55 بالمئة من المجموعة الموثقة. تكشف الفجوة بين الاثنين مدى صعوبة الهندسة العملية مقارنة بالألغاز المعزولة.
تذهب اختبارات المهام الوكيلية إلى أبعد من ذلك. يقيّم GAIA مهام متعددة الخطوات تتطلب تصفح الويب ومعالجة الملفات واستخدام الأدوات، حيث ينخفض معدل النجاح من 50 إلى 70 بالمئة في المهام السهلة إلى 10 إلى 25 بالمئة في أصعب مستوى. يكشف WebArena الفجوة بوضوح: خط أساس بشري بنسبة 78.2 بالمئة مقابل وكيل GPT-4 مبكر بنسبة 14.4 بالمئة عبر 812 مهمة متصفح. تتتبع هذه الاختبارات المهارات وراء وكلاء AI والبحث الوكيلي.
تقيس الاختبارات الآلية مهارات تقنية محددة، لكنها لا تعادل الاستخدام الفعلي في العالم الحقيقي. يلتقط Chatbot Arena، المعروف أيضاً بـ LMArena، التفضيل البشري بدلاً من ذلك. يقارن المستخدمون بين إجابتين مجهولتي المصدر ويصوّتون، وتغذي الأصوات تصنيف Elo على طريقة الشطرنج. تقع النماذج الأعلى فوق 1400 نقطة، وتقع النماذج القوية العاملة بين 1300 و1400، والفرق بين 30 و50 نقطة Elo يكاد لا يُلاحظ في الاستخدام اليومي.
لكل من الأسلوبين نقاط عمياء. يمكن التلاعب بالاختبارات الآلية وتشبعها، بينما تضع ساحات التفضيل غالباً النماذج الثلاثة الأولى داخل فترات ثقة متداخلة، بحيث يكون ترتيبها الدقيق جزئياً ضجيجاً إحصائياً. القاعدة العملية هي التثليث: طلب توافق بين اختبار معرفة واختبار برمجة وساحة تفضيل قبل الوثوق بأي نتيجة.
يشوّه خللان بصمت معظم قوائم التصنيف. يحدث التلوث عندما تتسرب أسئلة الاختبار، أو نصوص مشتقة منها، إلى بيانات التدريب، بحيث يسترجع النموذج الإجابات من الذاكرة بدلاً من الاستدلال. عندما أعاد الباحثون اختبار النماذج على مشكلات GitHub جديدة تاريخها بعد نقطة قطع التدريب، صمدت بعض النتائج بينما انخفضت أخرى بشكل حاد، مما أثبت أن جزءاً من التحسن الأصلي كان حفظاً عن ظهر قلب. يصبح السؤال الصادق هو كم من النتيجة يصمد بعد إزالة التلوث.
التشبع هو المشكلة الثانية. وجد تدقيق شمل 106 اختبارات أن التقييمات الثابتة تفقد قدرتها على التمييز بين النماذج في أقل من عامين في المتوسط. رياضيات المرحلة الابتدائية في GSM8K محلولة إلى حد كبير بنسبة 95 بالمئة فأعلى، وحتى GPQA Diamond يشهد الآن نماذج متقدمة قريبة من 94 بالمئة مقابل 65 بالمئة للخبراء البشريين. عندما يحصل الجميع على نتيجة ضمن نطاق علوي ضيق، لم يعد الاختبار قادراً على التمييز بين القادة.
قد تبدو الاختبارات مسألة هندسية، لكنها تحدد أي نموذج يجيب جمهوركم. النماذج التي تتصدر اختبارات الاستدلال والاسترجاع هي تلك المدمجة في مساعدين مثل ChatGPT وPerplexity وGemini، وسلوكها هو ما يحدد المصادر التي يتم الاستشهاد بها. فهم نقاط قوة النموذج يساعدكم على توقع كيفية قراءته وإعادة استخدامه لمحتواكم أثناء البحث.
يرتبط هذا مباشرة بـتحسين الاستشهاد بالذكاء الاصطناعي وبـاستراتيجية محتوى ذكاء اصطناعي سليمة. تتحقق نماذج الاستدلال الأقوى من الادعاءات عبر مصادر متعددة، مما يكافئ العمق والاتساق والبنية الواضحة على حساب الصفحات الضحلة. الجمع بين هذا الوعي وبحث الكلمات المفتاحية وتخطيط المحتوى المنضبط يساعدكم على استهداف الأسئلة التي تجيب عنها هذه النماذج فعلياً.
ابدأوا بتصنيف المصدر. تتمتع الاختبارات الأكاديمية المستقلة بمنهجية قوية لكنها تشيخ بسرعة. تعكس ساحات تفضيل الجمهور مستخدمين حقيقيين لكنها تشوّش الترتيب بين النتائج المتقاربة. يجب التعامل مع الحزم الخاضعة لسيطرة المزوّد دون منهجية علنية على أنها تسويق وليست دليلاً. تقدّم الاختبارات الديناميكية التي تستمد مشكلات جديدة باستمرار أفضل حماية ضد التلوث.
بعد ذلك، لا تثقوا أبداً برقم واحد. تحققوا مما إذا كان الاختبار مشبعاً، اقرؤوا إطار العمل وفترات الثقة، وأعطوا وزناً أكبر للاختبارات الصعبة غير المشبعة مقارنة بالسهلة. والأهم من ذلك، أجروا تقييمكم الخاص على بياناتكم الحقيقية، لأن مهامكم الخاصة هي الاختبار الصادق الوحيد لحالة استخدامكم.
تستخدم الفرق الاختبارات لتضييق قائمة النماذج قبل الالتزام بميزانية، ولتبرير استبدال نموذج بآخر، ولمراقبة ما إذا كان إصدار جديد يحسّن فعلياً المهمة التي تهمها. يستخدمها الباحثون لتتبع التقدم عبر المجال ولكشف التراجعات التي قد يغفلها إعلان المزوّد.
بالنسبة لمعظم المشترين، سير العمل هو نفسه: التصفية حسب الاختبار الذي يناسب المهمة، وتأكيد النتيجة عبر اختبارين أو ثلاثة مستقلة، ثم التحقق منها على بيانات داخلية. تُضيّق الاختبارات المجال بسرعة، لكن القرار النهائي يجب أن يستند دائماً إلى الأداء في سير عملكم الخاص.
تحوّل AI benchmarks الادعاءات الغامضة للمزوّدين إلى نتائج قابلة للمقارنة، ولهذا ترتكز عليها كل قرارات النماذج تقريباً. لكن النتيجة لا تعني شيئاً إلا عند معرفة الاختبار وتشبعه وإطاره وما إذا كانت الأسئلة قد تسربت إلى التدريب. النهج الموثوق هو التثليث بين اختبارات المعرفة والبرمجة والتفضيل، وتفضيل التقييمات الحديثة، والتأكد من كل شيء على بياناتكم الخاصة.
لتطبيق ذلك عملياً، اربطوا الإلمام بالاختبارات بـتقييم LLM وبـاستراتيجية محتوى ذكاء اصطناعي أوسع، واستخدموا أدوات البحث وتخطيط المحتوى الخاصة بـ Sorank للتوافق مع الأسئلة التي تجيب عنها النماذج الرائدة. المصادر المرجعية: LXT، Summit School، وDigital Applied.
MMLU هو اختبار معرفة يضم 57 مادة أكاديمية تُجاب باختيار من متعدد، لذا فهو يقيس الاسترجاع والفهم الواسع. أما SWE-bench فهو اختبار برمجة يطلب من النموذج إصلاح مشكلات برمجية حقيقية داخل مستودع كامل. يُظهر MMLU ما يعرفه النموذج، بينما يُظهر SWE-bench ما إذا كان قادراً على التصرف في مهمة هندسية عملية.
الكثير من الاختبارات الشائعة أصبحت الآن مشبعة، بمعنى أن النماذج المتقدمة تتجمع ضمن نطاق علوي ضيق ولم يعد الاختبار قادراً على التمييز بينها. جزء من هذا التجمع يأتي أيضاً من التلوث، حيث تتسرب أسئلة الاختبار إلى بيانات التدريب فيسترجع النموذج الإجابات من الذاكرة. لهذا السبب تُفضّل الاختبارات الجديدة والأصعب لمقارنة النماذج الرائدة.
لا. الرقم الواحد يكاد يكون بلا معنى بمفرده لأن النتائج تعتمد بشدة على إطار الاختبار، وعمر الاختبار، واحتمال تسرب البيانات. النهج الأكثر أماناً هو التثليث بين اختبار معرفة واختبار برمجة وساحة تفضيل بشري، ثم التحقق من النموذج على بياناتكم الحقيقية الخاصة قبل اتخاذ القرار.