الرموز هي الوحدات الصغيرة من النص التي تقرأها وتولّدها نماذج AI. تعرفوا على كيفية عمل الترميز ولماذا تحدد الرموز التكلفة والسياق.

الرموز هي الوحدات الأساسية التي تقرأها وتنتجها نماذج اللغة القائمة على AI. قبل أن يتمكن النموذج من العمل مع نصكم، يقوم مُرمِّز بتقسيم ذلك النص إلى رموز، يمكن أن تكون كلمات كاملة أو أجزاءً من كلمات أو أحرفًا مفردة أو علامات ترقيم. النموذج لا يرى الأحرف الخام كما نراها نحن؛ بل يرى تسلسلاً من الرموز، ويتعلم العلاقات الإحصائية بينها، ويولّد إجاباته رمزًا تلو الآخر.
الرمز هو تسلسل شائع من الأحرف مأخوذ من مفردات ثابتة تم تدريب النموذج عليها. مجموعة كل الرموز الفريدة التي يعرفها النموذج هي مفرداته، والتي يمكن أن تصل إلى آلاف عديدة من المدخلات. بعض الرموز كلمات كاملة، وبعضها الآخر أجزاء، ويعتمد المزيج الصحيح على طريقة بناء المُرمِّز.
يوضح مثال بسيط هذه الفكرة. جملة "I heard a dog bark loudly at a cat" قد تتقسم إلى الكلمات نفسها كرموز منفصلة، في حين أن كلمة أطول مثل "darkness" يمكن أن تنقسم إلى "dark" و"ness". ولأن النموذج يعمل على هذه الأجزاء، فإن عدد الرموز في مقطع نصي نادرًا ما يطابق عدد الكلمات، وهذه أول مفاجأة يواجهها معظم الناس عندما يتفحصون الأمر عن قرب.
توجد ثلاثة أنماط رئيسية من الترميز: الترميز على مستوى الكلمة، وعلى مستوى الحرف، وعلى مستوى جزء الكلمة. الترميز على مستوى الكلمة يقسّم النص عند الفواصل، والترميز على مستوى الحرف يقسّم النص إلى أحرف فردية، بينما يقع الترميز على مستوى جزء الكلمة بينهما، ويقسّم النص إلى أجزاء من الكلمات. تستخدم معظم النماذج الحديثة، بما فيها عائلة GPT، طريقة على مستوى جزء الكلمة تسمى byte pair encoding، التي توازن بين حجم المفردات والمرونة.
هذه المفاضلة حقيقية. الرموز الأصغر تتيح للنموذج التعامل مع الكلمات غير المعروفة والأخطاء الإملائية والتراكيب المعقدة، لكنها تحوّل مقطعًا نصيًا معينًا إلى عدد أكبر من الرموز، مما يستهلك حوسبة أكبر ويترك مساحة أقل ضمن حد ثابت. الرموز الأكبر أكثر كفاءة لكل مقطع نصي لكنها تحتاج إلى مفردات أكبر وتواجه صعوبة مع الكلمات النادرة. تشكل خطوة الترميز هذه أساس معالجة اللغة الطبيعية في الأنظمة الحديثة.
بمجرد ترميز النص، يخصص النموذج لكل رمز فريد معرّفًا رقميًا، بحيث تصبح الجملة تسلسلًا من الأرقام. تُربط هذه المعرّفات بعد ذلك بـembeddings، وهي متجهات رقمية متعددة القيم تلتقط مدى تكرار ظهور الرموز معًا أو في سياقات متشابهة. الـembeddings هي الطريقة التي يمثل بها النموذج المعنى وليس مجرد الإملاء.
عملية التوليد تكرارية. لإنتاج المخرجات، يتنبأ النموذج بمتجه للرمز التالي، ويختار الرمز الأكثر احتمالاً من مفرداته، ويضيفه إلى التسلسل، ويكرر العملية، وبذلك يبني الإجابة رمزًا تلو الآخر. هذا التنبؤ التدريجي هو الحلقة الأساسية لكل LLM، وهو ما يفسر لماذا تستغرق المخرجات الأطول وقتًا أطول وتكلف أكثر لتوليدها أثناء استدلال AI.
الرموز هي أيضًا وحدة التدريب. أثناء التدريب المسبق، يُعرض على النموذج تسلسلات هائلة من الرموز ويتعلم التنبؤ بالرمز التالي، محسّنًا دقته عبر تكرارات عديدة. تُقاس مجموعات بيانات التدريب بالرموز، غالبًا بالمليارات أو تريليونات منها، وتربط قوانين التوسع بين حجم الرموز الأكبر وجودة النموذج الأفضل.
لهذا السبب يسمي بعض الناس الرموز أحيانًا "عملة AI". في التدريب، تمثل الرموز استثمارًا في ذكاء النموذج، وفي الاستدلال، فإنها تحرك التكلفة والإيرادات معًا. الوحدة نفسها التي تقيس مقدار ما تعلّمه النموذج تقيس أيضًا تكلفة استخدامه، وهو ما يربط اقتصاديات بيانات تدريب AI مباشرة بالرموز.
لكل نموذج حد أقصى لعدد الرموز التي يمكنه التعامل معها في وقت واحد، يُعبّر عنه عادة بنافذة سياق موحدة تغطي كلاً من المدخلات والمخرجات. إذا كانت نافذة سياق النموذج 100 رمز واستخدم مدخلكم تسعة منها، يتبقى 91 للاستجابة. اختاروا ترميزًا أكثر دقة وقد يستهلك المدخل نفسه جزءًا أكبر بكثير من الميزانية.
لهذا الحد نتائج حقيقية. يمكن لمستند طويل أو محادثة طويلة متعددة الأدوار أن تتجاوز النافذة، مما يجبر النموذج على إسقاط أو ضغط المحتوى السابق وفقدان تفاصيله. نوافذ السياق الأكبر تخفف من هذه المشكلة، وتتيح للنموذج التفكير عبر مدخلات طويلة والبقاء متماسكًا، وهذا ما يجعل حجم نافذة السياق مواصفة رئيسية لأي نموذج.
بما أن الرموز هي وحدة العمل، فهي أيضًا وحدة الفوترة. تفرض معظم الجهات المزوّدة رسومًا لكل رمز وتسعّر المدخلات والمخرجات بشكل منفصل، مع كون رموز المخرجات أكثر تكلفة غالبًا. طلب يرسل موجّهًا قصيرًا لكنه يطلب إجابة طويلة قد تهيمن عليه تكلفة المخرجات، بينما يقلب تلخيص مستند كبير التوازن نحو تكلفة المدخلات.
تفرض الجهات المزوّدة أيضًا حدود معدل يُعبّر عنها بالرموز في الدقيقة، وهو ما يحدد سرعة عمل التطبيق. النتيجة العملية هي أن كفاءة الرموز مهمة: الموجّهات المختصرة، والتحكم في طول المخرجات، والإدارة الدقيقة للسياق، كلها تقلل التكلفة والزمن. يمكن أن يكون التحسين هنا كبيرًا، إذ تُبلغ بعض الفرق عن تخفيضات كبيرة في التكلفة لكل رمز من خلال هندسة أفضل، وهو أمر ذو أهمية حقيقية عند التخطيط لتدفقات عمل البحث عن الكلمات المفتاحية وتخطيط المحتوى التي تستدعي AI على نطاق واسع.
لا تقتصر الرموز على النص. تحوّل النماذج الحديثة متعددة الوسائط الصور إلى رموز بصرية، والصوت إلى رموز صوتية، والفيديو إلى تسلسلات يمكن للنموذج معالجتها بالطريقة نفسها التي يعالج بها الكلمات. هذا التمثيل المشترك هو ما يتيح لنظام واحد التعامل مع النص والصور والصوت معًا، موحّدًا المدخلات المتنوعة في تسلسلات من الرموز.
بالنسبة للتحسين لمحركات البحث التوليدية، تفسر الرموز كيفية قراءة AI لصفحاتكم. تستوعب النماذج محتواكم كرموز، وتلائمه ضمن نافذة سياق إلى جانب استعلام، وتولّد إجابة رمزًا تلو الآخر، وهو ما يكافئ المحتوى الواضح والسهل التقسيم. تنظيم الصفحات بحيث تكون الحقائق الأساسية مختصرة ومكتفية ذاتيًا يساعد النموذج على تمثيلها ضمن ميزانية الرموز الخاصة به، وهذا ما يجعل المحتوى الجاهز لـLLM واستراتيجية محتوى AI تؤتي ثمارها في إجابات AI.
الرموز هي اللبنات الأساسية لمعالجة اللغة في AI: الكلمات وأجزاء الكلمات والأحرف التي ينتجها المُرمِّز، وكل منها يُربط بمعرّف وembedding يستخدمهما النموذج لقراءة النص وتوليده. وهي أيضًا عملة AI، إذ تقيس حجم التدريب، وتحدد نافذة السياق، وتضبط سعر كل طلب. فهمها يوضح لماذا يكون المحتوى المختصر والمنظم جيدًا أسهل وأرخص على النماذج لاستخدامه.
بالنسبة للظهور، الدرس المستفاد هو أن AI يرى محتواكم كرموز، لذا فإن الوضوح والتنظيم يساعدانه على استيعابكم وفهمكم والاستشهاد بكم. اجمعوا بين محتوى جاهز لـLLM قوي واستراتيجية محتوى AI واضحة، واستخدموا أدوات البحث وتخطيط المحتوى من Sorank لتخطيط محتوى يقرأه AI بكفاءة. مصادر مرجعية: NVIDIA وMicrosoft Learn.
لا توجد قاعدة ثابتة، لكن التقدير الشائع لدى المطورين هو نحو رمز واحد لكل أربعة أحرف من النص الإنجليزي، أي ما يقارب ثلاثة أرباع الكلمة. الكلمات القصيرة الشائعة تكون عادة رمزًا واحدًا، بينما تنقسم الكلمات الأطول أو الأندر إلى عدة رموز جزئية. تُحتسب علامات الترقيم والمسافات أيضًا، لذا تحتوي الجملة دائمًا تقريبًا على رموز أكثر من كلماتها.
تفرض معظم الجهات المزوّدة لخدمات AI رسومًا حسب الرمز، وعادة ما تسعّر رموز المدخلات ورموز المخرجات بشكل منفصل، مع كون المخرجات أكثر تكلفة غالبًا. هذا يعني أن الموجّه الطويل والإجابة الطويلة كلاهما يضيف إلى الفاتورة. ولأن التكلفة تزداد مع عدد الرموز، فإن كتابة موجّهات مختصرة والتحكم في مقدار ما يولّده النموذج طريقتان عمليتان للتحكم في الإنفاق.
نافذة السياق هي العدد الأقصى من الرموز التي يمكن للنموذج الاحتفاظ بها في وقت واحد، وتغطي كلاً من المدخلات التي ترسلونها والمخرجات التي يولّدها. إذا تجاوزت محادثة أو مستند هذا الحد، يضطر النموذج إلى إسقاط أو ضغط الرموز السابقة، مما قد يكلّفه سياقًا مهمًا. تتيح نافذة السياق الأكبر للنموذج العمل مع مدخلات أطول والبقاء متماسكًا عبر تبادلات أطول.