מודלי שפה קטנים (SLM) הם מודלי AI קומפקטיים עם פחות פרמטרים, שנבנו למען מהירות, עלות ופרטיות. גלו כיצד הם פועלים ובמה הם שונים מ-LLM.

מודלי שפה קטנים הם גרסאות קומפקטיות של מודלי שפה שמבינים ומייצרים שפה טבעית תוך שימוש בפחות הרבה יותר פרמטרים מהמקבילים הגדולים שלהם. במקום שבו מודל גדול עשוי להכיל מאות מיליארדי או טריליוני פרמטרים וידע כללי רחב, מודל קטן נע בין מיליונים לכמה מיליארדי פרמטרים ומכוונן למשימה צרה ומתמחה יותר.
המשיכה היא מעשית. גודל קטן יותר משמעו הסקה (inference) מהירה יותר, עלות נמוכה יותר, והיכולת לרוץ על טלפון, מחשב נייד או התקן קצה במקום מרכז נתונים. ככל שצוותים מגלים שרוב המשימות היומיומיות לא זקוקות למודל ענק, מודלי SLM צוברים תאוצה אמיתית, והם מפעילים יותר ויותר את שלבי האחזור וההיסק שמאחורי חיפוש מבוסס AI.
מודל שפה קטן הוא קרוב קטן ומתמחה יותר של מודל שפה גדול, שקל יותר להתאים אישית וזול יותר להריץ. כמות הפרמטרים נעה בדרך כלל בין כמה מיליונים לכמה מיליארדים, לעומת מאות המיליארדים או הטריליונים במודלים הגדולים ביותר. הקומפקטיות הזו היא המאפיין המגדיר, וכל השאר נובע ממנה.
באופן קריטי, מודלי SLM בדרך כלל מאומנים או מכווננים על נתונים ממוקדים וספציפיים לתחום ולא על כל האינטרנט הציבורי. מודל שאומן על טקסט רפואי, לדוגמה, יכול לתת תשובות חדות יותר בתחום הבריאות ממודל כללי, למרות שהוא יודע הרבה פחות על העולם באופן כללי. הם חולקים את אותו יסוד טרנספורמר כמו LLM, רק בקנה מידה קטן בהרבה.
מודלי SLM נגזרים לעיתים קרובות ממודלים גדולים יותר באמצעות דחיסה. זיקוק ידע (knowledge distillation) מאמן מודל "תלמיד" קטן יותר לשחזר את ההתנהגות של מודל "מורה" גדול יותר, ומעביר חלק ניכר מהיכולת שלו לגודל שהוא שבריר ממנו. קוונטיזציה (quantization) מפחיתה את הדיוק המספרי, למשל מערכי 32 סיביות ל-8 סיביות, מה שמקטין את המודל ומאיץ אותו תוך שמירה על דיוק סביר.
גיזום (pruning) מסיר נוירונים או שכבות מיותרים שתורמים מעט, ומצמצם את המודל עוד יותר. מעבר לכך, שיטות כיוונון עדין (AI fine-tuning) יעילות בפרמטרים כמו LoRA מתאימות מודל בסיס לתחום ספציפי במהירות ובזול. יחד, הטכניקות הללו הופכות מודל יסוד כבד למשהו קליל וממוקד.
הפשרה המרכזית היא בין רוחב ליעילות. מודלי LLM מצטיינים בהיסק כללי, יצירתיות ומשימות רב-לשוניות מכיוון שהם אומנו על נתונים עצומים ומגוונים. מודלי SLM מחליפים את ההיקף הרחב הזה במהירות, עלות נמוכה ודיוק בתחום, ומתפקדים היטב במשימות ממוקדות אך חלשים יותר במבחני השוואה שדורשים ידע כללי רחב.
פער המשאבים דרמטי. אימון מודל חזית (frontier model) עשוי לדרוש עשרות אלפי GPU ברמה גבוהה הפועלים במשך חודשים, בעוד שניתן לאמן ולהריץ SLM עם שבריר קטן מזה. בזמן הסקת AI (AI inference), SLM יכול לרוץ על משאבי סמארטפון, בעוד שמודל גדול לרוב זקוק למספר מעבדים מקבילים. עבור מודלי היסק מורכבים, האפשרות הגדולה עדיין מנצחת.
עלות ואנרגיה באות ראשונות. מכיוון שהסקה היא הוצאה מתמשכת, הרצת מודל קומפקטי בקנה מידה גדול זולה בהרבה וצורכת פחות אנרגיה משמעותית ממודל גדול. זמן השהיה (latency) הוא הניצחון השני: מודלי SLM מגיבים במהירות עם זמן קצר לטוקן הראשון, מה שמתאים לשימושים בזמן אמת כמו תמיכת לקוחות.
גמישות בפריסה היא היתרון השלישי. מודלי SLM רצים על המכשיר עצמו, בתשתית מקומית, או בקצה על חומרה סטנדרטית, מה שגם מחזק את הפרטיות מכיוון שנתונים רגישים אף פעם לא צריכים לעזוב את המכשיר לענן. לבסוף, הגודל הקטן שלהם הופך את הכיוונון העדין למהיר, כך שצוותים יכולים להתאים מודל לתחום נישתי תוך שעות במקום שבועות.
הצד השני של ההתמחות הוא הצרות. מודלי SLM מתפקדים פחות טוב במבחני השוואה של ידע כללי רחב ומתקשים בהיסק מורכב על פני תחומים רבים. כשדוחפים אותם מעבר לתחום שעליו אומנו, הם נוטים יותר לספק תשובות בטוחות אך שגויות, כך שהאמינות שלהם תלויה במידה רבה בהישארות בתוך התחום.
יש להם גם חלונות הקשר קטנים יותר ופחות יכולת הסתגלות על פני תחומים מרובים, והם דורשים ניטור מתמשך לשינויי תחום ככל שהעולם משתנה. הכלל המעשי הוא להתאים את המודל למשימה: להשתמש במודל קטן כשהמשימה ממוקדת ומוגדרת היטב, ולפנות לגדול כשרוחב או היסק עמוק חיוניים.
מודלי SLM בולטים במשימות ממוקדות בנפח גבוה. צ'אטבוטים לשירות לקוחות שאומנו על ידע ספציפי לחברה עונים בדיוק ובזול. חילוץ נתונים פשוט, סיכום ותרגום פועלים היטב עם זמן השהיה נמוך. עוזרים על המכשיר ואפליקציות במצב לא מקוון נסמכים עליהם מכיוון שהם לא זקוקים לחיבור לענן.
הם גם מתאימים באופן טבעי למערכות אג'נטיות (agentic), שבהן קריאות מודל רבות, קטנות ומהירות מאוטמות שלבים בזרימת עבודה. דוגמאות קונקרטיות למודלים קטנים מוכשרים כוללות את משפחת Phi, את Llama 3 8B ואת Mistral 7B, שמראות שכמה מיליארדי פרמטרים יכולים להתמודד ביעילות עם מגוון רחב של משימות יומיומיות.
מודלי SLM ממוקמים יותר ויותר בתוך צינור החיפוש. מחקר על שכתוב שאילתות מצא שמודלים קטנים ביצעו באופן דומה למודלים גדולים בשבריר מהעלות, כך שמנועים ועוזרים משתמשים בהם כדי לנסח מחדש שאילתות, לסווג כוונה ולעבד מראש תוכן לפני שמודל גדול יותר מרכיב את התשובה הסופית. הבנת זה עוזרת להסביר כיצד מערכות AI קוראות את העמודים שלכם.
עבור אופטימיזציה למנועים גנרטיביים, המסקנה היא שמודלים קומפקטיים לרוב מבצעים את הקריאה וההכוונה. תוכן ברור, מובנה היטב וממוקד בתחום קל יותר למודל קטן לנתח, לחלץ ולעשות בו שימוש חוזר. אותן תכונות שעוזרות לLLM בקוד פתוח לבסס את תשובותיהם על התוכן שלכם עוזרות גם למודלים קטנים להציג אותו במדויק.
התעשייה עוברת מתפיסת "גדול יותר טוב יותר" למודלים בגודל הנכון. צוותי ייצור מבינים שמודל קטן ומתמחה מטפל ברוב העבודה השגרתית בשבריר מהעלות וזמן ההשהיה של מודל חזית, ומשאיר את המודלים הגדולים לשאילתות הקשות ביותר. חלוקה זו, מודלים קטנים למשימות שגרתיות ומודלים גדולים להיסק מורכב, הופכת לארכיטקטורת ברירת המחדל.
עבור משווקים, המשמעות היא עמידות לאורך זמן. ככל שיותר הסקה עוברת למודלים קומפקטיים ויעילים, הפרמיה על תוכן נקי, מובנה ועקבי מבחינה עובדתית רק גדלה, מכיוון שזה מה שכל מודל, גדול או קטן, יכול להבין ולצטט בצורה הכי אמינה.
מודלי שפה קטנים מחליפים את הידע הרחב של מודלים גדולים במהירות, עלות נמוכה, פרטיות ודיוק בתחום, ונבנים באמצעות זיקוק, קוונטיזציה, גיזום וכיוונון עדין יעיל. הם מצטיינים במשימות ממוקדות ובפריסה על המכשיר, בעוד שמודלים גדולים נשארים הבחירה עבור היסק רחב. יותר ויותר, מודלים קטנים מבצעים את הקריאה וההכוונה בתוך חיפוש מבוסס AI.
גלו כיצד הם קשורים לנוף הLLM הרחב יותר ולכיוונון עדין (AI fine-tuning), והשתמשו בכלי המחקר ותכנון התוכן של Sorank כדי לבנות תוכן שכל מודל יכול לנתח ולצטט. מקורות התייחסות: Red Hat ו-DataCamp.
גודל ומיקוד. למודל שפה קטן יש מיליוני עד כמה מיליארדי פרמטרים והוא מכוונן למשימות ספציפיות וממוקדות, בעוד שלמודל שפה גדול יש מיליארדי עד טריליוני פרמטרים וידע כללי רחב. מודלים קטנים מהירים יותר, זולים יותר ויכולים לרוץ על טלפון, אך מודלים גדולים מתמודדים עם היסק מורכב ותחומים מגוונים הרבה יותר טוב.
רובם נגזרים ממודלים גדולים יותר באמצעות דחיסה. זיקוק ידע מאמן מודל "תלמיד" קטן להעתיק מודל "מורה" גדול יותר, קוונטיזציה מפחיתה את הדיוק המספרי כדי לכווץ את המודל, וגיזום מסיר נוירונים או שכבות מיותרים. שיטות כיוונון עדין יעילות בפרמטרים כמו LoRA מתאימות לאחר מכן את התוצאה לתחום ספציפי במהירות ובעלות נמוכה.
מודלים קטנים לרוב מטפלים בשלבי התמיכה בחיפוש מבוסס AI, כגון שכתוב שאילתות, סיווג כוונה ועיבוד מקדים של תוכן, מכיוון שהם מתפקדים באופן דומה למודלים גדולים במשימות אלה בעלות נמוכה בהרבה. משמעות הדבר היא שמודלים קומפקטיים לעיתים קרובות מבצעים את קריאת העמודים שלכם, כך שתוכן ברור, מובנה וממוקד בתחום קל יותר עבורם לנתח, לחלץ ולצטט.