חיפוש חזותי מאפשר לאנשים לחפש באמצעות תמונה במקום מילים. גלו כיצד הוא פועל, מהם הכלים העומדים מאחוריו וכיצד לבצע אופטימיזציה עבורו.

חיפוש חזותי הוא טכניקת חיפוש המזהה מה נמצא בתמונה, בסרטון או בתוכן חזותי אחר, ומריצה חיפוש על בסיס זה, במקום על בסיס מילות מפתח מוקלדות. במקום לתאר אובייקט במילים, המשתמש מכוון מצלמה או מעלה תמונה, והמערכת מזהה את האובייקט ומחזירה תוצאות דומות חזותית, התאמות מוצרים או מידע קשור. היא מסירה את החלק הקשה ביותר בחיפוש עבור שאילתות רבות: לנסח במילים משהו שאתם רואים אך אינכם יודעים לקרוא לו בשם.
לעניין זה יש חשיבות מכיוון שנתח הולך וגדל של הגילוי, במיוחד בקניות, מתחיל כיום בתמונה. כלים כמו Google Lens ו-Pinterest Lens הפכו את החיפוש החזותי למיינסטרים, ושינוי זה מכניס גורמי דירוג חדשים ההופכים את אופטימיזציית התמונות לחשובה כמו עבודת מילות המפתח המסורתית.
חיפוש חזותי הוא טכניקה מבוססת ראייה ממוחשבת המחלצת מאפיינים ניתנים למעקב מתוכן חזותי ומחפשת ברשת כדי לסווג ולהתאים אותם. במקום שחיפוש טקסטואלי שואל אילו מילים מתארות את זה, חיפוש חזותי שואל מה זה ומה נראה כמו זה. הקלט הוא תמונה, והפלט הוא קבוצת התאמות המדורגות לפי דמיון ורלוונטיות.
חשוב להפריד בין חיפוש חזותי לבין חיפוש תמונה הפוך. כלי חיפוש תמונה הפוך מוקדמים מצאו עותקים מדויקים של קובץ. חיפוש חזותי מודרני מבין את תוכן התמונה, מזהה סגנון כיסא מסוים או גזע כלב, ומוצא פריטים דומים מבחינה קונספטואלית גם כאשר אין קובץ זהה. הבנה סמנטית זו היא מה שהופך אותו לשימושי באמת עבור גילוי.
מאחורי הקלעים, חיפוש חזותי מסתמך על בינה מלאכותית, למידת מכונה וזיהוי תמונות, ובפרט על מודלים של למידה עמוקה הנקראים רשתות נוירונים קונבולוציוניות. רשתות אלה מחלצות מאפיינים חזותיים, צורה, צבע, מרקם ודפוסים מרחביים, מתוך תמונה. המערכת לאחר מכן משווה מאפיינים אלה מול מאגר נתונים של תוכן חזותי מאונדקס כדי למצוא התאמות או התאמות קרובות, ומדרגת את התוצאות לפי מידת הדמיון והרלוונטיות שלהן.
באופן מכריע, מנועים אלה אינם מסתמכים על פיקסלים בלבד. הם גם מעריכים מטא-נתוני תמונה, טקסט חלופי (alt), שמות קבצים, כיתובים וסימון סכימה, כדי להוסיף הקשר סמנטי. זיהוי אובייקטים מאפשר למערכת לזהות מספר פריטים בתמונה אחת על ידי ציור גבולות וירטואליים סביב כל אחד מהם. והמודלים ממשיכים להשתפר: ככל שהם רואים יותר קלט חזותי, כך הם הופכים מדויקים יותר ומודעים יותר להקשר, מה שקושר את החיפוש החזותי להתקדמות המתמשכת של בינה מלאכותית מולטימודלית.
Google Lens הוא הדוגמה הרחבה ביותר. הוא יכול להבין למה אתם מסתכלים ולפעול בהתאם: לתרגם טקסט, לזהות צמחים ובעלי חיים, לחקור נקודות ציון, למצוא מוצרים ולהציף תמונות דומות חזותית. הוא משווה אובייקטים בתמונה שלכם לתמונות אחרות, מדרג אותן לפי דמיון, ומושך תוצאות רלוונטיות מרחבי הרשת.
Pinterest Lens נוקט זווית צרה יותר, ממוקדת אורח חיים, המכוונת לאופנה, עיצוב הבית והשראה, עם שילוב קניות חזק. מעבר לכלים אלה, Amazon StyleSnap, eBay Image Search, IKEA Kreativ, Sephora Virtual Artist ו-ASOS Style Match כולם משתמשים בחיפוש מבוסס תמונה כדי להניע גילוי מוצרים, וזו הסיבה שהחיפוש החזותי חופף במידה רבה כל כך עם קניות מונעות בינה מלאכותית.
ההבדל היסודי הוא הקלט. חיפוש טקסטואלי מחייב אתכם לנסח את מה שאתם רוצים, בעוד שחיפוש חזותי מאפשר לכם להראות זאת. הדבר מבטל את החיכוך שבתיאור פריט כאשר אינכם יודעים את שמו, מצב נפוץ באופנה, ריהוט וקניות מבוססות סגנון, שבהן אוצר המילים מאכזב את רוב האנשים.
השניים משלימים זה את זה. חיפוש טקסטואלי נותר הטוב ביותר עבור שאילתות מופשטות או אינפורמטיביות, בעוד שחיפוש חזותי מצטיין ברגעים קונקרטיים של "רואה ורוצה". הגבול מיטשטש יותר ויותר ככל שמנועים מקבלים תמונה יחד עם חידוד טקסטואלי, דפוס מולטימודלי המצוי לצד אופטימיזציית חיפוש מולטימודלית והמעבר הרחב יותר לעבר חיפוש בינה מלאכותית.
חיפוש חזותי מכניס גורמי דירוג חדשים, איכות תמונה, גודל ורלוונטיות הקשרית, ההופכים את אופטימיזציית התמונות לקריטית כמו אופטימיזציית מילות מפתח מסורתית. עבור מסחר אלקטרוני, המקרה העסקי חזק. יותר מ-50 אחוז מהצרכנים אומרים שמידע חזותי משפיע יותר מטקסט על החלטות רכישה, והקמעונאית ThredUp דיווחה כי חיפושי תמונות מובילים לשיעורי המרה גבוהים ב-85 אחוז.
תוצאות הפלטפורמות מחזקות זאת. IKEA Kreativ ראתה משכי הפעלה ארוכים כמעט פי שניים, Sephora Virtual Artist דיווחה על עלייה של 80 אחוז בשיעורי ההמרה עבור משתמשי הנסיון הוירטואלי, ו-ASOS Style Match אפשרה גילוי מוצרים מהיר יותר ב-35 אחוז כאשר החיפוש החזותי מהווה למעלה מ-10 אחוז מרכישות האפליקציה. שוק זיהוי התמונות הבסיסי צפוי לצמוח מ-46.7 מיליארד דולר ב-2024 ל-98.6 מיליארד דולר עד 2029, מה שמאותת עד כמה זה הופך למרכזי.
התחילו בתמונות עצמן. השתמשו בתמונות ייחודיות ברזולוציה גבוהה במקום בתמונות סטוק, תנו להן שמות קבצים תיאוריים התואמים את תוכנן, כתבו טקסט חלופי (alt) מפורט עם מילות מפתח רלוונטיות, והוסיפו כיתובים מועילים להקשר. איתותים אלה נותנים למנוע הזיהוי את העוגנים הסמנטיים שהוא משתמש בהם לצד הפיקסלים, וזהו לב אופטימיזציית חיפוש תמונות.
בצד הטכני, החילו סימון schema.org כדי שמנועים יבינו את תוכן התמונות, צרו מפות אתר לתמונות, ודאו רספונסיביות לנייד וטעינה מהירה, ויישמו נתונים מובנים לזכאות לתוצאות עשירות. עבור פלטפורמות, הפכו תמונות לניתנות ל"פין" ותייגו אותן היטב עבור Pinterest, שמרו על תיאורים ברורים עבור Google Lens, וקשרו תמונות לעמודי מוצר. שילוב זה עם מחקר מילות מפתח ותכנון תוכן ממושמע מיישר את התמונות שלכם עם הכוונה שמאחורי השאילתות החזותיות.
בעוד שקמעונאות מובילה, החיפוש החזותי מגיע רחוק יותר. בתחום הבריאות הוא מסייע בזיהוי מצבים גלויים, בנדל"ן הוא מציף נכסים דומים, וברכב הוא מאתר דגמי רכב תואמים. נוסעים משתמשים בו כדי לזהות נקודות ציון ולתרגם תפריטים, וסטודנטים משתמשים בו כדי לזהות צמחים, יצירות אמנות או אובייקטים לא מוכרים במבט.
החוט המשותף זהה לזה שבקניות: למשתמש יש משהו לנגד עיניו שקשה לו לתאר. לכל עסק שמוצריו או מידעו ניתנים לזיהוי מתמונה יש סיבה להפוך את התוכן החזותי שלו לניתן לגילוי, מה שמרחיב את החיפוש החזותי הרבה מעבר לעמוד הקטלוג ואל תוך פרקטיקת אופטימיזציית התמונות הכללית.
דיוק החיפוש החזותי תלוי באיכות התמונה ובמידת האימון של המודל עבור תחום נתון. תאורה גרועה, רקעים עמוסים או זוויות חריגות עלולים לבלבל את הזיהוי, ומוצרי נישה שהמודל ראה לעיתים רחוקות עשויים להתאים בצורה גרועה. עבור בעלי אתרים, התוצאות תלויות גם בפלטפורמות שאינן בשליטתם, שכן Google ו-Pinterest מחליטות כיצד התוצאות מוצגות.
קיימים גם פערי מדידה. קשה יותר לעקוב אחר ייחוס ביקורים המונעים על ידי חיפוש חזותי מאשר אחר תעבורת מילות מפתח, כך שהוכחת ההשפעה עלולה להיות קשה. הגישה האמינה היא להתייחס לאופטימיזציית תמונות חזקה כאל היגיינה בסיסית המשתלמת בחיפוש תמונות רגיל, בחיפוש חזותי ובתשובות בינה מלאכותית כאחד, במקום להמר על תכונה של פלטפורמה בודדת כלשהי.
חיפוש חזותי מאפשר לאנשים לחפש באמצעות תמונה במקום מילים, תוך שימוש בראייה ממוחשבת כדי לזהות את תוכן התמונה ולהתאים אותו מול תוכן חזותי מאונדקס. הוא מעצב מחדש את הגילוי, במיוחד במסחר, שבו הוא מעלה את שיעורי ההמרה ומקצר את הדרך מראייה לקנייה. עבור משווקים, המסקנה קונקרטית: תמונות באיכות גבוהה, מטא-נתונים תיאוריים, סכימה ומפות אתר לתמונות חשובים כיום כמו מילות מפתח.
כדי להעמיק בנושא, קשרו זאת לאופטימיזציית חיפוש תמונות ולאופטימיזציית חיפוש מולטימודלית, והשתמשו בכלי המחקר ותכנון התוכן של Sorank כדי ליישר את התוכן החזותי שלכם עם הכוונה האמיתית. מקורות: G2 ו-Ignite Visibility.
כלי חיפוש תמונה הפוך מוקדמים מצאו בעיקר עותקים מדויקים של קובץ ספציפי ברחבי הרשת. חיפוש חזותי מודרני מבין את התוכן בפועל של תמונה באמצעות למידה עמוקה, כך שהוא יכול לזהות אובייקט או סגנון ולמצוא פריטים דומים מבחינה קונספטואלית גם כאשר לא קיים קובץ זהה. הבנה סמנטית זו היא מה שהופך אותו לשימושי עבור גילוי מוצרים והשראה.
Google Lens הוא הרחב ביותר, מסוגל לזהות אובייקטים, טקסט, צמחים, נקודות ציון ומוצרים ולמצוא תמונות דומות חזותית ברחבי הרשת. Pinterest Lens מתמקד באורח חיים, אופנה ועיצוב עם קישורי קניות חזקים. קמעונאים גם מפעילים מנועים משלהם, ובהם Amazon StyleSnap, eBay Image Search, IKEA Kreativ, Sephora Virtual Artist ו-ASOS Style Match.
השתמשו בתמונות ייחודיות ברזולוציה גבוהה עם שמות קבצים תיאוריים, טקסט חלופי (alt) מפורט וכיתובים מועילים כדי שמנועים יוכלו לקרוא את ההקשר הסמנטי סביב הפיקסלים. הוסיפו סימון schema.org, צרו מפות אתר לתמונות, וודאו טעינה מהירה בנייד. עבור פלטפורמות, הפכו תמונות לניתנות ל"פין" עבור Pinterest ושמרו על תיאורים ברורים עבור Google Lens, וקשרו כל תמונה לעמוד המוצר או התוכן שלה.