בפלטפורמה שמריצה מיליוני חיפושים ביום, התוצאה בראש העמוד היא חזות הכל. אצלם, התוצאה הזו הייתה לרוב שגויה, ושכבת ה-AI שנועדה לסייע הציגה לעיתים בריכה, נוף או מחיר שלא היו קיימים במציאות. כתוצאה מכך, המטיילים פשוט נטשו.
מנוע החיפוש שלהם ידע לבצע התאמה מדויקת של מילים, אך החמיץ את כוונת המשתמש. חיפוש כמו "מלון שקט למשפחות עם בריכה מחוממת" שיבש לחלוטין את דירוג התוצאות, מכיוון שהמערכת התמקדה במילות מפתח והחמיצה את ההקשר. הנכס המתאים ביותר היה קיים בקטלוג, הוא פשוט מעולם לא הגיע לראש העמוד.
כפתרון זמני, החברה הוסיפה שכבת מענה גנרטיבית. אלא שהיא רק החמירה את המצב: המערכת הציגה בביטחון מלא מתקנים, מרחקים ומחירים שלא היו קיימים במציאות. מטיילים שהזמינו חופשה על בסיס נתונים מומצאים כאלה, לא נשארו לקוחות מרוצים לאורך זמן.
בבסיס שתי הבעיות עמד פער זהה: המודלים אומנו על בסיס סיגנלים אוטומטיים ללא בקרת איכות אנושית, ולא היה בנמצא סט ייחוס מאומת ומתויג שניתן לאמן מולו. ללא העוגן הזה, רמת הדיוק נשחקה בהדרגה ובשקט, מבלי שלחברה תהיה יכולת למדוד את היקף הפגיעה.
סט ייחוס מאומת, מודלים המכוילים לכוונת המשתמש, ומנגנוני אימות עובדות שפועלים ללא הפסקה.
הקמנו תהליך בקרת איכות שבו מומחי תוכן עברו על מאות אלפי שאילתות חיפוש אמיתיות, דירגו את איכות התוצאות והזינו משוב מדויק ומובנה בחזרה למערכת.
הדאטה המתויג הזה הפך לסט ייחוס מאומת, שהיה לנכס הנתונים האיכותי ביותר שהחזיק הארגון מעולם, ושימש כעוגן לאימון המודלים ולמדידת הדיוק לאורך זמן.
באמצעות הדאטה המאומת, אימנו מחדש את מודלי החיפוש וההמלצות כדי לחבר בין כוונת המטייל להתאמה המדויקת ביותר בקטלוג. כעת, גם שאילתה מורכבת בשפה טבעית מחזירה את המיקום הנכון, ולא רק את מילת המפתח הקרובה ביותר.
הטמענו סוכנים אוטונומיים שמנטרים את שכבת המענה הגנרטיבית בזמן אמת, מצליבים את הפלט שלה מול מסד הנתונים העובדתי של החברה, ומזהים כל פרט מומצא ברגע שהוא נוצר.
כל פלט שהמערכת אינה יכולה לייחס למקור מוסמך נחסם עוד לפני שהוא מוצג למשתמש. המערכת מעדיפה להציג פחות מידע, מאשר להציג מידע שגוי.
תהליכי הבדיקה הללו רצים באופן רציף, מה שמבטיח שהרלוונטיות תישמר לאורך זמן והמודלים לא ייסחפו בחזרה להתנהגותם הישנה לאחר סיום שלב ההשקה.
התאמות מדויקות יותר ואפס נתונים מומצאים הפכו את הגלישה באתר להזמנות בפועל.
רמת הדיוק והרלוונטיות של התוצאות בעמוד הראשון עלתה בכ-35%, מה שהוביל לזינוק מיידי במעורבות הגולשים. למעלה מ-200,000 שאילתות תויגו ודורגו בתהליך, והפכו לנכס הדאטה החזק ביותר של הארגון לכל הפרויקטים הבאים.
התלונות על הצגת פרטים מומצאים או שגויים באתר צנחו ב-80%, ויחד איתן זינק שיעור ההמרה מחיפוש להזמנה בפועל. המשתמשים מצאו בדיוק את מה שחיפשו, סמכו על המידע שהוצג להם, והשלימו את ההזמנה.
אי אפשר להגיע לרמת רלוונטיות גבוהה באמצעות כיול על גבי דאטה שלא עבר בקרת איכות. השיפור המשמעותי הושג קודם כל בזכות סט ייחוס המאומת, לאחר מכן באמצעות הכיול, ולבסוף הודות למנגנוני אימות העובדות ששומרות על דיוק השכבה הגנרטיבית בפרודקשן. זהו בדיוק הלקח שעומד מאחורי עבודת מוכנות הדאטה שלנו: המודל הוא רק לעיתים נדירות הרכיב השבור. הבעיה היא כמעט תמיד בדאטה.
הדאטה הקליני של חברת מדטק היה נעול תחת חוקי פרטיות. מנוע de-identification מבוסס AI הסווה את פרטי המטופל אך שמר על האות הקליני, שחרר טרה-בייטים בבטחה וקיצר את מחזור הפיתוח בכ-60%, בציות מלא ל-HIPAA.
לפרויקט המלא ← מוכנות דאטה · ביטוחה-AI של קבוצת ביטוח ישראלית מובילה המשיך להזות. גילינו שהמקור הוא אי-התאמה של כ-30% בדאטה, בנינו מחדש את הצינור, ושמנו רצפת ביטחון נוקשה של 85% מתחת לכל תשובה.
לפרויקט המלא ←