לקבוצת ביטוח ופיננסים ישראלית מובילה היה עוזר AI שלא הפסיק להמציא תשובות. הפתרון לא היה מודל חכם יותר, אלא לבנות מחדש את הדאטה שמתחתיו, ולא לתת למודל לדבר כשהדאטה לא מגבה אותו.
העוזר ענה שוטף, ולעיתים קרובות המציא את מה שלא ידע. בעסק תחת רגולציה שבו המספרים קריטיים, תשובה שגויה שנאמרת בביטחון גרועה יותר מלא לענות בכלל.
אז הפסקנו לעבוד על המודל והסתכלנו מתחתיו. הידע של הארגון היה מפוזר על פני מערכת ERP, מערכת CRM, גיליונות אלקטרוניים ושנים של דוחות שירות ישנים, שכל אחד מחזיק גרסה משלו לאמת. בקודי המוצר והחלקים היה פער של כ-30% בין המערכות, וחוסר העקביות הזה היה המקור הישיר להזיות: כשנשאלה שאלה, האחזור העלה שוב ושוב רשומות סותרות, והמודל מילא את הפערים בניחוש.
המודל עשה בדיוק את מה שנאמר לו. תשתית הדאטה היא זו שלא ניתן היה לסמוך עליה, הסיבה האמיתית לכך ש-AI נכשל על דאטה ארגוני.
שישה מהלכים, לפי הסדר, ממיפוי הבלגן ועד החזרת המודל לפרודקשן על דאטה שאפשר לסמוך עליו.
עצרנו את המודל ומיפינו כל מקור שהזין אותו (ERP, CRM, גיליונות אלקטרוניים ודוחות שירות ישנים), ואז כימתנו את הפערים. הפער של כ-30% בקודי המוצר בין המערכות היה הגורם מספר אחת לתשובות המומצאות.
עיבוד רציף שמסיר כפילויות וסתירות, מנקה תווים משובשים מדוחות טקסט, ומנרמל ערכים גולמיים (תאריכים, מטבעות, קודים) לפורמט אחיד אחד שהאחזור יכול להסתמך עליו.
כל יחידת מידע מתויגת במחלקה שלה, ברמת הרגישות ובתוקף, ומסמכים ארוכים מפורקים למקטעים קטנים ועצמאיים, כך ששכבת החיפוש יכולה לשלוף עובדה אחת ספציפית בלי לגרור רעש רקע.
שכבת האחזור, מחוברת לספריית הזהויות של הארגון, בודקת בכל שאילתה מי שואל וחושפת למודל רק את הרשומות שאותו משתמש באמת מורשה לראות. בקרת הגישה היא לא תוספת שהודבקה מבחוץ. היא חלק מהאחזור.
אם החיפוש לא מוצא התאמה בוודאות של 85% לפחות, אסור למודל לענות. גיבוי קבוע ("המידע אינו במערכת המעודכנת") מעביר את השאלה לאדם במקום לניחוש.
חיברנו מחדש את המודל לדאטה הנקי, הרצנו בדיקות עומס ודיוק מול שאלות מקרי קצה קשות, והעלינו אותו לאוויר עבור עובדי שטח ומנהלי סניפים, כשהוא עונה רק מדאטה שהוא יכול לעמוד מאחוריו.
הפתרון מעולם לא היה מודל טוב יותר, אלא תשתית שהמודל יכול לסמוך עליה, וכלל ברור: כשאין ודאות, לא עונים.
העוזר עונה כעת רק מדאטה נקי ומסונן לפי הרשאות, מצטט את הרשומה שמאחורי כל תשובה, ואומר במפורש כשהמידע לא קיים. הוא רץ בפרודקשן עבור עובדי שטח ומנהלי סניפים בכל הקבוצה.
פער הקודים של כ-30% בין המערכות (המקור הישיר להזיות) אותר ונפתר, ושום תשובה כבר לא יוצאת מהמערכת בלי התאמה ברמת ודאות של 85% לפחות. מה שהיה פעם ניחוש הוא כעת העברה מבוקרת לאדם.
המשמעת היא העיקר: אחזור מוגבל למה שכל משתמש רשאי לראות, רף ודאות אמיתי ולא כזה שנשען על תקווה, וגיבוי אנושי לכל מה שהדאטה לא יכול לענות עליו. זה המרחק בין הדגמה שמסנוורת פעם אחת למערכת שעסק תחת רגולציה באמת יכול להישען עליה. פער הביצוע, סגור.
הפניות של פלטפורמת פינטק הוכפלו בימים, אבל אימון נציג לקח חודש. סימולטור אימון מבוסס AI וקופיילוט מעוגן קיצרו את ההכשרה ל-10 ימים והגדילו את המוקד ב-30% ללא הפרות ציות.
לפרויקט המלא ← אנונימיזציית דאטה · בריאותהדאטה הקליני של חברת מדטק היה נעול תחת חוקי פרטיות. מנוע הסרת-זיהוי מבוסס AI הסווה את פרטי המטופלים אך שמר על האות הקליני, שחרר טרה-בייטים בבטחה וקיצר את מחזור הפיתוח בכ-60%, בתאימות HIPAA מלאה.
לפרויקט המלא ←