לקבוצת ביטוח ופיננסים ישראלית מובילה היה עוזר AI שהמציא תשובות ללא הרף. הפתרון לא היה מודל חכם יותר, אלא בנייה מחדש של תשתית הדאטה, וחסימת המודל מלענות כשהנתונים לא מגבים אותו.
העוזר ענה בשטף, ולעיתים קרובות המציא את מה שלא ידע. בארגון כפוף לרגולציה שבו המספרים קריטיים, תשובה שגויה שנאמרת בביטחון גרועה הרבה יותר מחוסר מענה.
לכן הפסקנו לגעת במודל ובדקנו את התשתית. הידע הארגוני היה מפוזר בין מערכות ERP, CRM, גיליונות אלקטרוניים ודוחות שירות ישנים, כשכל מקור מציג גרסה משלו לאמת. בקודי המוצר והחלפים התגלה פער של כ-30% בין המערכות, וחוסר העקביות הזה היה המקור הישיר להזיות: בכל שאילתה, מנגנון השליפה העלה רשומות סותרות, והמודל השלים את הפערים בניחושים.
המודל עשה בדיוק את העבודה שלו. תשתית הדאטה היא זו שאי אפשר היה לסמוך עליה, הסיבה האמיתית לכך שפרויקטי AI נכשלים על דאטה ארגוני.
שישה שלבים, לפי הסדר, ממיפוי הבלגן ועד החזרת המודל לפרודקשן על בסיס דאטה שאפשר לסמוך עליו.
עצרנו את המודל ומיפינו כל מקור מידע שהזין אותו (ERP, CRM, גיליונות אלקטרוניים ודוחות שירות ישנים), ואז כימתנו את הפערים. הפער של כ-30% בקודי המוצר בין המערכות היה הגורם המרכזי לתשובות המומצאות.
תהליך עיבוד רציף שמסיר כפילויות וסתירות, מנקה תווים משובשים מדוחות טקסט, ומנרמל נתונים גולמיים (תאריכים, מטבעות, קודים) לפורמט אחיד שמנגנון השליפה יכול להסתמך עליו.
כל יחידת מידע מתויגת לפי מחלקה, רמת רגישות ותוקף, ומסמכים ארוכים מפורקים למקטעים קטנים ועצמאיים, כדי ששכבת החיפוש תוכל לשלוף עובדה ספציפית בלי לגרור רעש רקע.
שכבת השליפה מחוברת למערכת ניהול הזהויות של הארגון, ובכל שאילתה בודקת מי השואל וחושפת למודל רק את הרשומות שאותו משתמש מורשה לראות. בקרת הגישה אינה טלאי חיצוני, אלא חלק בלתי נפרד מתהליך השליפה.
אם החיפוש לא מוצא התאמה בוודאות של 85% לפחות, המודל נחסם מלענות. תשובת ברירת מחדל קבועה ("המידע אינו קיים במערכת") מעבירה את הטיפול לנציג אנושי במקום לנחש.
חיברנו מחדש את המודל לדאטה הנקי, הרצנו בדיקות עומס ודיוק מול שאלות קצה מורכבות, והעלינו אותו לאוויר עבור עובדי השטח ומנהלי הסניפים, כשהוא עונה אך ורק על בסיס נתונים שהוא יכול לעמוד מאחוריהם.
הפתרון מעולם לא היה מודל מתקדם יותר, אלא תשתית שהמודל יכול לסמוך עליה, וכלל ברזל: כשאין ודאות, לא עונים.
העוזר עונה כעת רק על בסיס דאטה נקי ומסונן לפי הרשאות, מצטט את הרשומה שמאחורי כל תשובה, ומציין במפורש כשהמידע אינו קיים. הוא רץ בפרודקשן ומשמש את עובדי השטח ומנהלי הסניפים בכל הקבוצה.
פער הקודים של כ-30% בין המערכות (המקור הישיר להזיות) אותר ונפתר, ואף תשובה לא יוצאת מהמערכת ללא התאמה ברמת ודאות של 85% לפחות. מה שהיה פעם ניחוש הוא כעת העברה מבוקרת לטיפול אנושי.
משמעת היא שם המשחק: שליפת נתונים שמוגבלת להרשאות המשתמש, רף ודאות קשיח שלא נשען על תקוות, וגיבוי אנושי לכל שאלה שהדאטה לא מסוגל לענות עליה. זה ההבדל בין הדגמה נוצצת למערכת שארגון מפוקח באמת יכול להישען עליה. פער הביצוע, נסגר.
הפניות של פלטפורמת פינטק הוכפלו בימים, אבל אימון נציג לקח חודש. סימולטור אימון מבוסס AI וקופיילוט מעוגן קיצרו את ההכשרה ל-10 ימים והגדילו את המוקד ב-30% ללא הפרות ציות.
לפרויקט המלא ← אנונימיזציית דאטה · בריאותהדאטה הקליני של חברת מדטק היה נעול תחת חוקי פרטיות. מנוע הסרת-זיהוי מבוסס AI הסווה את פרטי המטופלים אך שמר על האות הקליני, שחרר טרה-בייטים בבטחה וקיצר את מחזור הפיתוח בכ-60%, בתאימות HIPAA מלאה.
לפרויקט המלא ←