AIפרודקשןהערכה

איך מוודאים שה-AI שלכם לא טועה?

החדר מלא, ההדגמה עוברת חלק, ואז מישהו שואל את השאלה היחידה שבאמת משנה: איך אתם יודעים שהוא לא טועה? תחושת בטן היא לא תשובה. הנה התשובה האמיתית.

החדר מלא, המסך דולק, ומערכת ה-AI עבדה בצורה מושלמת במשך שלושה שבועות של הדגמות. מישהו כבר מושיט יד למתג כדי להעלות אותה לאוויר מול לקוחות אמיתיים, ואז קול שקט שואל את השאלה היחידה שבאמת משנה: איך נדע בוודאות שהוא לא טועה? לאף אחד אין נתונים מדויקים, רק תחושת בטן טובה.

תחושת בטן היא לא הוכחה. כדי לדעת אם ה-AI באמת מדויק, לא מסתמכים על הדגמה אלא על הערכה מובנית: בדיקה יזומה של המערכת מול תרחישים שבהם התשובה הנכונה כבר ידועה לכם מראש, שמריצים עוד לפני שהמערכת פוגשת לקוח קצה, וממשיכים להריץ באופן קבוע גם לאחר מכן. הדגמה מראה שה-AI מסוגל לספק תשובה נכונה פעם אחת. הערכה מראה באיזו תדירות הוא מדייק, ובאילו נקודות בדיוק הוא נכשל.

הדגמה היא ההוכחה הכי מסוכנת שיש לכם

הדגמה היא כמו סרטון של רגעי השיא. היא מציגה את המסלול האופטימלי על גבי קלט נוח וידידותי שבחר מפתח המערכת. בפרודקשן, המציאות הפוכה לגמרי: עומס המשימות של יום שלישי אחר הצהריים, מסמך סרוק שהוזן קצת עקום, או לקוח שלא יודע להסביר את הבעיה שלו כמו שצריך. לשפוט מערכת AI לפי ההדגמה שלה זה כמו להעריך ביצועים של מכונית לפי המראה שלה באולם התצוגה. זה בדיוק הפער בין מחיאות הכפיים בחדר הישיבות לשקט המדאיג בפרודקשן, פער שתוקע כל כך הרבה פיילוטים והוא הסיבה המרכזית לכך שרובם לעולם לא מגיעים לפרודקשן.

הגדירו את מפתח התשובות לפני שאתם סומכים על הפלט

הערכה יסודית דורשת 'סט זהב': כמה מאות מקרים אמיתיים שנלקחו מתוך הפעילות השוטפת שלכם, כאשר עבור כל מקרה כבר קיימת תוצאה נכונה שאושרה על ידי גורם אנושי. לא מדובר במקרים הקלים ביותר, אלא במקרים מייצגים, כולל, באופן מכוון, התרחישים המורכבים, הנדירים והרגישים ביותר, שבהם כל טעות עלולה לעלות ביוקר. לאחר מכן מריצים את ה-AI על גבי הסט הזה ומודדים ארבעה פרמטרים:

רק בשלב הזה יש בידיכם נתון מספרי מדויק במקום תחושת בטן, והוכחה מוצקה שאפשר להציג בגאווה לכל מי ששואל.

הגדירו רף שאותו לא עוברים

הכלל שהופך את המערכת לבטוחה

כאשר רמת הביטחון יורדת מתחת לרף מוגדר, ה-AI לא מקבל החלטה בעצמו אלא מעביר את הטיפול לגורם אנושי. חברת ביטוח שעבדנו איתה, למשל, הגדירה רף ביטחון קשיח של 85% עבור כל פלט, כאשר כל מקרה שמתחת לרף מועבר אוטומטית לבדיקה אנושית. למערכת מותר לא לדעת, אבל אסור לה בשום אופן לנחש בשקט.

תהליך ההערכה הוא זה שמראה לכם בדיוק איפה לקבוע את הרף הזה. זהו הצעד שהופך את האמירה "זה בדרך כלל עובד" לקביעה חד-משמעית: "זה עובד, והנה בדיוק מה שקורה במקרי הקצה". זה ההבדל בין מערכת AI שאתם מקווים שהיא תקינה, לבין מערכת שאתם יכולים להוכיח את האמינות שלה במספרים.

הערכה היא תהליך קבוע, לא אבן דרך חד-פעמית

העולם לא קופא על שמריו אחרי ההשקה. המודלים נשחקים, הדאטה משתנה, ספקים מעדכנים פורמטים, והמדדים של אתמול כבר לא רלוונטיים היום. הערכה חד-פעמית היא כמו תמונת סטילס, בזמן שפרודקשן דורש וידאו בשידור חי. המערכות היציבות באמת מריצות בדיקות באופן רציף ומרימות דגל אדום ברגע שרמת הדיוק יורדת, בדומה למשמעת של בודקי עובדות קפדניים שפוסלים כל טענה שאי אפשר לאמת מול מקור מוסמך. אם מדדתם את הביצועים רק פעם אחת, אין לכם מושג אם ה-AI מדויק היום. אתם רק יודעים שהוא היה מדויק ביום שבו בדקתם אותו. הבדיקות שצריך להריץ לפני ההשקה הראשונה הן סיפור אחר לגמרי, וכבר ריכזנו אותן עבורכם.

אף אחד מהשלבים האלה אינו נוצץ, ושום דבר מזה לא בא לידי ביטוי בהדגמה מהירה. וזו בדיוק הנקודה. השאלה "איך תדעו שהוא לא טועה?" אולי נשמעת טכנית, אבל היא עוסקת בליבת האמון: אי אפשר להנגיש ללקוחות או לרגולטור מערכת AI שאתם ערבים לביצועיה רק על בסיס תחושת בטן. הגדירו קודם כל את מפתח התשובות. הביטחון והשקט הנפשי כבר יגיעו בעקבותיו.

שאלות נפוצות

מה ההבדל בין הדגמה להערכה?

הדגמה מראה שמערכת ה-AI מסוגלת לספק תשובה נכונה באופן חד-פעמי, על גבי קלט שנבחר בקפידה מראש. הערכה, לעומת זאת, מודדת את אחוזי הדיוק לאורך מאות תרחישים אמיתיים מהשטח, כולל אלו שבדרך כלל 'שוברים' הדגמות סטנדרטיות.

מה צריך להיות הגודל של סט ההערכה?

הוא צריך להיות גדול מספיק כדי לייצג את מגוון התרחישים האמיתי שלכם, כולל מקרי קצה ומצבים נדירים. כמה מאות דוגמאות נבחרות שעברו אימות אנושי עדיפות בהרבה על אלפי דוגמאות פשוטות וגנריות.

האם חייבים דאטה נקי כדי להעריך את ה-AI?

ממש לא. המקרים ה'מלוכלכים' והמורכבים הם לב העניין, כי שם בדיוק ה-AI נוטה להיכשל בפרודקשן. בניית סט ההערכה היא חלק בלתי נפרד מתהליך הפיתוח עצמו, ולא דרישת קדם שחייבים להשלים מראש.

תגיות AI
שיתוף
Reef TRH
ארכיטקטורת AI ופיתוח פרודקשן

אנחנו הופכים אבות-טיפוס שבריריים של AI למערכות יציבות ומוכנות לפרודקשן, ומגשרים בין הפיתוח לתפעול כדי שה-AI שלכם באמת יגיע לאוויר וישרוד בפרודקשן.

צרו קשר

עדיין לא בטוחים ברמת הדיוק של ה-AI שלכם?

לאבחון AI לפני שהוא פוגש לקוח, אבחון קצר אומר לכם מה ה-AI שלכם עושה נכון, מה לא, והיכן צריך לקבוע את הרף. היקף קבוע, בלי כלי לקנות.