AIפרודקשןהערכה

איך תדעו שה-AI שלכם לא טועה?

החדר מלא, ההדגמה חלקה, ומישהו שואל את השאלה היחידה שחשובה: איך תדעו שהוא לא טועה? תחושה טובה היא לא תשובה. הנה התשובה האמיתית.

החדר מלא, המסך דולק, וה-AI עבד בצורה מושלמת לאורך שלושה שבועות של הדגמות. מישהו מושיט יד למתג שיעמיד אותו מול לקוחות אמיתיים, וקול שקט יותר שואל את השאלה היחידה שחשובה: איך באמת נדע שהוא לא טועה? לאף אחד אין מספר. יש להם תחושה טובה.

תחושה טובה היא לא ראיה. אם ה-AI מדייק לא לומדים מהדגמה אלא מהערכה: בדיקה מכוונת של המערכת מול מקרים שבהם התשובה הנכונה כבר ידועה לכם, שמריצים עוד לפני שהיא פוגשת לקוח, ושוב ושוב גם אחרי. הדגמה מראה שה-AI יכול לתת תשובה נכונה פעם אחת. הערכה מראה כמה פעמים הוא מדייק, ובדיוק היכן הוא טועה.

ההדגמה היא הראיה המסוכנת ביותר שיש לכם

הדגמה היא סרט תקצירים. היא מריצה את המסלול המושלם על קלט ידידותי שבחר מי שבנה אותה. פרודקשן הוא ההפך: עומס המקרים של יום שלישי אחר הצהריים, המסמך הסרוק שמונח קצת עקום, הלקוח שמתאר את הבעיה לא נכון. לשפוט AI לפי ההדגמה שלו זה כמו לשפוט מכונית לפי אולם התצוגה. זה בדיוק אותו פער בין מחיאות הכפיים בחדר לשקט בפרודקשן שמשאיר כל כך הרבה פיילוטים תקועים, וחלק גדול מהסיבה שרובם אף פעם לא מגיעים לפרודקשן.

כתבו את מפתח התשובות לפני שתסמכו על התשובה

הערכה דורשת סט זהב: כמה מאות מקרים אמיתיים שנשלפו מהעבודה שלכם עצמכם, לכל אחד התוצאה הנכונה שאדם כבר אישר. לא הקלים, אלא המייצגים, ובכוונה גם המקרים הקשים, הנדירים והרגישים שבהם תשובה שגויה עולה ביוקר. אז מריצים את ה-AI על פני הסט ומודדים ארבעה דברים:

רק עכשיו יש לכם מספר במקום תחושה, ומשהו שאפשר להצדיק מול כל מי ששואל.

קבעו רף שלא תחצו

הכלל שהופך את המערכת לבטוחה

מתחת לרף ביטחון מוגדר, ה-AI לא עונה בעצמו, אלא מעביר את המקרה לאדם. חברת ביטוח אחת שעבדנו איתה קבעה רף ביטחון קשיח של 85% מתחת לכל תשובה, עם גיבוי אנושי מתחתיו. למערכת מותר לא להיות בטוחה. אף פעם לא מותר לה לנחש בשקט.

ההערכה היא זו שאומרת לכם היכן לקבוע את הרף הזה. זה המהלך שהופך את "זה בדרך כלל עובד" ל"זה עובד, והנה בדיוק מה שקורה כשלא". זה ההבדל בין AI שאתם יכולים לערוב לו לבין כזה שאתם יכולים להוכיח.

הערכה היא הרגל, לא אבן דרך

העולם ממשיך לזוז אחרי ההשקה. מודלים נסחפים, הדאטה שלכם משתנה, ספק משנה פורמט, והמספר של אתמול מתיישן. הערכה חד-פעמית היא תצלום, פרודקשן צריך שידור חי. המערכות ששורדות מריצות את הבדיקה שוב ושוב ומרימות דגל ברגע שהדיוק יורד, בדיוק אותה משמעת של סוכני בדיקת עובדות שחוסמים כל טענה שאי אפשר לאמת מול מקור אמין. אם מדדתם רק פעם אחת, אתם לא יודעים אם ה-AI שלכם מדייק היום. אתם יודעים שהוא דייק ביום שבו הסתכלתם. אילו בדיקות להריץ לפני ההשקה הראשונה זו רשימה נפרדת, וכתבנו אותה.

שום דבר מזה לא זוהר, ושום דבר מזה לא מופיע בהדגמה. זו בדיוק הנקודה. "איך תדעו שהוא לא טועה?" נשמעת כמו שאלה טכנית, אבל היא באמת שאלה על אמון: אי אפשר למסור ללקוח או לרגולטור AI שאתם יכולים לערוב לו רק על סמך תחושה טובה. בנו קודם את מפתח התשובות. הביטחון מגיע אחר כך.

שאלות נפוצות

מה ההבדל בין הדגמה להערכה?

הדגמה מראה שה-AI יכול לתת תשובה נכונה פעם אחת, על קלט שמישהו בחר. הערכה מודדת כמה פעמים הוא מדייק על פני מאות מקרים אמיתיים, כולל אלה ששוברים הדגמות.

כמה גדול צריך להיות סט ההערכה?

גדול מספיק כדי לכסות את הטווח האמיתי שלכם, כולל מקרים קשים ונדירים. כמה מאות דוגמאות מובחרות ומאומתות בידי אדם עדיפות על אלפי דוגמאות קלות.

צריך דאטה נקי לפני שאפשר להעריך AI?

לא. המקרים המבולגנים הם כל העניין, כי שם ה-AI נכשל בפרודקשן. לבנות את סט ההערכה זה חלק מהעבודה, לא תנאי מקדים שחייבים לסיים קודם.

תגיות AI
שיתוף
Reef TRH
ארכיטקטורת AI ופיתוח פרודקשן

אנחנו הופכים אבות-טיפוס שבריריים של AI למערכות יציבות ומוכנות לפרודקשן, ומגשרים בין הפיתוח לתפעול כדי שה-AI שלכם באמת יגיע לאוויר וישרוד בפרודקשן.

צרו קשר

עדיין לא בטוחים שה-AI שלכם מדייק?

לאבחון AI לפני שהוא פוגש לקוח, אבחון קצר אומר לכם מה ה-AI שלכם עושה נכון, מה לא, והיכן צריך לקבוע את הרף. היקף קבוע, בלי כלי לקנות.