כדי לאמן מודלים אבחוניים חדשים, צוותי הפיתוח נזקקו לטרה-בייטים של דאטה קלינית אמיתית. המידע היה שם, ממש בהישג יד, אבל המחלקה המשפטית חסמה את הגישה: הקבצים הכילו פרטים מזהים של מטופלים, והשחרה ידנית בהיקפים כאלה לא הייתה ריאלית. כתוצאה מכך, פיתוח מוצרים חדשים נעצר לחודשים.
צוותי המחקר נזקקו למידע קליני גולמי, כמו תמונות רפואיות, סריקות וטקסט חופשי, כדי לפתח את הדור הבא של אלגוריתמים אבחוניים. כל המידע הזה היה בבעלות החברה, אך היא לא יכלה להשתמש בו באופן חוקי, מכיוון שכל קובץ הכיל שמות, מזהים ופרטי מטופלים חסויים המוגנים תחת תקני HIPAA.
עבודה ידנית לא הייתה אופציה ריאלית. מעבר על מיליוני סריקות ומסמכים והשחרת הפרטים המזהים בהם היו דורשים אלפי שעות עבודה ועלויות עתק, ועדיין לא היו עומדים בקצב הנדרש למחקר.
הכלים האוטומטיים הפשוטים יותר עשו טעות הפוכה: הם ביצעו השחרת יתר אגרסיבית, ומחקו בדיוק את המדידות הקליניות וההיסטוריה הרפואית שהופכות את הדאטה לבעלת ערך לאימון. הברירה שנותרה הייתה בין תהליך איטי ובטוח לבין תהליך מהיר אך חסר תועלת, והפיתוח פיגר אחרי המתחרים בחודשים.
מנוע שמסיר פרטים מזהים ומגן על המידע הקליני, עם חתימת אדם המבטיחה אפס דליפות.
פיתחנו מנוע אנונימיזציה המשלב מודלי שפה וראייה ממוחשבת, ומאומן לזהות יותר מ-50 סוגי פרטים מזהים בטקסט רפואי מורכב ובתוך הסריקות עצמן.
המנוע מסיר או מסתיר רק את הפרטים המזהים הישירים, כמו שמות, תאריכים, כתובות ותווי פנים, ומשאיר את ההקשר הקליני, המדידות והממצאים שלמים לחלוטין ושמישים למחקר.
הודות ליכולת שלו להבין את ההקשר, הוא לא פוגע בדאטה שהופכת את הקובץ לבעל ערך לאימון, בדיוק בנקודה שבה נכשלו הכלים הבסיסיים שנוסו בעבר.
שכבת בקרה בודקת את הפלט: קבצים שאושרו בוודאות גבוהה משוחררים מיד למחקר, בעוד שכל קובץ שמעורר ספק מועבר לבדיקה מהירה של מומחה. כך אנחנו מבטיחים אפס חשיפה, ולא 'כמעט אפס'.
תשתיות הדאטה מעבדות טרה-בייטים של תמונות ומסמכים, והופכות ארכיון נעול למערך נתונים פעיל ורחב, במקום דגימה קטנה שנאספה ידנית.
אבטחת הפרטיות מוטמעת ישירות בתהליך, בליווי תיעוד ביקורת מלא המוכיח עמידה בתקני הבריאות והפרטיות המחמירים ביותר.
הדאטה הפכה לבטוחה לשימוש, והמחקר הפך למהיר בהרבה.
שחרור טרה-בייטים של דאטה קלינית שהייתה חסומה סיפק למודלים את חומרי האימון הנחוצים להם, וקיצר את מחזור הפיתוח של מוצרי AI אבחוניים חדשים בכ-60%. כתוצאה מכך, החברה הגיעה לשוק מהר יותר וצמצמה משמעותית את עלויות הכנת הדאטה.
התהליך עמד במלואו בתקנים הרגולטוריים המחמירים ביותר, כולל HIPAA ו-GDPR, ללא אף מקרה של חשיפה או דליפה של נתוני מטופלים. הדאטה, שהיוותה קודם לכן סיכון משפטי, הפכה לנכס האימון המרכזי של החברה.
כל אחד יכול להשחיר קובץ עד שלא נשאר בו שום ערך. האתגר האמיתי הוא להסיר פרטים מזהים תוך שמירה על המידע הקליני, ולהוכיח שהזהות אכן נמחקה לחלוטין. לשם כך נדרשים מודלים שמבינים את ההקשר, וחתימת אדם שעומדת מאחורי ההבטחה. זהו בדיוק אותו עיקרון כמו בפרויקט מוכנות הדאטה שלנו: הערך האמיתי טמון בהפיכת הדאטה לשמישה ובטוחה, ולא רק בהעברה שלה ממקום למקום.
החיפוש של פלטפורמת הזמנות קבר את ההתאמות הטובות ביותר וה-AI שלה המציא מתקנים שמעולם לא היו שם. דאטה מאומתת אנושית, כיוונון רלוונטיות וסוכני בדיקת עובדות העלו את רלוונטיות התוצאה העליונה ב-35% וקיצצו דיווחי מידע מומצא ב-80%.
לפרויקט המלא ← מוכנות דאטה · ביטוחה-AI של קבוצת ביטוח ישראלית מובילה הזה שוב ושוב. איתרנו את זה לאי-התאמה של כ-30% בדאטה, בנינו מחדש את תשתיות הדאטה, ושמנו רצפת ביטחון קשיחה של 85% תחת כל תשובה.
לפרויקט המלא ←