הבעיה

הדאטה שיכולה לאמן את המודל הייתה הדאטה שאסור היה לגעת בה.

צוותי המחקר שלהם נזקקו לחומר קליני גולמי, תמונות רפואיות, סריקות וטקסט חופשי, כדי לבנות את הדור הבא של אלגוריתמים אבחוניים. החברה הייתה הבעלים של כל זה. היא פשוט לא יכלה להשתמש בו באופן חוקי, כי כל קובץ הכיל שמות, מזהים ופרטי מטופלים חסויים המוגנים ב-HIPAA.

לעשות את זה ביד לא הייתה אופציה. סקירה של מיליוני סריקות ומסמכים כדי להשחיר פרטים מזהים הייתה לוקחת אלפי שעות ועולה הון, ועדיין לא הייתה מדביקה את קצב המחקר.

הכלים האוטומטיים הנאיביים עשו טעות אחרת: הם השחירו בצורה אגרסיבית מדי, ומחקו בדיוק את המדידות הקליניות וההיסטוריה שבגללן הדאטה בכלל שווה אימון. אז הברירה שעל השולחן הייתה: איטי ובטוח, או מהיר וחסר תועלת. הפיתוח פיגר בחודשים אחרי המתחרים.

מה עשינו

להסתיר את המטופל, לשמור על הרפואה.

מנוע שמסיר את הזהות ומגן על האות הקליני, עם אדם שערב לאפס דליפות.

מנוע ייעודי

שפה וראייה יחד

בנינו מנוע דה-אידנטיפיקציה שמשלב מודלי שפה וראייה ממוחשבת, מאומן לזהות יותר מ-50 סוגים של פרטים מזהים בתוך טקסט רפואי מורכב ובתוך הסריקות עצמן.

מבין הקשר

להסתיר את הזהות, לא את הממצא

המנוע מסיר או מסתיר רק את המזהים הישירים, שמות, תאריכים, כתובות ופנים, בזמן שהוא משאיר את ההקשר הקליני, המדידות והממצאים שלמים לגמרי ושמישים למחקר.

שומר את הערך

אין יותר השחרת יתר

מכיוון שהוא מבין מה הוא קורא, הוא מפסיק להרוס בדיוק את הדאטה שבגללה הקובץ בכלל שווה אימון, בדיוק במקום שבו הכלים הקהים שניסו קודם נכשלו.

אדם בלולאה

אפס דליפות, מאומת

שכבת סקירה בודקת את הפלט. קבצים שאושרו בביטחון מלא משוחררים למחקר מיד; כל דבר לא ודאי עובר למומחה לבדיקה מהירה, כך שההבטחה היא אפס חשיפה, לא כמעט אפס.

בקנה מידה

טרה-בייטים, לא דגימות

הפייפליין רץ על טרה-בייטים של תמונות ומסמכים, והופך ארכיון נעול למערך נתונים עובד, לא לדגימה קטנה שנאספה ביד.

תאימות מובנית

HIPAA ו-GDPR, עם הוכחות

הגנת הפרטיות בנויה לתוך התהליך, עם תיעוד ביקורת מלא שמוכיח עמידה בתקנים הקפדניים ביותר של בריאות ופרטיות.

התוצאה

ארכיון נעול הפך למערך האימון.

הדאטה נעשתה בטוחה, והמחקר נעשה מהיר.

חי

מחזור פיתוח קצר בכ-60%

שחרור טרה-בייטים של דאטה קלינית שהייתה נעולה קודם נתן למודלים את החומר שהם היו רעבים לו, וקיצץ את מחזור הפיתוח של מוצרים אבחוניים חדשים ב-AI בכ-60%, כך שהחברה הגיעה לשוק מהר יותר והוציאה הרבה פחות על הכנת דאטה.

וגם תואם

אפס דליפות של דאטת מטופלים

העבודה עמדה בתקנים הרגולטוריים הקפדניים ביותר במלואם, HIPAA ו-GDPR, בלי אירוע אחד של חשיפה או דליפה של דאטת מטופלים. הדאטה שהייתה סיכון משפטי הפכה לנכס האימון המרכזי של החברה.

למה זה מחזיק

אנונימיזציה שווה משהו רק אם הדאטה עדיין שווה משהו.

כל אחד יכול להשחיר קובץ עד שלא נשאר בו שום ערך. החלק הקשה הוא להסיר את הזהות תוך שמירה על האות הקליני, ולהיות מסוגלים להוכיח שהזהות באמת נעלמה. זה דורש מודלים שמבינים מה הם קוראים ואדם שעומד מאחורי ההבטחה. זה אותו עיקרון כמו עבודת מוכנות הדאטה שלנו: הערך הוא בהפיכת דאטה לשמישה, בבטחה, ולא רק בהזזה שלה ממקום למקום.

עוד פרויקטים

עבודה קשורה.

יושבים על דאטה שאסור לכם להשתמש בה חוקית?

לתיאום שיחת אסטרטגיה הביאו את הארכיון שהמחלקה המשפטית לא נותנת לכם לפתוח. שלושים דקות, בלי מצגות, או חקרו AI לבריאות, או ראו עוד פרויקטים.