שיעור התערבות אנושית: המדד האחד שמראה אם השקת ה-AI שלכם באמת עובדת
רוב החברות שמריצות סוכני AI בפרודקשן לא יודעות לומר כמה פעמים הסוכנים האלה באמת צריכים שאדם ייכנס לתמונה. שיעור התערבות אנושית הוא המספר שעונה על השאלה הזו — ובסוף המאמר הזה אתם אמורים לדעת לחשב אותו עבור תהליך שאתם כבר מריצים.
המסגרת של FabricLoop לארגוני AI מגדירה את שיעור התערבות אנושית בפשטות: היא שואלת כמה פעמים עבודה אוטומטית צריכה אדם. זו ההגדרה, והמאמר הזה לא סוטה ממנה. מה שבא אחר כך הוא החלק שעמוד המושג לא פורס במלואו: החשבון עצמו, מיושם על תהליך עבודה אמיתי אחד, עם המספרים שהופכים את הרעיון לקונקרטי במקום לשאיפה.
מה המספר באמת מודד
שיעור התערבות אנושית (HIR) הוא החלק מפעולות הסוכן, בתוך תהליך מוגדר אחד ובתוך תקופת זמן אחת, שדרשו מאדם להיכנס לפני שהתוצאה יכלה לעמוד כמוגמרת. «להיכנס» יש כאן משמעות מדויקת: אדם תיקן את הפלט, דרס החלטה שהסוכן קיבל, או ענה על שאלה שהסוכן העלה במפורש לפני שהמשיך — מה ש-Loop Agent של FabricLoop קורא לו רגע ask_human. מחלקים את מספר הפעולות האלה בסך הפעולות שהסוכן ביצע באותה תקופה, ומקבלים את ה-HIR.
הסיבה שהמדד הזה ראוי לעמוד לצד זמינות ודיוק, ולא מתחתיהם, היא שהוא מודד משהו שהמספרים האלה לא רואים. סוכן יכול להציג 95% דיוק במבחן פנימי ועדיין להיות השקה גרועה יותר מסוכן עם 80%, אם ה-5% שהוא טועה בהם עוברים בשקט בזמן שה-20% שהוא לא בטוח לגביהם מסומנים בכל פעם. HIR לא שואל אם הסוכן טוב. הוא שואל אם המערכת יודעת מתי היא צריכה אדם, ואם אדם באמת מגיע כשזה קורה. השאלה השנייה היא זו שקובעת אם בטוח להרחיב השקה.
חישוב HIR עבור תהליך עבודה אמיתי אחד
קחו תהליך שצוות IT או תפעול באמת עשוי להריץ היום: סוכן שממיין פניות תמיכה נכנסות, מסווג אותן (חיוב, דיווח על באג, החזר כספי, גישה לחשבון, וכן הלאה), ומנסח תשובה ראשונה. כל טיוטה נוחתת בתור בדיקה לפני שהיא מגיעה ללקוח — שום דבר לא נשלח מעצמו. שלב הבדיקה הזה, כשלעצמו, אינו התערבות. בודק שלוחץ «שלח» על טיוטה שלא נזקקה לשינוי הוא תהליך שעובד כפי שתוכנן. התערבות היא מה שקורה כשהטיוטה נזקקה לעבודה: הבודק שכתב אותה, תיקן את הסיווג, העביר את הפנייה לתור אחר, או שהסוכן עצמו עצר באמצע המשימה ושאל שאלה לפני שניסח משהו.
המספרים למטה הם דוגמה להמחשה, לא נתונים של חברה אמיתית — אבל צורת הסיפור, והחשבון שמאחוריו, הם בדיוק מה שהייתם בונים מהלוגים שלכם.
בחודש הפיילוט הסוכן נוגע ב-640 פניות. מתוכן, 415 זקוקות להתערבות — שכתוב, סיווג מחדש או ניתוב מחדש — ורק 75 מתוך 415 הן רגעים שהסוכן סימן בעצמו לפני שניסח משהו. השאר הן טעויות שבודק תופס אחרי מעשה. זה HIR של 64.8%, עם חלק הסלמה של 18% בלבד: ברוב הזמן שהסוכן טועה, הוא טועה בביטחון, וזו הגרסה הגרועה ביותר של הבעיה הזו.
הצוות שולף את יומן התיקונים ומתייג כל התערבות בסיבה. שתי קטגוריות שולטות: הסוכן קורא לא נכון את מדיניות ההחזר בכל מקרה שכרוך בסכום כסף, והוא מנסח תשובות רגועות ופרוצדורליות ללקוחות שכעסם גלוי. את שתיהן אפשר לתקן בלי לגעת במודל — מוסיפים כלל מפורש שכל פנייה שמזכירה החזר מעל $50, או שעוברת סף סנטימנט, מפעילה הסלמת ask_human במקום טיוטה. כל השאר עדיין מנוסח ונבדק כמו קודם.
| חודש | פניות שטופלו | התערבויות | HIR | חלק ההסלמה |
|---|---|---|---|---|
| 1 — פיילוט | 640 | 415 | 64.8% | 18% |
| 2 — אחרי שהוספו כללים | 810 | 224 | 27.7% | 58% |
| 3 — כללים כוילו שוב | 940 | 101 | 10.7% | 79% |
עד החודש השלישי HIR ירד ביותר מ-80%, אבל המספר האינפורמטיבי יותר הוא חלק ההסלמה: הוא עלה מ-18% ל-79%. רוב מה שנשאר אינו הסוכן שנתפס טועה — זה הסוכן שמזהה נכון מקרה מעורפל באמת (חשבון VIP, חריג ממדיניות, החזר שנופל בדיוק על הסף) ושואל לפני שהוא פועל. הירידה אמיתית, והיא הושגה: כל סבב תיקונים הוחזר לכללים מפורשים, כך שהטעויות הספציפיות שייצרו אותם הפסיקו לחזור, בעוד הקטגוריות שעדיין דורשות שיקול דעת ממשיכות להיות מסומנות במקום שמנסחים סביבן.
הירידה שחשובה היא זו שבה הסוכן משתפר בלדעת מה הוא לא יודע — לא זו שבה אדם מפסיק בשקט לבדוק.
הטעות: להתייחס לאפס כאל היעד
ברגע שצוות רואה את HIR יורד מחודש לחודש, השאלה הבאה המתבקשת היא כמה נמוך הוא יכול לרדת. האינסטינקט הוא להתייחס לאפס כאל קו הסיום — הוכחה שהסוכן סוף-סוף טוב מספיק לרוץ בלי השגחה. האינסטינקט הזה הפוך, וזו הקריאה השגויה הנפוצה ביותר של המדד הזה.
תהליך שמציג 0% התערבות שבועות ברצף כמעט אף פעם לא אומר שהסוכן הפסיק לטעות. הוא אומר שאחד משני דברים קרה במקום: הבודקים הפסיקו באמת לקרוא את הטיוטות לפני שאישרו אותן, או שמסלול ההסלמה נשבר בשקט — ספים רוככו, כלל ניתוב נכשל בלי רעש, או שהטריגר של ask_human הפסיק לפעול. כך או כך, האפס לא אומר שהמערכת הפסיקה להזדקק לאדם. הוא אומר שאדם הפסיק להישאל, או הפסיק להסתכל.
היעד האמיתי מעולם לא היה פחות התערבויות במופשט. הוא מערכת שבה הרגעים הספציפיים שדורשים את שיקול הדעת של אדם עולים לפני השטח — ורק הרגעים האלה — כך שתשומת הלב של אדם הולכת למה שבאמת צריך אותה, במקום להתפצל באופן שווה על הכול או להיעדר לגמרי. תהליך שיושב על 12% HIR, כשכמעט כל ה-12% האלה הם הסוכן שמסמן נכון מקרים מעורפלים או בעלי סיכון גבוה באמת, בריא יותר מתהליך שיושב על 2%, כשרוב ה-2% האלה הם בודק שנתקל בטעות שהסוכן מעולם לא סימן. המספר הנמוך יותר יכול להסתיר את המערכת הגרועה יותר.
בדיוק בשביל זה קיים חלק ההסלמה. כשצופים בו לצד HIR, הוא אומר באיזה סיפור אתם נמצאים:
אם HIR יורד בזמן שחלק ההסלמה נשאר שטוח או יורד, אל תרשמו את זה עדיין כניצחון. משכו מדגם אקראי מהפעולות שנרשמו כ«לא נדרשה התערבות» ותנו למישהו לבדוק אותן בקור, בלי לומר שהמדגם סומן כנקי. בדקו אם אותות במורד הזרם — פניות שנפתחות מחדש, תלונות, החזרים שנמשכים בחזרה, CSAT — נסחפים כלפי מעלה באותו זמן. HIR יורד עם בעיות במורד הזרם שעולות אינו מערכת שלמדה מהר יותר. זו מערכת שאף אחד לא תפס בזמן.
מה למדוד אם רוצים למדוד את זה היום
כל זה לא דורש כלים חדשים כמעט כמו שהוא דורש לרשום את הדבר הנכון. רוב הצוותים שמריצים סוכן כבר עוקבים אחרי נפח — בכמה פניות הוא נגע, כמה משימות ניסח. כמעט אף אחד מהם לא עוקב אחרי התוצאה, וזה הדבר היחיד ש-HIR באמת צריך.
- רשמו תוצאה לכל פעולה, לא רק ספירת פעילות. נשלח כמו שהוא, נערך לפני השליחה, נדחה ונכתב מחדש, או הוסלם על ידי הסוכן עצמו. בלי רישום ברמת התוצאה אי אפשר לחשב HIR בכלל — תדעו שהסוכן עשה משהו, לא אם היה צריך לתקן אותו.
- קבעו את המכנה לפני שאתם קובעים את המונה. החליטו מה נחשב פעולה אחת בתהליך הזה — פנייה אחת שנגעו בה, משימה אחת שנוסחה — והחזיקו בהגדרה הזו יציבה בין תקופות, כדי ששינוי ב-HIR ישקף את שיקול הדעת של הסוכן ולא שינוי בדרך הספירה.
- תייגו כל התערבות בסיבה. «נערך» כמעט לא אומר כלום. «נערך: מדיניות החזר מעל $50 יושמה לא נכון» אומר בדיוק מה לתקן אחר כך. טקסונומיה קצרה ועקבית הופכת יומן תיקונים לרשימת עבודה במקום לוח תוצאות.
- עקבו אחרי חלק ההסלמה לצד HIR, לא במקומו. שני המספרים יחד אומרים אם ירידה הושגה או נלקחה בהשאלה — ראו את טבלת המגמה למעלה.
- קבעו רצפה, לא יעד של אפס. החליטו, לכל תהליך, איך נראה HIR סביר שאינו אפס בהתחשב בכמה עמימות אמיתית יש בתהליך, והתייחסו לשיעור שיורד הרבה מתחת לרצפה הזו כמשהו שצריך לחקור, לא כמשהו לחגוג.
- דווחו על HIR לכל תהליך, אף פעם לא כמספר מעורבב אחד לכל החברה. ממוצע יחיד מסתיר איזה תהליך ספציפי באמת הרוויח פחות השגחה ואיזה צובר בשקט סיכון מתחת לכותרת שנראית טוב.
- בדקו מחדש את המדגם «הנקי» לפי לוח זמנים. משכו מדי פעם פעולות שנרשמו כלא זקוקות להתערבות ותנו למישהו לבדוק אותן בלי לדעת שסומנו כנקיות. זו הבדיקה הישירה היחידה אם הבודקים שלכם עדיין קוראים.
בגלל זה Loop Agent בנוי סביב ask_human, resume והסלמה לאפליקציות ערוץ, ולא סביב אוטונומיה שקטה — סוכן שעוצר כדי לשאול הוא סוכן שמופיע במונה של ה-HIR בכוונה, לא סוכן שנתפס במקרה. הסלמות וטיוטות עולות באותן קבוצות שבהן הצוות כבר עובד, לצד משימות והערות, כך שהרגע שנזקק לאדם נראה במקום שבו העבודה כבר חיה — לא קבור בקונסולת סוכנים נפרדת שאף אחד לא בודק. ב-Enterprise, יומני ביקורת מאפשרים ל-IT ולתפעול לראות מה הסוכנים עשו ומתי בדיוק אדם נכנס, וזה חומר הגלם ש-HIR נבנה ממנו מלכתחילה.
חברו את זה לקריאות — המושג המלווה שדואג שגם הרשאות וגישה יהיו גלויות — ותקבלו את שתי השאלות שכל השקת AI צריכה לדעת לענות עליהן לפני שהיא מתרחבת: מי יכול לראות מה סוכן עושה, וכמה פעמים אדם באמת צריך להיכנס.
