Miera ľudskej intervencie: jediná metrika, ktorá povie, či váš rollout AI naozaj funguje
Väčšina firiem, ktoré prevádzkujú AI agentov v produkcii, nevie povedať, ako často tí agenti naozaj potrebujú človeka. Miera ľudskej intervencie je číslo, ktoré na tú otázku odpovedá — a na konci tohto textu by ste ju mali vedieť vypočítať pre workflow, ktorý už vediete.
Vlastný rámec FabricLoop pre AI organizácie definuje mieru ľudskej intervencie priamo: pýta sa, ako často automatizovaná práca potrebuje človeka. To je definícia a tento text sa od nej neodchyľuje. Ďalej je tá časť, ktorú stránka konceptu nerozpisuje celú: samotná aritmetika, použitá na jeden skutočný workflow, s číslami, ktoré z myšlienky robia niečo konkrétne namiesto len žiaduceho.
Čo to číslo v skutočnosti meria
Miera ľudskej intervencie (MĽI) je podiel akcií agenta, v jednom vymedzenom workflow a jednom období, pri ktorých musel človek zasiahnuť, kým výsledok mohol platiť ako hotový. «Zasiahnuť» má tu konkrétny význam: človek opravil výstup, zrušil rozhodnutie, ktoré agent urobil, alebo odpovedal na otázku, ktorú agent výslovne položil, kým bude pokračovať — to, čo Loop Agent od FabricLoop nazýva okamihom ask_human. Vydeľte počet týchto akcií celkovým počtom akcií, ktoré agent v tom istom období urobil, a máte MĽI.
Táto metrika si zaslúži miesto vedľa dostupnosti a presnosti, nie pod nimi, pretože meria niečo, čo tie čísla nevidia. Agent môže mať na internom benchmarku 95 % presnosť a stále byť horší rollout než ten s 80 %, ak tých 5 %, v ktorých sa mýli, prejde potichu, kým tých 20 %, pri ktorých si nie je istý, sa zakaždým označí. MĽI sa nepýta, či je agent dobrý. Pýta sa, či systém vie, kedy potrebuje človeka, a či sa človek naozaj objaví, keď to nastane. Táto druhá otázka rozhoduje, či je rollout bezpečné rozširovať.
Výpočet MĽI pre jeden skutočný workflow
Vezmite workflow, ktorý by tím IT alebo prevádzky mohol viesť už dnes: agent triedi prichádzajúce tikety podpory, klasifikuje ich (fakturácia, hlásenie chyby, refundácia, prístup k účtu a podobne) a napíše prvý návrh odpovede. Každý návrh spadne do frontu na kontrolu, kým sa dostane k zákazníkovi — nič neodchádza samo. Samotný krok kontroly nie je intervencia. Keď recenzent klikne na «odoslať» pri návrhu, ktorý nepotreboval zmeny, workflow funguje, ako bol navrhnutý. Intervencia je to, čo sa stane, keď návrh potreboval prácu: recenzent ho prepísal, opravil klasifikáciu, presmeroval tiket do iného frontu, alebo sa agent sám uprostred úlohy zastavil a položil otázku, kým čokoľvek napísal.
Čísla nižšie sú ilustračný príklad, nie dáta skutočnej firmy — ale tvar príbehu a aritmetika za ním sú presne to, čo si postavíte z vlastných logov.
V pilotnom mesiaci sa agent dotkne 640 tiketov. Z nich 415 potrebuje intervenciu — prepísanie, preklasifikovanie alebo presmerovanie — a len 75 z týchto 415 sú okamihy, ktoré agent označil sám, kým čokoľvek napísal. Zvyšok sú chyby, ktoré recenzent chytí až potom. To je MĽI 64,8 % pri podiele eskalácií len 18 %: agent sa sebaisto mýli po väčšinu času, keď sa mýli, a to je najhoršia podoba tohto problému.
Tím vytiahne protokol opráv a každú intervenciu označí dôvodom. Dominujú dve kategórie: agent zle číta politiku refundácií, len čo sa objaví suma, a píše pokojné, procedurálne odpovede zákazníkom, ktorí sú viditeľne nahnevaní. Oboje sa dá opraviť bez siahania na model — pridajte explicitné pravidlo, že každý tiket so zmienkou o refundácii nad $50 alebo so skóre sentimentu nad prahom spustí eskaláciu ask_human namiesto návrhu. Všetko ostatné sa ďalej píše a kontroluje ako predtým.
| Mesiac | Spracované tikety | Intervencie | MĽI | Podiel eskalácií |
|---|---|---|---|---|
| 1 — Pilot | 640 | 415 | 64,8 % | 18 % |
| 2 — Po pridaných pravidlách | 810 | 224 | 27,7 % | 58 % |
| 3 — Pravidlá znova doladené | 940 | 101 | 10,7 % | 79 % |
Do tretieho mesiaca MĽI klesla o viac než 80 %, ale výrečnejšie číslo je podiel eskalácií: vystúpil z 18 % na 79 %. Väčšina toho, čo ostáva, nie je agent pristihnutý pri chybe — je to agent, ktorý správne spozná naozaj nejednoznačný prípad (účet VIP, výnimka z politiky, refundácia presne na prahu) a opýta sa, kým koná. Pokles je skutočný a zaslúžený: každé kolo opráv sa vrátilo do explicitných pravidiel, takže konkrétne chyby, ktoré ich vyvolali, sa prestali opakovať, kým kategórie, ktoré stále potrebujú úsudok, sa ďalej označujú namiesto toho, aby sa okolo nich písal návrh.
Pokles, na ktorom záleží, je ten, v ktorom agent lepšie vie, čo nevie — nie ten, v ktorom človek ticho prestane kontrolovať.
Chyba: brať nulu ako cieľ
Len čo tím sleduje, ako MĽI mesiac po mesiaci klesá, ďalšia očividná otázka je, ako nízko môže ísť. Inštinkt je brať nulu ako cieľovú čiaru — dôkaz, že agent je konečne dosť dobrý na to, aby bežal bez dohľadu. Ten inštinkt je obrátený a je to najčastejšie chybné čítanie tejto metriky.
Workflow, ktorý týždne ukazuje 0 % intervencií, takmer nikdy neznamená, že agent prestal robiť chyby. Znamená, že sa stalo jedno z dvoch: recenzenti prestali návrhy pred schválením naozaj čítať, alebo sa cesta eskalácie ticho rozbila — prahy sa uvoľnili, pravidlo smerovania zlyhalo bez hluku, alebo spúšť ask_human prestala páliť. Tak či tak nula nehovorí, že systém prestal človeka potrebovať. Hovorí, že sa človeka prestalo pýtať, alebo že prestal pozerať.
Skutočný cieľ nikdy nebol menej intervencií v abstrakcii. Je to systém, v ktorom konkrétne okamihy vyžadujúce úsudok človeka vyplávajú na povrch — a len tie okamihy — aby pozornosť človeka šla tam, kde je naozaj potrebná, namiesto toho, aby sa delila rovnomerne na všetko alebo chýbala úplne. Workflow na 12 % MĽI, kde takmer celých tých 12 % je agent správne označujúci naozaj nejednoznačné alebo vysoko rizikové prípady, je zdravší než ten na 2 %, kde väčšina tých 2 % je recenzent, ktorý zakopne o chybu, ktorú agent nikdy neoznačil. Nižšie číslo môže schovať horší systém.
Presne na to je podiel eskalácií. Vedľa MĽI vám povie, v ktorom príbehu ste:
Ak MĽI klesá a podiel eskalácií ostáva plochý alebo tiež klesá, ešte to nezapisujte ako výhru. Vytiahnite náhodnú vzorku akcií zapísaných ako «intervencia nebola potrebná» a nechajte ich niekoho skontrolovať naslepo, bez toho, aby ste povedali, že vzorka bola označená ako čistá. Pozrite sa, či signály ďalej v reťazci — znova otvorené tikety, sťažnosti, spätné vymáhanie refundácií, CSAT — v tom istom čase nestúpajú. Klesajúca MĽI s rastúcimi problémami ďalej v reťazci nie je systém, ktorý sa naučil rýchlejšie. Je to systém, ktorý nikto nestihol chytiť.
Čo inštrumentovať, ak to chcete merať už dnes
Nič z toho nevyžaduje natoľko nové nástroje ako záznam správnej veci. Väčšina tímov s agentom už sleduje objem — koľkých tiketov sa dotkol, koľko úloh napísal. Takmer žiadny nesleduje výsledok, a to je jediné, čo MĽI naozaj potrebuje.
- Zaznamenajte výsledok každej akcie, nie len počítadlo aktivity. Odoslané bez zmeny, upravené pred odoslaním, odmietnuté a prepísané, alebo eskalované samotným agentom. Bez logu na úrovni výsledku sa MĽI vôbec nedá vypočítať — budete vedieť, že agent niečo urobil, nie či to bolo treba opraviť.
- Najprv zafixujte menovateľ, až potom čitateľ. Rozhodnite, čo sa v tomto workflow ráta ako jedna akcia — jeden dotknutý tiket, jedna napísaná úloha — a držte tú definíciu stálu naprieč obdobiami, aby zmena MĽI odrážala úsudok agenta, nie zmenu spôsobu počítania.
- Každú intervenciu označte dôvodom. «Upravené» nehovorí takmer nič. «Upravené: zle použitá politika refundácií nad $50» hovorí presne, čo opraviť ďalej. Krátka, stála taxonómia zmení protokol opráv na zoznam práce, nie na výsledkovú tabuľu.
- Sledujte podiel eskalácií vedľa MĽI, nie namiesto nej. Obe čísla spolu povedia, či je pokles zaslúžený, alebo požičaný — pozri tabuľku trendu vyššie.
- Nastavte podlahu, nie cieľ nula. Pri každom workflow rozhodnite, ako vyzerá vierohodná nenulová MĽI vzhľadom na to, koľko skutočnej nejednoznačnosti workflow obsahuje, a s mierou, ktorá spadne výrazne pod tú podlahu, zaobchádzajte ako s niečím na prešetrenie, nie na oslavu.
- Reportujte MĽI po workflow, nikdy ako jedno zmiešané číslo za celú firmu. Jeden priemer schová, ktorý konkrétny workflow si naozaj zaslúžil menej dohľadu a ktorý ticho hromadí riziko pod dobre vyzerajúcim súhrnným číslom.
- Podľa rozvrhu znova kontrolujte «čistú» vzorku. Pravidelne vyťahujte akcie zapísané ako nevyžadujúce intervenciu a nechajte ich niekoho skontrolovať, bez toho, aby vedel, že boli označené ako čisté. Je to jediná priama kontrola, či recenzenti stále čítajú.
Preto je Loop Agent postavený okolo ask_human, obnovenia a eskalácie cez aplikáciu kanála, nie okolo tichej autonómie — agent, ktorý sa zastaví, aby sa opýtal, sa v čitateli vašej MĽI objaví schválne, nie ako ten, ktorého chytili náhodou. Eskalácie a návrhy vyplávajú v tých istých Groups, kde tím už pracuje, vedľa úloh a poznámok, takže okamih, ktorý potreboval človeka, je vidieť tam, kde práca už žije — nie zahrabaný v samostatnej konzole agenta, ktorú nikto nekontroluje. Na Enterprise auditné logy umožnia IT a prevádzke vidieť, čo agenti urobili a presne kedy človek zasiahol, a z tej suroviny sa MĽI od začiatku stavia.
Dajte to dokopy s Čitateľnosťou — sprievodným konceptom, ktorý robí viditeľnými aj oprávnenia a prístupy — a máte dve otázky, na ktoré by mal každý rollout AI vedieť odpovedať, kým sa rozšíri: kto vidí, čo agent robí, a ako často musí človek naozaj zasiahnuť.
