Taxa d'Intervenció Humana: l'única mètrica que diu si el desplegament d'IA funciona de debò
La majoria d'empreses que fan córrer agents d'IA en producció no us poden dir amb quina freqüència aquests agents necessiten de veritat que hi intervingui una persona. La Taxa d'Intervenció Humana és el número que respon aquesta pregunta — i al final d'aquest article hauríeu de poder calcular-la per a un flux de treball que ja feu servir.
El marc propi de FabricLoop per a organitzacions d'IA defineix la Taxa d'Intervenció Humana amb claredat: pregunta amb quina freqüència la feina automatitzada necessita una persona. Aquesta és la definició, i aquest article no se n'aparta. El que ve a continuació és la part que la pàgina de concepte no desplega del tot: l'aritmètica real, aplicada a un flux de treball real, amb els números que fan la idea concreta en lloc d'aspiracional.
Què mesura realment el número
La Taxa d'Intervenció Humana (HIR) és la part de les accions d'un agent, dins d'un flux de treball definit i un període de temps, que van requerir que una persona hi intervingués abans que el resultat es pogués donar per acabat. «Intervenir» té aquí un sentit precís: una persona va corregir la sortida, va anul·lar una decisió de l'agent o va respondre una pregunta que l'agent va plantejar explícitament abans de continuar — el que el Loop Agent de FabricLoop anomena un moment ask_human. Dividiu el recompte d'aquestes accions pel total d'accions que l'agent va fer en el mateix període, i teniu l'HIR.
El motiu pel qual aquesta mètrica es guanya un lloc al costat del temps de funcionament i la precisió, i no a sota, és que mesura una cosa que aquells números no veuen. Un agent pot treure un 95% de precisió en un referent intern i ser igualment un desplegament pitjor que un que en treu un 80%, si el 5% que s'equivoca passa en silenci mentre el 20% de què no n'està segur es marca cada vegada. L'HIR no pregunta si l'agent és bo. Pregunta si el sistema sap quan necessita una persona, i si una persona apareix de veritat quan cal. Aquesta segona pregunta és la que decideix si un desplegament es pot ampliar amb seguretat.
Calcular l'HIR per a un flux de treball real
Agafeu un flux que un equip d'IT o d'operacions podria estar executant avui: un agent que tria els tiquets de suport entrants, els classifica (facturació, informe d'error, reemborsament, accés al compte, i així successivament) i redacta una primera resposta. Cada esborrany arriba a una cua de revisió abans d'arribar a un client — res no s'envia sol. Aquest pas de revisió, per si sol, no és intervenció. Un revisor que prem «envia» en un esborrany que no necessitava canvis és el flux funcionant tal com es va dissenyar. La intervenció és el que passa quan l'esborrany necessitava feina: el revisor el va reescriure, va corregir la classificació, va redirigir el tiquet a una altra cua, o el mateix agent es va aturar a mitja tasca i va fer una pregunta abans de redactar res.
Els números de sota són un exemple il·lustratiu, no dades d'una empresa real — però la forma de la història, i l'aritmètica que hi ha al darrere, és exactament el que construiríeu a partir dels vostres registres.
El mes pilot, l'agent toca 640 tiquets. D'aquests, 415 necessiten una intervenció — una reescriptura, una reclassificació o una redirecció — i només 75 d'aquests 415 són moments que l'agent va marcar ell mateix abans de redactar res. La resta són errors que un revisor enxampa a posteriori. Això és una HIR del 64.8%, amb una quota d'escalada de només el 18%: la major part del temps que s'equivoca, l'agent s'equivoca amb confiança, que és la pitjor versió d'aquest problema.
L'equip treu el registre de correccions i etiqueta cada intervenció amb un motiu. Dues categories dominen: l'agent llegeix malament la política de reemborsament sempre que hi ha un import, i redacta respostes calmades i procedimentals a clients que estan visiblement enfadats. Totes dues es poden arreglar sense tocar el model — afegiu una regla explícita que qualsevol tiquet que esmenti un reemborsament superior a $50, o que superi un llindar de sentiment, dispari una escalada ask_human en lloc d'un esborrany. Tota la resta es continua redactant i revisant com abans.
| Mes | Tiquets tractats | Intervencions | HIR | Quota d'escalada |
|---|---|---|---|---|
| 1 — Pilot | 640 | 415 | 64.8% | 18% |
| 2 — Després d'afegir regles | 810 | 224 | 27.7% | 58% |
| 3 — Regles reajustades | 940 | 101 | 10.7% | 79% |
Al tercer mes, l'HIR ha baixat més d'un 80%, però el número més informatiu és la quota d'escalada: va pujar del 18% al 79%. La major part del que queda no és l'agent enxampat equivocant-se — és l'agent que reconeix correctament un cas realment ambigu (un compte VIP, una excepció de política, un reemborsament que cau just al llindar) i pregunta abans d'actuar. La baixada és real, i és merescuda: cada ronda de correccions es va tornar a introduir en regles explícites, de manera que els errors concrets que les havien produït van deixar de repetir-se, mentre que les categories que encara necessiten judici es continuen marcant en lloc de redactar-hi al voltant.
La baixada que importa és aquella en què l'agent millora a l'hora de saber què no sap — no aquella en què una persona deixa de revisar en silenci.
L'error: tractar el zero com l'objectiu
Quan un equip veu l'HIR baixar mes rere mes, la pregunta següent òbvia és fins on pot baixar. L'instint és tractar el zero com la línia d'arribada — la prova que l'agent per fi és prou bo per córrer sense supervisió. Aquest instint va a l'inrevés, i és la lectura errònia més comuna d'aquesta mètrica.
Un flux que mostra un 0% d'intervenció setmanes seguides gairebé mai no vol dir que l'agent hagi deixat de cometre errors. Vol dir que ha passat una de dues coses: els revisors han deixat de llegir de veritat els esborranys abans d'aprovar-los, o el camí d'escalada s'ha trencat en silenci — s'han afluixat els llindars, una regla d'encaminament ha fallat sense fer soroll, o el disparador ask_human ha deixat d'activar-se. En qualsevol cas, el zero no us diu que el sistema ha deixat de necessitar una persona. Us diu que a una persona han deixat de preguntar-li, o que ha deixat de mirar.
L'objectiu real no va ser mai menys intervencions en abstracte. És un sistema en què els moments concrets que necessiten el judici d'una persona surten a la superfície — i només aquells moments — perquè l'atenció d'una persona vagi allà on realment cal, en lloc de repartir-se per igual sobre tot o de faltar del tot. Un flux al 12% d'HIR, en què gairebé tot aquest 12% és l'agent marcant correctament casos realment ambigus o d'alt risc, és més sa que un al 2%, en què la major part d'aquest 2% és un revisor que ensopega amb un error que l'agent no va marcar mai. El número més baix pot amagar el sistema pitjor.
Exactament per a això serveix la quota d'escalada. Observada al costat de l'HIR, us diu en quina història sou:
Si l'HIR baixa mentre la quota d'escalada es manté plana o baixa, no ho arxiveu encara com a victòria. Traieu una mostra aleatòria de les accions registrades com a «no calia intervenció» i feu que algú les revisi en fred, sense dir-li que la mostra estava marcada com a neta. Comproveu si els senyals aigües avall — tiquets que es reobren, queixes, recuperacions de reemborsaments, CSAT — deriven cap amunt alhora. Una HIR a la baixa amb problemes aigües avall a l'alça no és un sistema que ha après més de pressa. És un sistema que ningú no va enxampar a temps.
Què instrumentar si voleu mesurar-ho avui
Res d'això no exigeix tant eines noves com registrar la cosa correcta. La majoria d'equips que fan córrer un agent ja fan seguiment del volum — quants tiquets ha tocat, quantes tasques ha redactat. Gairebé cap en fa del resultat, que és l'única cosa que l'HIR necessita de veritat.
- Registreu un resultat per a cada acció, no només un recompte d'activitat. Enviat tal qual, editat abans d'enviar, rebutjat i reescrit, o escalat pel mateix agent. Sense un registre a nivell de resultat, l'HIR no es pot calcular — sabreu que l'agent va fer alguna cosa, no si calia corregir-la.
- Fixeu el denominador abans de fixar el numerador. Decidiu què compta com una acció en aquest flux — un tiquet tocat, una tasca redactada — i manteniu aquesta definició estable entre períodes, perquè un canvi de l'HIR reflecteixi el judici de l'agent i no un canvi en la manera de comptar.
- Etiqueteu cada intervenció amb un motiu. «Editat» gairebé no diu res. «Editat: política de reemborsament per sobre de $50 mal aplicada» diu exactament què cal arreglar a continuació. Una taxonomia curta i consistent converteix un registre de correccions en una llista de feina, no en un marcador.
- Feu seguiment de la quota d'escalada al costat de l'HIR, no en lloc seu. Els dos números junts us diuen si una baixada és merescuda o prestada — vegeu la taula de tendència de dalt.
- Poseu un terra, no un objectiu de zero. Decidiu, per flux, com és una HIR plausible diferent de zero tenint en compte quanta ambigüitat real conté aquell flux, i tracteu una taxa que cau molt per sota d'aquest terra com una cosa a investigar, no a celebrar.
- Informeu de l'HIR per flux, mai com un sol número barrejat de tota l'empresa. Una sola mitjana amaga quin flux concret ha merescut de veritat menys supervisió i quin acumula risc en silenci sota una xifra de titular que fa bona cara.
- Torneu a comprovar la mostra «neta» amb un calendari. Traieu periòdicament accions registrades com a sense necessitat d'intervenció i feu que algú les revisi sense saber que estaven marcades com a netes. És l'única comprovació directa de si els vostres revisors encara llegeixen.
Per això el Loop Agent està construït al voltant d'ask_human, resume i l'escalada per aplicació de canal, en lloc d'una autonomia silenciosa — un agent que s'atura per preguntar és un agent que apareix al numerador de l'HIR expressament, no un que han enxampat per accident. Les escalades i els esborranys surten als mateixos Grups on l'equip ja treballa, al costat de les tasques i les notes, de manera que el moment que necessitava una persona és visible allà on la feina ja viu — no enterrat en una consola d'agent a part que ningú no mira. A Enterprise, els registres d'auditoria permeten a IT i operacions veure què van fer els agents i exactament quan hi va intervenir un humà, que és la matèria primera amb què es construeix l'HIR d'entrada.
Poseu-ho al costat de la Llegibilitat — el concepte company perquè els permisos i l'accés també siguin visibles — i teniu les dues preguntes que tot desplegament d'IA hauria de poder respondre abans d'ampliar-se: qui pot veure què fa un agent, i amb quina freqüència una persona ha d'intervenir de veritat.
