Il·lustració de paper retallat d'una balena i un banc de peixos que es mouen junts per un escull de corall, il·luminats per raigs de llum des de la superfície, que representa un sistema gairebé autosuficient que encara és observat des de dalt
IA i Confiança

Taxa d'Intervenció Humana: l'única mètrica que diu si el desplegament d'IA funciona de debò

La majoria d'empreses que fan córrer agents d'IA en producció no us poden dir amb quina freqüència aquests agents necessiten de veritat que hi intervingui una persona. La Taxa d'Intervenció Humana és el número que respon aquesta pregunta — i al final d'aquest article hauríeu de poder calcular-la per a un flux de treball que ja feu servir.

Editorial de FabricLoop
2.180 paraules
10 min de lectura

El marc propi de FabricLoop per a organitzacions d'IA defineix la Taxa d'Intervenció Humana amb claredat: pregunta amb quina freqüència la feina automatitzada necessita una persona. Aquesta és la definició, i aquest article no se n'aparta. El que ve a continuació és la part que la pàgina de concepte no desplega del tot: l'aritmètica real, aplicada a un flux de treball real, amb els números que fan la idea concreta en lloc d'aspiracional.

Què mesura realment el número

La Taxa d'Intervenció Humana (HIR) és la part de les accions d'un agent, dins d'un flux de treball definit i un període de temps, que van requerir que una persona hi intervingués abans que el resultat es pogués donar per acabat. «Intervenir» té aquí un sentit precís: una persona va corregir la sortida, va anul·lar una decisió de l'agent o va respondre una pregunta que l'agent va plantejar explícitament abans de continuar — el que el Loop Agent de FabricLoop anomena un moment ask_human. Dividiu el recompte d'aquestes accions pel total d'accions que l'agent va fer en el mateix període, i teniu l'HIR.

El motiu pel qual aquesta mètrica es guanya un lloc al costat del temps de funcionament i la precisió, i no a sota, és que mesura una cosa que aquells números no veuen. Un agent pot treure un 95% de precisió en un referent intern i ser igualment un desplegament pitjor que un que en treu un 80%, si el 5% que s'equivoca passa en silenci mentre el 20% de què no n'està segur es marca cada vegada. L'HIR no pregunta si l'agent és bo. Pregunta si el sistema sap quan necessita una persona, i si una persona apareix de veritat quan cal. Aquesta segona pregunta és la que decideix si un desplegament es pot ampliar amb seguretat.

Calcular l'HIR per a un flux de treball real

Agafeu un flux que un equip d'IT o d'operacions podria estar executant avui: un agent que tria els tiquets de suport entrants, els classifica (facturació, informe d'error, reemborsament, accés al compte, i així successivament) i redacta una primera resposta. Cada esborrany arriba a una cua de revisió abans d'arribar a un client — res no s'envia sol. Aquest pas de revisió, per si sol, no és intervenció. Un revisor que prem «envia» en un esborrany que no necessitava canvis és el flux funcionant tal com es va dissenyar. La intervenció és el que passa quan l'esborrany necessitava feina: el revisor el va reescriure, va corregir la classificació, va redirigir el tiquet a una altra cua, o el mateix agent es va aturar a mitja tasca i va fer una pregunta abans de redactar res.

Els números de sota són un exemple il·lustratiu, no dades d'una empresa real — però la forma de la història, i l'aritmètica que hi ha al darrere, és exactament el que construiríeu a partir dels vostres registres.

Fórmula de l'HIR
HIR = Accions que requereixen intervenció ÷ Accions totals de l'agent
El mateix flux, el mateix període. Compteu només les accions en què una persona va canviar el resultat. Un revisor que aprova un esborrany sense canvis no compta com a intervenció — i tampoc un esborrany que no en necessitava cap.
Quota d'escalada
Quota d'escalada = Preguntes iniciades per l'agent ÷ Intervencions totals
Parteix cada intervenció en dos tipus: l'agent va marcar la seva pròpia incertesa, o un revisor va enxampar un error que l'agent no havia marcat. Aquest és el número que diu si una HIR a la baixa és una bona notícia.

El mes pilot, l'agent toca 640 tiquets. D'aquests, 415 necessiten una intervenció — una reescriptura, una reclassificació o una redirecció — i només 75 d'aquests 415 són moments que l'agent va marcar ell mateix abans de redactar res. La resta són errors que un revisor enxampa a posteriori. Això és una HIR del 64.8%, amb una quota d'escalada de només el 18%: la major part del temps que s'equivoca, l'agent s'equivoca amb confiança, que és la pitjor versió d'aquest problema.

L'equip treu el registre de correccions i etiqueta cada intervenció amb un motiu. Dues categories dominen: l'agent llegeix malament la política de reemborsament sempre que hi ha un import, i redacta respostes calmades i procedimentals a clients que estan visiblement enfadats. Totes dues es poden arreglar sense tocar el model — afegiu una regla explícita que qualsevol tiquet que esmenti un reemborsament superior a $50, o que superi un llindar de sentiment, dispari una escalada ask_human en lloc d'un esborrany. Tota la resta es continua redactant i revisant com abans.

MesTiquets tractatsIntervencionsHIRQuota d'escalada
1 — Pilot 640 415 64.8% 18%
2 — Després d'afegir regles 810 224 27.7% 58%
3 — Regles reajustades 940 101 10.7% 79%

Al tercer mes, l'HIR ha baixat més d'un 80%, però el número més informatiu és la quota d'escalada: va pujar del 18% al 79%. La major part del que queda no és l'agent enxampat equivocant-se — és l'agent que reconeix correctament un cas realment ambigu (un compte VIP, una excepció de política, un reemborsament que cau just al llindar) i pregunta abans d'actuar. La baixada és real, i és merescuda: cada ronda de correccions es va tornar a introduir en regles explícites, de manera que els errors concrets que les havien produït van deixar de repetir-se, mentre que les categories que encara necessiten judici es continuen marcant en lloc de redactar-hi al voltant.

La baixada que importa és aquella en què l'agent millora a l'hora de saber què no sap — no aquella en què una persona deixa de revisar en silenci.

L'error: tractar el zero com l'objectiu

Quan un equip veu l'HIR baixar mes rere mes, la pregunta següent òbvia és fins on pot baixar. L'instint és tractar el zero com la línia d'arribada — la prova que l'agent per fi és prou bo per córrer sense supervisió. Aquest instint va a l'inrevés, i és la lectura errònia més comuna d'aquesta mètrica.

Per què el 0% sol ser un senyal d'alarma

Un flux que mostra un 0% d'intervenció setmanes seguides gairebé mai no vol dir que l'agent hagi deixat de cometre errors. Vol dir que ha passat una de dues coses: els revisors han deixat de llegir de veritat els esborranys abans d'aprovar-los, o el camí d'escalada s'ha trencat en silenci — s'han afluixat els llindars, una regla d'encaminament ha fallat sense fer soroll, o el disparador ask_human ha deixat d'activar-se. En qualsevol cas, el zero no us diu que el sistema ha deixat de necessitar una persona. Us diu que a una persona han deixat de preguntar-li, o que ha deixat de mirar.

L'objectiu real no va ser mai menys intervencions en abstracte. És un sistema en què els moments concrets que necessiten el judici d'una persona surten a la superfície — i només aquells moments — perquè l'atenció d'una persona vagi allà on realment cal, en lloc de repartir-se per igual sobre tot o de faltar del tot. Un flux al 12% d'HIR, en què gairebé tot aquest 12% és l'agent marcant correctament casos realment ambigus o d'alt risc, és més sa que un al 2%, en què la major part d'aquest 2% és un revisor que ensopega amb un error que l'agent no va marcar mai. El número més baix pot amagar el sistema pitjor.

Exactament per a això serveix la quota d'escalada. Observada al costat de l'HIR, us diu en quina història sou:

Llegir una tendència de l'HIR — el mateix número a la baixa, dos significats
0%, indefinidament
Senyal d'alarma — ningú mira, no un sistema impecable
Alt i pla durant mesos
No aprèn — les correccions no tornen a les regles
Baixa, i la quota també
Reviseu-ho — probablement aprovacions de tràmit, no progrés real
Baixa, i la quota puja
Confiança guanyada — el sistema coneix els seus límits

Si l'HIR baixa mentre la quota d'escalada es manté plana o baixa, no ho arxiveu encara com a victòria. Traieu una mostra aleatòria de les accions registrades com a «no calia intervenció» i feu que algú les revisi en fred, sense dir-li que la mostra estava marcada com a neta. Comproveu si els senyals aigües avall — tiquets que es reobren, queixes, recuperacions de reemborsaments, CSAT — deriven cap amunt alhora. Una HIR a la baixa amb problemes aigües avall a l'alça no és un sistema que ha après més de pressa. És un sistema que ningú no va enxampar a temps.

Què instrumentar si voleu mesurar-ho avui

Res d'això no exigeix tant eines noves com registrar la cosa correcta. La majoria d'equips que fan córrer un agent ja fan seguiment del volum — quants tiquets ha tocat, quantes tasques ha redactat. Gairebé cap en fa del resultat, que és l'única cosa que l'HIR necessita de veritat.

  1. Registreu un resultat per a cada acció, no només un recompte d'activitat. Enviat tal qual, editat abans d'enviar, rebutjat i reescrit, o escalat pel mateix agent. Sense un registre a nivell de resultat, l'HIR no es pot calcular — sabreu que l'agent va fer alguna cosa, no si calia corregir-la.
  2. Fixeu el denominador abans de fixar el numerador. Decidiu què compta com una acció en aquest flux — un tiquet tocat, una tasca redactada — i manteniu aquesta definició estable entre períodes, perquè un canvi de l'HIR reflecteixi el judici de l'agent i no un canvi en la manera de comptar.
  3. Etiqueteu cada intervenció amb un motiu. «Editat» gairebé no diu res. «Editat: política de reemborsament per sobre de $50 mal aplicada» diu exactament què cal arreglar a continuació. Una taxonomia curta i consistent converteix un registre de correccions en una llista de feina, no en un marcador.
  4. Feu seguiment de la quota d'escalada al costat de l'HIR, no en lloc seu. Els dos números junts us diuen si una baixada és merescuda o prestada — vegeu la taula de tendència de dalt.
  5. Poseu un terra, no un objectiu de zero. Decidiu, per flux, com és una HIR plausible diferent de zero tenint en compte quanta ambigüitat real conté aquell flux, i tracteu una taxa que cau molt per sota d'aquest terra com una cosa a investigar, no a celebrar.
  6. Informeu de l'HIR per flux, mai com un sol número barrejat de tota l'empresa. Una sola mitjana amaga quin flux concret ha merescut de veritat menys supervisió i quin acumula risc en silenci sota una xifra de titular que fa bona cara.
  7. Torneu a comprovar la mostra «neta» amb un calendari. Traieu periòdicament accions registrades com a sense necessitat d'intervenció i feu que algú les revisi sense saber que estaven marcades com a netes. És l'única comprovació directa de si els vostres revisors encara llegeixen.
FL
Com ho sosté FabricLoop

Per això el Loop Agent està construït al voltant d'ask_human, resume i l'escalada per aplicació de canal, en lloc d'una autonomia silenciosa — un agent que s'atura per preguntar és un agent que apareix al numerador de l'HIR expressament, no un que han enxampat per accident. Les escalades i els esborranys surten als mateixos Grups on l'equip ja treballa, al costat de les tasques i les notes, de manera que el moment que necessitava una persona és visible allà on la feina ja viu — no enterrat en una consola d'agent a part que ningú no mira. A Enterprise, els registres d'auditoria permeten a IT i operacions veure què van fer els agents i exactament quan hi va intervenir un humà, que és la matèria primera amb què es construeix l'HIR d'entrada.

Poseu-ho al costat de la Llegibilitat — el concepte company perquè els permisos i l'accés també siguin visibles — i teniu les dues preguntes que tot desplegament d'IA hauria de poder respondre abans d'ampliar-se: qui pot veure què fa un agent, i amb quina freqüència una persona ha d'intervenir de veritat.


Idees clau
01
La Taxa d'Intervenció Humana és la part de les accions d'un agent, en un flux i un període, que van requerir que una persona corregís, anul·lés o respongués una pregunta plantejada per l'agent abans que la feina comptés com a feta. És una ràtio: intervencions dividides per accions totals.
02
Un revisor que aprova un esborrany que no necessitava canvis no és una intervenció. L'HIR mesura amb quina freqüència el resultat havia de canviar, no amb quina freqüència un humà va mirar alguna cosa.
03
La quota d'escalada — la part de les intervencions que l'agent va marcar ell mateix, davant de la part que un revisor va enxampar a posteriori — és la mètrica companya que diu si una HIR a la baixa reflecteix una millora real o menys gent que revisa de veritat.
04
Una baixada sana de l'HIR ve de tornar els motius de correcció a regles o exemples explícits, perquè el mateix error deixi de repetir-se — no de revisors cansats de llegir esborranys.
05
Un 0% d'intervenció sostingut en el temps és gairebé sempre un senyal d'alarma, no una fita. Sol voler dir que els revisors han deixat de llegir o que un camí d'escalada s'ha trencat en silenci — no que l'agent s'hagi tornat impecable.
06
L'objectiu real no és el número més baix possible. És un sistema que fa visibles els moments concrets que necessiten judici humà — i només aquells moments — perquè l'atenció d'una persona caigui allà on realment cal.
07
Per contrastar una HIR a la baixa, vigileu els senyals aigües avall — tiquets reoberts, queixes, recuperacions de reemborsaments, CSAT — per si hi ha una pujada que la taxa sola amagaria, i torneu a revisar periòdicament en fred una mostra d'accions de «no calia intervenció».
08
Per mesurar l'HIR en absolut, cal un registre a nivell de resultat (enviat tal qual, editat, rebutjat, escalat) — no només recomptes d'activitat. La majoria d'equips que fan córrer agents avui registren volum i res més.
09
Informeu de l'HIR per flux, no com una sola xifra barrejada de tota l'empresa. Una sola mitjana pot amagar un flux que de veritat ha merescut menys supervisió al costat d'un que acumula risc en silenci.