Eine Papierkunst-Illustration eines Wals und eines Fischschwarms, die gemeinsam durch ein Korallenriff ziehen, beleuchtet von Lichtstrahlen von der Oberfläche – Bild für ein weitgehend eigenständiges System, das von oben noch beobachtet wird
KI & Vertrauen

Human Intervention Rate: Die eine Kennzahl, die zeigt, ob Ihr KI-Rollout wirklich funktioniert

Die meisten Unternehmen, die KI-Agenten in Produktion betreiben, können nicht sagen, wie oft diese Agenten tatsächlich eine Person brauchen. Die Human Intervention Rate ist die Zahl, die diese Frage beantwortet – und am Ende dieses Beitrags sollten Sie sie für einen Workflow berechnen können, den Sie schon heute fahren.

FabricLoop Redaktion
2.180 Wörter
10 Min. Lesezeit

FabricLoops eigener Rahmen für KI-Organisationen definiert die Human Intervention Rate klar: Sie fragt, wie oft automatisierte Arbeit eine Person braucht. Das ist die Definition, und dieser Beitrag weicht nicht davon ab. Was folgt, ist der Teil, den die Konzeptseite nicht vollständig ausführt: die konkrete Rechnung, angewandt auf einen echten Workflow, mit den Zahlen, die die Idee konkret machen statt nur erstrebenswert.

Was die Zahl tatsächlich misst

Die Human Intervention Rate (HIR) ist der Anteil der Aktionen eines Agenten – innerhalb eines definierten Workflows und eines Zeitraums –, bei denen eine Person eingreifen musste, bevor das Ergebnis als fertig gelten konnte. „Eingreifen“ hat hier eine konkrete Bedeutung: Eine Person hat die Ausgabe korrigiert, eine Entscheidung des Agenten überschrieben oder eine Frage beantwortet, die der Agent ausdrücklich gestellt hat, bevor er fortfahren würde – was FabricLoops Loop Agent einen ask_human-Moment nennt. Teilen Sie die Anzahl dieser Aktionen durch die Gesamtzahl der Aktionen, die der Agent im selben Zeitraum ausgeführt hat, und Sie haben die HIR.

Der Grund, warum diese Kennzahl neben Verfügbarkeit und Genauigkeit steht und nicht darunter, ist, dass sie etwas misst, das diese Zahlen nicht sehen. Ein Agent kann bei einem internen Benchmark 95 % Genauigkeit erreichen und trotzdem ein schlechterer Rollout sein als einer mit 80 %, wenn die 5 %, die er falsch macht, still durchrutschen, während die 20 %, bei denen er unsicher ist, jedes Mal markiert werden. Die HIR fragt nicht, ob der Agent gut ist. Sie fragt, ob das System weiß, wann es eine Person braucht, und ob eine Person tatsächlich erscheint, wenn das der Fall ist. Diese zweite Frage entscheidet, ob ein Rollout sicher erweitert werden kann.

Die HIR für einen echten Workflow berechnen

Nehmen Sie einen Workflow, den ein IT- oder Operations-Team heute tatsächlich fahren könnte: Ein Agent triagiert eingehende Support-Tickets, klassifiziert sie (Abrechnung, Fehlerbericht, Erstattung, Kontozugang und so weiter) und entwirft eine erste Antwort. Jeder Entwurf landet in einer Prüfwarteschlange, bevor er einen Kunden erreicht – nichts geht von allein raus. Dieser Prüfschritt allein ist keine Intervention. Wenn eine prüfende Person bei einem Entwurf, der keine Änderungen brauchte, auf „Senden“ klickt, arbeitet der Workflow wie vorgesehen. Intervention ist das, was passiert, wenn der Entwurf Arbeit brauchte: Die prüfende Person hat ihn umgeschrieben, die Klassifizierung korrigiert, das Ticket in eine andere Warteschlange umgeleitet, oder der Agent selbst hat mitten in der Aufgabe pausiert und eine Frage gestellt, bevor er überhaupt etwas entworfen hat.

Die Zahlen unten sind ein illustratives Beispiel, keine Daten eines echten Unternehmens – aber die Form der Geschichte und die Rechnung dahinter sind genau das, was Sie aus Ihren eigenen Logs bauen würden.

HIR-Formel
HIR = Aktionen mit Intervention ÷ Aktionen des Agenten insgesamt
Gleicher Workflow, gleicher Zeitraum. Zählen Sie nur Aktionen, bei denen eine Person das Ergebnis verändert hat. Eine prüfende Person, die einen unveränderten Entwurf freigibt, zählt nicht als Intervention – und ein Entwurf, der gar keine Änderungen brauchte, ebenfalls nicht.
Eskalationsanteil
Eskalationsanteil = Vom Agenten ausgelöste Fragen ÷ Interventionen insgesamt
Teilt jede Intervention in zwei Arten: Der Agent hat seine eigene Unsicherheit markiert, oder eine prüfende Person hat einen Fehler entdeckt, den der Agent nicht markiert hat. Das ist die Zahl, die sagt, ob eine fallende HIR eine gute Nachricht ist.

Im Pilotmonat berührt der Agent 640 Tickets. Davon brauchen 415 eine Intervention – eine Umschreibung, eine Neuklassifizierung oder eine Umleitung – und nur 75 dieser 415 sind Momente, die der Agent selbst markiert hat, bevor er etwas entworfen hat. Der Rest sind Fehler, die eine prüfende Person im Nachhinein entdeckt. Das ist eine HIR von 64,8 %, bei einem Eskalationsanteil von nur 18 %: Der Agent liegt die meiste Zeit, in der er falsch liegt, selbstbewusst falsch – die schlechteste Variante dieses Problems.

Das Team zieht das Korrekturprotokoll und versieht jede Intervention mit einem Grund. Zwei Kategorien dominieren: Der Agent liest die Erstattungsrichtlinie falsch, sobald ein Betrag im Spiel ist, und er entwirft ruhige, verfahrenstechnische Antworten an Kundinnen und Kunden, die sichtbar wütend sind. Beides lässt sich beheben, ohne das Modell anzufassen – eine explizite Regel, dass jedes Ticket mit einer Erstattung über 50 $ oder über einer Stimmungsschwelle eine ask_human-Eskalation auslöst statt eines Entwurfs. Alles andere wird weiterhin entworfen und geprüft wie zuvor.

MonatBearbeitete TicketsInterventionenHIREskalationsanteil
1 — Pilot 640 415 64,8 % 18 %
2 — Nach hinzugefügten Regeln 810 224 27,7 % 58 %
3 — Regeln erneut justiert 940 101 10,7 % 79 %

Bis Monat drei ist die HIR um mehr als 80 % gefallen, aber die aussagekräftigere Zahl ist der Eskalationsanteil: Er stieg von 18 % auf 79 %. Das meiste, was übrig bleibt, ist nicht, dass der Agent beim Falschliegen ertappt wird – es ist, dass der Agent einen wirklich mehrdeutigen Fall richtig erkennt (ein VIP-Konto, eine Richtlinienausnahme, eine Erstattung genau an der Schwelle) und fragt, bevor er handelt. Der Rückgang ist echt, und er ist verdient: Jede Korrekturrunde floss in explizite Regeln zurück, sodass die konkreten Fehler, die sie erzeugt hatten, nicht wiederkehrten, während die Kategorien, die weiterhin Urteil brauchen, markiert werden, statt dass man um sie herum entwirft.

Der Rückgang, der zählt, ist der, bei dem der Agent besser weiß, was er nicht weiß – nicht der, bei dem eine Person still aufhört zu prüfen.

Der Fehler: null als Ziel zu behandeln

Sobald ein Team zusieht, wie die HIR Monat für Monat fällt, ist die naheliegende nächste Frage, wie tief sie sinken kann. Der Instinkt ist, null als Ziellinie zu behandeln – der Beweis, dass der Agent endlich gut genug ist, um unbeaufsichtigt zu laufen. Dieser Instinkt ist verkehrt, und er ist die häufigste Fehldeutung dieser Kennzahl.

Warum 0 % meist ein Warnsignal ist

Ein Workflow, der wochenlang 0 % Intervention zeigt, bedeutet fast nie, dass der Agent aufgehört hat, Fehler zu machen. Es bedeutet, dass eines von zwei Dingen passiert ist: Prüfende haben aufgehört, die Entwürfe vor der Freigabe wirklich zu lesen, oder der Eskalationspfad ist still kaputtgegangen – Schwellen wurden gelockert, eine Routing-Regel ist lautlos fehlgeschlagen, oder der ask_human-Auslöser hat aufgehört zu feuern. So oder so sagt die Null nicht, dass das System keine Person mehr braucht. Sie sagt, dass eine Person nicht mehr gefragt wird oder nicht mehr hinschaut.

Das eigentliche Ziel war nie weniger Interventionen im Abstrakten. Es ist ein System, in dem die konkreten Momente, die das Urteil einer Person brauchen, sichtbar werden – und nur diese Momente –, sodass die Aufmerksamkeit einer Person dorthin geht, wo sie tatsächlich gebraucht wird, statt gleichmäßig über alles verteilt zu werden oder ganz zu fehlen. Ein Workflow bei 12 % HIR, bei dem fast alle dieser 12 % der Agent sind, der wirklich mehrdeutige oder folgenreiche Fälle richtig markiert, ist gesünder als einer bei 2 %, bei dem der größte Teil dieser 2 % eine prüfende Person ist, die über einen Fehler stolpert, den der Agent nie markiert hat. Die niedrigere Zahl kann das schlechtere System verbergen.

Genau dafür ist der Eskalationsanteil da. Neben der HIR betrachtet, sagt er Ihnen, in welcher Geschichte Sie stecken:

Eine HIR-Tendenz lesen – dieselbe fallende Zahl, zwei verschiedene Bedeutungen
0 %, auf Dauer
Warnsignal — niemand schaut hin, kein fehlerfreies System
Hoch und monatelang flach
Lernt nicht — Korrekturen fließen nicht in Regeln zurück
Fallend, Anteil fällt mit
Prüfen — wahrscheinlich abgenickte Freigaben, kein echter Fortschritt
Fallend, Anteil steigt
Vertrauen verdient — das System kennt seine eigenen Grenzen

Wenn die HIR sinkt, während der Eskalationsanteil flach bleibt oder fällt, verbuchen Sie das noch nicht als Erfolg. Ziehen Sie eine Zufallsstichprobe der Aktionen, die als „keine Intervention nötig“ protokolliert wurden, und lassen Sie jemanden sie unvoreingenommen prüfen, ohne zu sagen, dass die Stichprobe als sauber markiert war. Prüfen Sie, ob nachgelagerte Signale – Tickets, die wieder geöffnet werden, Beschwerden, Erstattungsrückforderungen, CSAT – gleichzeitig nach oben driften. Eine fallende HIR bei steigenden nachgelagerten Problemen ist kein System, das schneller gelernt hat. Es ist ein System, das niemand rechtzeitig erwischt hat.

Was Sie instrumentieren sollten, wenn Sie das heute messen wollen

Nichts davon verlangt so sehr neue Werkzeuge wie das Protokollieren der richtigen Sache. Die meisten Teams, die einen Agenten betreiben, erfassen bereits Volumen – wie viele Tickets er berührt, wie viele Aufgaben er entworfen hat. Fast keines erfasst das Ergebnis, und genau das braucht die HIR.

  1. Protokollieren Sie ein Ergebnis für jede Aktion, nicht nur eine Aktivitätszahl. Unverändert gesendet, vor dem Senden bearbeitet, abgelehnt und neu geschrieben, oder vom Agenten selbst eskaliert. Ohne Protokollierung auf Ergebnisebene lässt sich die HIR gar nicht berechnen – Sie wissen, dass der Agent etwas getan hat, nicht, ob es korrigiert werden musste.
  2. Fixieren Sie den Nenner, bevor Sie den Zähler fixieren. Entscheiden Sie, was für diesen Workflow als eine Aktion zählt – ein berührtes Ticket, eine entworfene Aufgabe – und halten Sie diese Definition über Zeiträume hinweg stabil, damit eine Änderung der HIR das Urteil des Agenten widerspiegelt und nicht eine Änderung Ihrer Zählweise.
  3. Versehen Sie jede Intervention mit einem Grund. „Bearbeitet“ sagt fast nichts. „Bearbeitet: Erstattungsrichtlinie über 50 $ falsch angewandt“ sagt genau, was als Nächstes zu beheben ist. Eine kurze, konsistente Taxonomie macht aus einem Korrekturprotokoll eine Aufgabenliste statt einer Anzeigetafel.
  4. Verfolgen Sie den Eskalationsanteil neben der HIR, nicht an ihrer Stelle. Die beiden Zahlen zusammen sagen Ihnen, ob ein Rückgang verdient oder geliehen ist – siehe die Tendenz oben.
  5. Setzen Sie eine Untergrenze, kein Ziel von null. Entscheiden Sie pro Workflow, wie eine plausible HIR ungleich null aussieht, gegeben wie viel echte Mehrdeutigkeit dieser Workflow enthält, und behandeln Sie eine Rate, die deutlich unter diese Untergrenze fällt, als etwas, das untersucht werden muss, nicht als etwas, das gefeiert wird.
  6. Berichten Sie die HIR pro Workflow, niemals als eine vermischte unternehmensweite Zahl. Ein einzelner Durchschnitt verbirgt, welcher konkrete Workflow tatsächlich weniger Aufsicht verdient hat und welcher still Risiko unter einer gut aussehenden Schlagzeile anhäuft.
  7. Prüfen Sie die „saubere“ Stichprobe nach einem Zeitplan nach. Ziehen Sie regelmäßig Aktionen, die als ohne Interventionsbedarf protokolliert wurden, und lassen Sie jemanden sie prüfen, ohne zu wissen, dass sie als sauber markiert waren. Das ist die einzige direkte Prüfung, ob Ihre Prüfenden noch lesen.
FL
Wie FabricLoop dabei hilft

Deshalb ist Loop Agent um ask_human, resume und Channel-App-Eskalation gebaut statt um stille Autonomie – ein Agent, der pausiert, um zu fragen, ist ein Agent, der absichtlich im Zähler Ihrer HIR auftaucht, nicht einer, der zufällig ertappt wurde. Eskalationen und Entwürfe erscheinen in denselben Gruppen, in denen das Team schon arbeitet, neben Aufgaben und Notizen, sodass der Moment, der eine Person brauchte, dort sichtbar ist, wo die Arbeit schon lebt – nicht vergraben in einer separaten Agentenkonsole, die niemand prüft. Im Enterprise-Tarif lassen Audit-Logs IT und Operations sehen, was Agenten getan haben und genau wann ein Mensch eingegriffen hat, und genau das ist das Rohmaterial, aus dem die HIR überhaupt gebaut wird.

Stellen Sie das neben Lesbarkeit – das begleitende Konzept, damit auch Berechtigungen und Zugriffe sichtbar sind – und Sie haben die zwei Fragen, die jeder KI-Rollout beantworten können sollte, bevor er erweitert wird: Wer kann sehen, was ein Agent tut, und wie oft muss eine Person tatsächlich eingreifen.


Die wichtigsten Erkenntnisse
01
Die Human Intervention Rate ist der Anteil der Aktionen eines Agenten, in einem Workflow und einem Zeitraum, bei denen eine Person korrigieren, überschreiben oder eine vom Agenten gestellte Frage beantworten musste, bevor die Arbeit als erledigt galt. Es ist ein Verhältnis: Interventionen geteilt durch Aktionen insgesamt.
02
Eine prüfende Person, die einen Entwurf freigibt, der keine Änderungen brauchte, ist keine Intervention. Die HIR misst, wie oft das Ergebnis sich ändern musste, nicht wie oft ein Mensch etwas angesehen hat.
03
Der Eskalationsanteil – der Teil der Interventionen, den der Agent selbst markiert hat, gegenüber dem Teil, den eine prüfende Person im Nachhinein entdeckt hat – ist die begleitende Kennzahl, die sagt, ob eine fallende HIR echte Verbesserung widerspiegelt oder weniger Menschen, die tatsächlich prüfen.
04
Ein gesunder Rückgang der HIR kommt daher, dass Korrekturgründe in explizite Regeln oder Beispiele zurückfließen, sodass derselbe Fehler nicht wiederkehrt – nicht daher, dass Prüfende das Lesen von Entwürfen leid sind.
05
0 % Intervention über die Zeit ist fast immer ein Warnsignal, kein Meilenstein. Meist bedeutet es, dass Prüfende aufgehört haben zu lesen oder ein Eskalationspfad still kaputtgegangen ist – nicht, dass der Agent fehlerfrei geworden ist.
06
Das eigentliche Ziel ist nicht die niedrigstmögliche Zahl. Es ist ein System, das die konkreten Momente sichtbar macht, die menschliches Urteil brauchen – und nur diese Momente –, sodass die Aufmerksamkeit einer Person dort landet, wo sie tatsächlich gebraucht wird.
07
Um eine fallende HIR gegenzuprüfen, beobachten Sie nachgelagerte Signale – wieder geöffnete Tickets, Beschwerden, Erstattungsrückforderungen, CSAT – auf einen Anstieg, den die Rate allein verbergen würde, und prüfen Sie regelmäßig eine Stichprobe von Aktionen mit „keine Intervention nötig“ unvoreingenommen nach.
08
Um die HIR überhaupt zu messen, brauchen Sie Protokollierung auf Ergebnisebene (unverändert gesendet, bearbeitet, abgelehnt, eskaliert) – nicht nur Aktivitätszahlen. Die meisten Teams, die heute Agenten betreiben, protokollieren Volumen und sonst nichts.
09
Berichten Sie die HIR pro Workflow, nicht als eine vermischte unternehmensweite Zahl. Ein einzelner Durchschnitt kann einen Workflow verbergen, der tatsächlich weniger Aufsicht verdient hat, neben einem, der still Risiko anhäuft.