कागज़ की कला में एक व्हेल और मछलियों का झुंड प्रवाल भित्ति से साथ-साथ गुज़रते हुए, ऊपर से आती रोशनी की किरणों में, जो एक ऐसी व्यवस्था को दिखाता है जो लगभग अपने आप चलती है और फिर भी ऊपर से देखी जा रही है
AI और भरोसा

मानव हस्तक्षेप दर: वह एक मापदंड जो बताता है कि आपका AI रोलआउट सच में काम कर रहा है या नहीं

ज़्यादातर कंपनियाँ जो प्रोडक्शन में AI एजेंट चला रही हैं, यह नहीं बता सकतीं कि उन एजेंटों को असल में कितनी बार किसी व्यक्ति की ज़रूरत पड़ती है। मानव हस्तक्षेप दर वही संख्या है जो इस सवाल का जवाब देती है — और इस लेख के अंत तक आपको एक ऐसे वर्कफ़्लो के लिए इसे निकालना आ जाना चाहिए जिसे आप पहले से चला रहे हैं।

FabricLoop संपादकीय
2,180 शब्द
10 मिनट का पठन

AI संगठनों के लिए FabricLoop का अपना ढाँचा मानव हस्तक्षेप दर को साफ़ शब्दों में परिभाषित करता है: यह पूछता है कि स्वचालित काम को कितनी बार किसी व्यक्ति की ज़रूरत होती है। यही परिभाषा है, और यह लेख उससे नहीं हटता। आगे वह हिस्सा है जिसे कॉन्सेप्ट पेज पूरा नहीं लिखता: असली हिसाब, एक वास्तविक वर्कफ़्लो पर लगाया हुआ, उन संख्याओं के साथ जो विचार को आकांक्षा की जगह ठोस बनाती हैं।

यह संख्या असल में क्या मापती है

मानव हस्तक्षेप दर (HIR) किसी एजेंट की उन कार्रवाइयों का हिस्सा है, एक तय वर्कफ़्लो और एक समय अवधि के भीतर, जिनमें नतीजे को पूरा मानने से पहले किसी व्यक्ति को बीच में आना पड़ा। «बीच में आना» का यहाँ एक खास मतलब है: किसी व्यक्ति ने आउटपुट सुधारा, एजेंट के फ़ैसले को पलट दिया, या एजेंट के आगे बढ़ने से पहले उसके उठाए सवाल का जवाब दिया — जिसे FabricLoop का Loop Agent एक ask_human क्षण कहता है। उन कार्रवाइयों की गिनती को उसी अवधि में एजेंट की कुल कार्रवाइयों से भाग दें, और आपको HIR मिलता है।

यह मापदंड अपटाइम और सटीकता के बराबर जगह इसलिए पाता है, उनके नीचे नहीं, क्योंकि यह वह चीज़ मापता है जो वे संख्याएँ नहीं देख पातीं। कोई एजेंट किसी आंतरिक बेंचमार्क पर 95% सटीकता दिखा सकता है और फिर भी 80% वाले एजेंट से खराब रोलआउट हो सकता है, अगर उसके गलत 5% चुपचाप निकल जाएँ जबकि जिन 20% पर वह अनिश्चित है वे हर बार चिह्नित हों। HIR यह नहीं पूछता कि एजेंट अच्छा है या नहीं। वह पूछता है कि सिस्टम जानता है या नहीं कि उसे व्यक्ति कब चाहिए, और जब चाहिए तब कोई व्यक्ति सच में आता है या नहीं। यही दूसरा सवाल तय करता है कि रोलआउट को बढ़ाना सुरक्षित है या नहीं।

एक वास्तविक वर्कफ़्लो के लिए HIR निकालना

एक ऐसा वर्कफ़्लो लें जिसे IT या ऑपरेशंस टीम आज सच में चला सकती है: एक एजेंट आने वाले सपोर्ट टिकटों की छँटाई करता है, उन्हें वर्गीकृत करता है (बिलिंग, बग रिपोर्ट, रिफ़ंड, अकाउंट एक्सेस, और ऐसे ही), और पहला जवाब ड्राफ़्ट करता है। हर ड्राफ़्ट ग्राहक तक पहुँचने से पहले समीक्षा कतार में जाता है — कुछ भी अपने आप नहीं भेजा जाता। वह समीक्षा कदम, अपने आप में, हस्तक्षेप नहीं है। समीक्षक का ऐसे ड्राफ़्ट पर «भेजें» दबाना जिसमें कोई बदलाव नहीं चाहिए था, वर्कफ़्लो का डिज़ाइन के अनुसार चलना है। हस्तक्षेप तब होता है जब ड्राफ़्ट पर काम करना पड़ा: समीक्षक ने उसे फिर से लिखा, वर्गीकरण सुधारा, टिकट को दूसरी कतार में भेजा, या एजेंट ने काम के बीच में रुककर कुछ ड्राफ़्ट करने से पहले सवाल पूछा।

नीचे की संख्याएँ एक उदाहरण हैं, किसी असली कंपनी का डेटा नहीं — लेकिन कहानी का आकार, और उसके पीछे का हिसाब, ठीक वही है जो आप अपनी लॉग से बनाएँगे।

HIR सूत्र
HIR = हस्तक्षेप माँगने वाली कार्रवाइयाँ ÷ एजेंट की कुल कार्रवाइयाँ
वही वर्कफ़्लो, वही अवधि। केवल उन्हीं कार्रवाइयों को गिनें जिनमें किसी व्यक्ति ने नतीजा बदला। बिना बदलाव वाले ड्राफ़्ट को मंज़ूरी देना हस्तक्षेप नहीं है — और ऐसा ड्राफ़्ट भी नहीं जिसमें कोई बदलाव चाहिए ही नहीं था।
एस्केलेशन हिस्सा
एस्केलेशन हिस्सा = एजेंट की शुरू की गई माँगें ÷ कुल हस्तक्षेप
हर हस्तक्षेप को दो तरह में बाँटता है: एजेंट ने अपनी अनिश्चितता खुद चिह्नित की, या समीक्षक ने ऐसी गलती पकड़ी जिसे एजेंट ने चिह्नित नहीं किया। यही संख्या बताती है कि गिरता HIR अच्छी खबर है या नहीं।

पायलट महीने में एजेंट 640 टिकट छूता है। उनमें से 415 को हस्तक्षेप चाहिए — दोबारा लिखना, दोबारा वर्गीकरण, या दूसरी कतार में भेजना — और उन 415 में से केवल 75 ऐसे क्षण हैं जिन्हें एजेंट ने कुछ ड्राफ़्ट करने से पहले खुद चिह्नित किया। बाकी वे गलतियाँ हैं जिन्हें समीक्षक बाद में पकड़ता है। यह 64.8% का HIR है, और एस्केलेशन हिस्सा सिर्फ़ 18%: जब एजेंट गलत होता है, ज़्यादातर समय वह आत्मविश्वास से गलत होता है, और यह इस समस्या का सबसे खराब रूप है।

टीम सुधार लॉग निकालती है और हर हस्तक्षेप पर कारण का टैग लगाती है। दो श्रेणियाँ हावी हैं: डॉलर राशि वाली किसी भी बात पर एजेंट रिफ़ंड नीति गलत पढ़ता है, और जिन ग्राहकों का गुस्सा साफ़ दिख रहा हो, उन्हें शांत, प्रक्रियात्मक जवाब ड्राफ़्ट करता है। दोनों मॉडल को छुए बिना ठीक हो सकते हैं — एक साफ़ नियम जोड़ें कि $50 से ऊपर के रिफ़ंड का ज़िक्र करने वाला, या भावना की सीमा से ऊपर का कोई भी टिकट, ड्राफ़्ट की जगह ask_human एस्केलेशन चलाए। बाकी सब पहले की तरह ड्राफ़्ट और समीक्षा होता रहे।

महीनासंभाले गए टिकटहस्तक्षेपHIRएस्केलेशन हिस्सा
1 — पायलट 640 415 64.8% 18%
2 — नियम जोड़ने के बाद 810 224 27.7% 58%
3 — नियम फिर से ठीक किए 940 101 10.7% 79%

तीसरे महीने तक HIR 80% से ज़्यादा गिर चुका है, लेकिन ज़्यादा बताने वाली संख्या एस्केलेशन हिस्सा है: वह 18% से 79% तक चढ़ा। जो बचा है उसका बड़ा हिस्सा यह नहीं कि एजेंट गलत होते पकड़ा गया — यह है कि एजेंट सच में अस्पष्ट मामला (VIP अकाउंट, नीति का अपवाद, सीमा पर ठीक बैठने वाला रिफ़ंड) सही पहचानता है और काम करने से पहले पूछता है। गिरावट असली है, और अर्जित है: सुधार का हर दौर साफ़ नियमों में वापस गया, इसलिए जिन खास गलतियों ने उन्हें पैदा किया वे दोबारा नहीं हुईं, जबकि जिन श्रेणियों को अभी भी फ़ैसले की ज़रूरत है वे ड्राफ़्ट से टाले जाने की जगह चिह्नित होती रहीं।

जो गिरावट मायने रखती है वह है जिसमें एजेंट यह जानने में बेहतर होता है कि वह क्या नहीं जानता — वह नहीं जिसमें कोई व्यक्ति चुपचाप जाँचना बंद कर देता है।

गलती: शून्य को लक्ष्य मानना

जब कोई टीम महीने-दर-महीने HIR गिरते देखती है, अगला साफ़ सवाल यह होता है कि यह कितना नीचे जा सकता है। सहज प्रवृत्ति शून्य को फ़िनिश लाइन मानने की है — सबूत कि एजेंट आखिरकार बिना निगरानी चलने लायक हो गया। वह प्रवृत्ति उलटी है, और इस मापदंड की सबसे आम गलत पढ़त यही है।

0% आमतौर पर खतरे का संकेत क्यों है

जो वर्कफ़्लो हफ़्तों तक 0% हस्तक्षेप दिखाता है, उसका मतलब लगभग कभी यह नहीं होता कि एजेंट ने गलतियाँ करना बंद कर दिया। इसका मतलब होता है कि इनमें से एक हुआ: समीक्षकों ने मंज़ूरी से पहले ड्राफ़्ट सच में पढ़ना बंद कर दिया, या एस्केलेशन का रास्ता चुपचाप टूट गया — सीमाएँ ढीली हो गईं, कोई रूटिंग नियम बिना आवाज़ विफल हुआ, या ask_human ट्रिगर चलना बंद हो गया। दोनों ही स्थितियों में शून्य यह नहीं कहता कि सिस्टम को अब व्यक्ति की ज़रूरत नहीं। वह कहता है कि किसी व्यक्ति से पूछा जाना बंद हो गया, या उसने देखना बंद कर दिया।

असली लक्ष्य कभी अमूर्त रूप में कम हस्तक्षेप नहीं था। वह एक ऐसी व्यवस्था है जिसमें वे खास क्षण सामने आएँ जिन्हें किसी व्यक्ति के फ़ैसले की ज़रूरत है — और केवल वे क्षण — ताकि व्यक्ति का ध्यान वहीं जाए जहाँ सच में ज़रूरत है, हर चीज़ पर बराबर बँटने या पूरी तरह गायब होने की जगह। 12% HIR वाला वर्कफ़्लो, जिसमें उस 12% का लगभग सारा हिस्सा एजेंट का सच में अस्पष्ट या ऊँचे दाँव वाले मामलों को सही चिह्नित करना है, 2% वाले से ज़्यादा स्वस्थ है, जिसमें उस 2% का ज़्यादातर हिस्सा समीक्षक का ऐसी गलती पर ठोकर खाना है जिसे एजेंट ने कभी चिह्नित नहीं किया। कम संख्या बदतर व्यवस्था को छिपा सकती है।

एस्केलेशन हिस्सा ठीक इसी के लिए है। HIR के साथ देखने पर वह बताता है कि आप किस कहानी में हैं:

HIR का रुझान पढ़ना — वही गिरती संख्या, दो अलग अर्थ
0%, अनिश्चित काल तक
खतरे का संकेत — कोई नहीं देख रहा, दोषरहित व्यवस्था नहीं
महीनों तक ऊँचा और सपाट
सीख नहीं रहा — सुधार नियमों में वापस नहीं जा रहे
गिर रहा, हिस्सा भी गिर रहा
जाँचें — संभवतः बिना पढ़े लगी मुहर, असली प्रगति नहीं
गिर रहा, हिस्सा बढ़ रहा
भरोसा अर्जित — व्यवस्था अपनी सीमाएँ जानती है

अगर HIR गिर रहा है और एस्केलेशन हिस्सा सपाट है या गिर रहा है, तो उसे अभी जीत मत लिखें। «हस्तक्षेप की ज़रूरत नहीं» लिखी कार्रवाइयों का यादृच्छिक नमूना निकालें और किसी से उन्हें ठंडे दिमाग़ से देखवाएँ, यह बताए बिना कि नमूना साफ़ चिह्नित था। देखें कि आगे के संकेत — दोबारा खुले टिकट, शिकायतें, रिफ़ंड क्लॉबैक, CSAT — उसी समय ऊपर तो नहीं खिसक रहे। गिरता HIR और बढ़ती आगे की समस्याएँ ऐसी व्यवस्था नहीं जो तेज़ी से सीखी। वह ऐसी व्यवस्था है जिसे समय पर किसी ने नहीं पकड़ा।

अगर आज इसे मापना है तो क्या दर्ज करें

इसमें से कुछ भी नए टूल से उतना नहीं माँगता जितना सही चीज़ लॉग करने से। एजेंट चलाने वाली ज़्यादातर टीमें मात्रा पहले से ट्रैक करती हैं — उसने कितने टिकट छुए, कितने काम ड्राफ़्ट किए। लगभग कोई नतीजा नहीं ट्रैक करती, और HIR को असल में बस वही चाहिए।

  1. हर कार्रवाई का नतीजा लॉग करें, सिर्फ़ गतिविधि की गिनती नहीं। जैसा का तैसा भेजा गया, भेजने से पहले संपादित, अस्वीकार कर दोबारा लिखा, या एजेंट ने खुद एस्केलेट किया। नतीजे-स्तर की लॉगिंग के बिना HIR निकाला ही नहीं जा सकता — आपको पता चलेगा कि एजेंट ने कुछ किया, यह नहीं कि उसे ठीक करना पड़ा या नहीं।
  2. अंश ठीक करने से पहले हर तय करें। तय करें कि इस वर्कफ़्लो में एक कार्रवाई क्या है — एक छुआ टिकट, एक ड्राफ़्ट किया काम — और वह परिभाषा अवधियों में स्थिर रखें, ताकि HIR का बदलाव एजेंट के फ़ैसले को दिखाए, गिनती के तरीके के बदलाव को नहीं।
  3. हर हस्तक्षेप पर कारण का टैग लगाएँ। «संपादित» लगभग कुछ नहीं बताता। «संपादित: $50 से ऊपर रिफ़ंड नीति गलत लगाई» ठीक बताता है कि आगे क्या सुधारना है। छोटा, एक जैसा वर्गीकरण सुधार लॉग को स्कोरबोर्ड की जगह काम की सूची बना देता है।
  4. एस्केलेशन हिस्सा HIR के साथ ट्रैक करें, उसकी जगह नहीं। दोनों संख्याएँ मिलकर बताती हैं कि गिरावट अर्जित है या उधार की — ऊपर की रुझान तालिका देखें।
  5. शून्य का लक्ष्य नहीं, एक फ़र्श तय करें। हर वर्कफ़्लो के लिए तय करें कि उसमें जितनी असली अस्पष्टता है, उसके हिसाब से एक विश्वसनीय गैर-शून्य HIR कैसा दिखता है, और जो दर उस फ़र्श से काफी नीचे गिरे उसे मनाने की चीज़ नहीं, जाँचने की चीज़ मानें।
  6. HIR हर वर्कफ़्लो के लिए रिपोर्ट करें, कंपनी-भर की एक मिली हुई संख्या के रूप में कभी नहीं। एक औसत छिपा देता है कि किस खास वर्कफ़्लो ने सच में कम निगरानी अर्जित की है और कौन अच्छा दिखने वाले शीर्षक के नीचे चुपचाप जोखिम जमा कर रहा है।
  7. «साफ़» नमूने को समय-सारणी पर दोबारा जाँचें। समय-समय पर वे कार्रवाइयाँ निकालें जो बिना हस्तक्षेप दर्ज हुईं और किसी से उन्हें यह बताए बिना देखवाएँ कि वे साफ़ चिह्नित थीं। यही एक सीधी जाँच है कि आपके समीक्षक अभी भी पढ़ रहे हैं या नहीं।
FL
FabricLoop इसमें कैसे मदद करता है

इसीलिए Loop Agent चुप स्वायत्तता की जगह ask_human, resume और चैनल-ऐप एस्केलेशन के आसपास बना है — जो एजेंट पूछने के लिए रुकता है वह आपके HIR के अंश में जानबूझकर दिखता है, वह नहीं जो संयोग से पकड़ा गया। एस्केलेशन और ड्राफ़्ट उन्हीं समूहों में आते हैं जहाँ टीम पहले से काम करती है, कार्य और नोट्स के बगल में, इसलिए जिस क्षण को व्यक्ति चाहिए था वह वहीं दिखता है जहाँ काम पहले से रहता है — किसी अलग एजेंट कंसोल में दबा नहीं जिसे कोई नहीं देखता। Enterprise पर ऑडिट लॉग IT और ऑपरेशंस को दिखाते हैं कि एजेंटों ने क्या किया और कोई इंसान ठीक कब बीच में आया, और यही वह कच्चा माल है जिससे HIR शुरू से बनता है।

इसे पठनीयता के साथ रखें — साथ का वह कॉन्सेप्ट जो अनुदान और पहुँच को भी दृश्य रखता है — और आपको वे दो सवाल मिलते हैं जिनका जवाब हर AI रोलआउट को फैलने से पहले देना आना चाहिए: कौन देख सकता है कि एजेंट क्या कर रहा है, और किसी व्यक्ति को असल में कितनी बार बीच में आना पड़ता है।


मुख्य बातें
01
मानव हस्तक्षेप दर एजेंट की उन कार्रवाइयों का हिस्सा है, एक वर्कफ़्लो और एक अवधि में, जिनमें काम पूरा गिने जाने से पहले किसी व्यक्ति को सुधारना, पलटना, या एजेंट के सवाल का जवाब देना पड़ा। यह अनुपात है: हस्तक्षेप भाग कुल कार्रवाइयाँ।
02
ऐसे ड्राफ़्ट को मंज़ूरी देना जिसमें बदलाव नहीं चाहिए था, हस्तक्षेप नहीं है। HIR मापता है कि नतीजा कितनी बार बदलना पड़ा, यह नहीं कि किसी इंसान ने कितनी बार कुछ देखा।
03
एस्केलेशन हिस्सा — हस्तक्षेपों का वह भाग जिसे एजेंट ने खुद चिह्नित किया, बनाम जिसे समीक्षक ने बाद में पकड़ा — साथ का मापदंड है जो बताता है कि गिरता HIR असली सुधार है या कम लोग सच में जाँच रहे हैं।
04
HIR की स्वस्थ गिरावट सुधार के कारणों को साफ़ नियमों या उदाहरणों में वापस डालने से आती है, ताकि वही गलती दोबारा न हो — इससे नहीं कि समीक्षक ड्राफ़्ट पढ़ते-पढ़ते थक गए।
05
लंबे समय तक 0% हस्तक्षेप लगभग हमेशा खतरे का संकेत है, कोई उपलब्धि नहीं। इसका मतलब आमतौर पर यह होता है कि समीक्षकों ने पढ़ना बंद कर दिया या एस्केलेशन का रास्ता चुपचाप टूट गया — यह नहीं कि एजेंट दोषरहित हो गया।
06
असली लक्ष्य सबसे कम संभव संख्या नहीं है। वह ऐसी व्यवस्था है जो मानव फ़ैसले वाले खास क्षणों को दृश्य बनाती है — और केवल वे क्षण — ताकि व्यक्ति का ध्यान वहीं पड़े जहाँ सच में ज़रूरत है।
07
गिरते HIR की जाँच के लिए आगे के संकेत देखें — दोबारा खुले टिकट, शिकायतें, रिफ़ंड क्लॉबैक, CSAT — उस बढ़त के लिए जिसे दर अकेले छिपा देगी, और «हस्तक्षेप की ज़रूरत नहीं» कार्रवाइयों के नमूने को समय-समय पर ठंडे दिमाग़ से दोबारा देखें।
08
HIR मापने के लिए नतीजे-स्तर की लॉगिंग चाहिए (जैसा का तैसा भेजा, संपादित, अस्वीकार, एस्केलेट) — सिर्फ़ गतिविधि की गिनती नहीं। आज एजेंट चलाने वाली ज़्यादातर टीमें मात्रा लॉग करती हैं और कुछ नहीं।
09
HIR हर वर्कफ़्लो के हिसाब से रिपोर्ट करें, कंपनी-भर की एक मिली हुई संख्या के रूप में नहीं। एक औसत ऐसे वर्कफ़्लो को छिपा सकता है जिसने सच में कम निगरानी अर्जित की है, उसके बगल में जो चुपचाप जोखिम जमा कर रहा है।