मानव हस्तक्षेप दर: वह एक मापदंड जो बताता है कि आपका AI रोलआउट सच में काम कर रहा है या नहीं
ज़्यादातर कंपनियाँ जो प्रोडक्शन में AI एजेंट चला रही हैं, यह नहीं बता सकतीं कि उन एजेंटों को असल में कितनी बार किसी व्यक्ति की ज़रूरत पड़ती है। मानव हस्तक्षेप दर वही संख्या है जो इस सवाल का जवाब देती है — और इस लेख के अंत तक आपको एक ऐसे वर्कफ़्लो के लिए इसे निकालना आ जाना चाहिए जिसे आप पहले से चला रहे हैं।
AI संगठनों के लिए FabricLoop का अपना ढाँचा मानव हस्तक्षेप दर को साफ़ शब्दों में परिभाषित करता है: यह पूछता है कि स्वचालित काम को कितनी बार किसी व्यक्ति की ज़रूरत होती है। यही परिभाषा है, और यह लेख उससे नहीं हटता। आगे वह हिस्सा है जिसे कॉन्सेप्ट पेज पूरा नहीं लिखता: असली हिसाब, एक वास्तविक वर्कफ़्लो पर लगाया हुआ, उन संख्याओं के साथ जो विचार को आकांक्षा की जगह ठोस बनाती हैं।
यह संख्या असल में क्या मापती है
मानव हस्तक्षेप दर (HIR) किसी एजेंट की उन कार्रवाइयों का हिस्सा है, एक तय वर्कफ़्लो और एक समय अवधि के भीतर, जिनमें नतीजे को पूरा मानने से पहले किसी व्यक्ति को बीच में आना पड़ा। «बीच में आना» का यहाँ एक खास मतलब है: किसी व्यक्ति ने आउटपुट सुधारा, एजेंट के फ़ैसले को पलट दिया, या एजेंट के आगे बढ़ने से पहले उसके उठाए सवाल का जवाब दिया — जिसे FabricLoop का Loop Agent एक ask_human क्षण कहता है। उन कार्रवाइयों की गिनती को उसी अवधि में एजेंट की कुल कार्रवाइयों से भाग दें, और आपको HIR मिलता है।
यह मापदंड अपटाइम और सटीकता के बराबर जगह इसलिए पाता है, उनके नीचे नहीं, क्योंकि यह वह चीज़ मापता है जो वे संख्याएँ नहीं देख पातीं। कोई एजेंट किसी आंतरिक बेंचमार्क पर 95% सटीकता दिखा सकता है और फिर भी 80% वाले एजेंट से खराब रोलआउट हो सकता है, अगर उसके गलत 5% चुपचाप निकल जाएँ जबकि जिन 20% पर वह अनिश्चित है वे हर बार चिह्नित हों। HIR यह नहीं पूछता कि एजेंट अच्छा है या नहीं। वह पूछता है कि सिस्टम जानता है या नहीं कि उसे व्यक्ति कब चाहिए, और जब चाहिए तब कोई व्यक्ति सच में आता है या नहीं। यही दूसरा सवाल तय करता है कि रोलआउट को बढ़ाना सुरक्षित है या नहीं।
एक वास्तविक वर्कफ़्लो के लिए HIR निकालना
एक ऐसा वर्कफ़्लो लें जिसे IT या ऑपरेशंस टीम आज सच में चला सकती है: एक एजेंट आने वाले सपोर्ट टिकटों की छँटाई करता है, उन्हें वर्गीकृत करता है (बिलिंग, बग रिपोर्ट, रिफ़ंड, अकाउंट एक्सेस, और ऐसे ही), और पहला जवाब ड्राफ़्ट करता है। हर ड्राफ़्ट ग्राहक तक पहुँचने से पहले समीक्षा कतार में जाता है — कुछ भी अपने आप नहीं भेजा जाता। वह समीक्षा कदम, अपने आप में, हस्तक्षेप नहीं है। समीक्षक का ऐसे ड्राफ़्ट पर «भेजें» दबाना जिसमें कोई बदलाव नहीं चाहिए था, वर्कफ़्लो का डिज़ाइन के अनुसार चलना है। हस्तक्षेप तब होता है जब ड्राफ़्ट पर काम करना पड़ा: समीक्षक ने उसे फिर से लिखा, वर्गीकरण सुधारा, टिकट को दूसरी कतार में भेजा, या एजेंट ने काम के बीच में रुककर कुछ ड्राफ़्ट करने से पहले सवाल पूछा।
नीचे की संख्याएँ एक उदाहरण हैं, किसी असली कंपनी का डेटा नहीं — लेकिन कहानी का आकार, और उसके पीछे का हिसाब, ठीक वही है जो आप अपनी लॉग से बनाएँगे।
पायलट महीने में एजेंट 640 टिकट छूता है। उनमें से 415 को हस्तक्षेप चाहिए — दोबारा लिखना, दोबारा वर्गीकरण, या दूसरी कतार में भेजना — और उन 415 में से केवल 75 ऐसे क्षण हैं जिन्हें एजेंट ने कुछ ड्राफ़्ट करने से पहले खुद चिह्नित किया। बाकी वे गलतियाँ हैं जिन्हें समीक्षक बाद में पकड़ता है। यह 64.8% का HIR है, और एस्केलेशन हिस्सा सिर्फ़ 18%: जब एजेंट गलत होता है, ज़्यादातर समय वह आत्मविश्वास से गलत होता है, और यह इस समस्या का सबसे खराब रूप है।
टीम सुधार लॉग निकालती है और हर हस्तक्षेप पर कारण का टैग लगाती है। दो श्रेणियाँ हावी हैं: डॉलर राशि वाली किसी भी बात पर एजेंट रिफ़ंड नीति गलत पढ़ता है, और जिन ग्राहकों का गुस्सा साफ़ दिख रहा हो, उन्हें शांत, प्रक्रियात्मक जवाब ड्राफ़्ट करता है। दोनों मॉडल को छुए बिना ठीक हो सकते हैं — एक साफ़ नियम जोड़ें कि $50 से ऊपर के रिफ़ंड का ज़िक्र करने वाला, या भावना की सीमा से ऊपर का कोई भी टिकट, ड्राफ़्ट की जगह ask_human एस्केलेशन चलाए। बाकी सब पहले की तरह ड्राफ़्ट और समीक्षा होता रहे।
| महीना | संभाले गए टिकट | हस्तक्षेप | HIR | एस्केलेशन हिस्सा |
|---|---|---|---|---|
| 1 — पायलट | 640 | 415 | 64.8% | 18% |
| 2 — नियम जोड़ने के बाद | 810 | 224 | 27.7% | 58% |
| 3 — नियम फिर से ठीक किए | 940 | 101 | 10.7% | 79% |
तीसरे महीने तक HIR 80% से ज़्यादा गिर चुका है, लेकिन ज़्यादा बताने वाली संख्या एस्केलेशन हिस्सा है: वह 18% से 79% तक चढ़ा। जो बचा है उसका बड़ा हिस्सा यह नहीं कि एजेंट गलत होते पकड़ा गया — यह है कि एजेंट सच में अस्पष्ट मामला (VIP अकाउंट, नीति का अपवाद, सीमा पर ठीक बैठने वाला रिफ़ंड) सही पहचानता है और काम करने से पहले पूछता है। गिरावट असली है, और अर्जित है: सुधार का हर दौर साफ़ नियमों में वापस गया, इसलिए जिन खास गलतियों ने उन्हें पैदा किया वे दोबारा नहीं हुईं, जबकि जिन श्रेणियों को अभी भी फ़ैसले की ज़रूरत है वे ड्राफ़्ट से टाले जाने की जगह चिह्नित होती रहीं।
जो गिरावट मायने रखती है वह है जिसमें एजेंट यह जानने में बेहतर होता है कि वह क्या नहीं जानता — वह नहीं जिसमें कोई व्यक्ति चुपचाप जाँचना बंद कर देता है।
गलती: शून्य को लक्ष्य मानना
जब कोई टीम महीने-दर-महीने HIR गिरते देखती है, अगला साफ़ सवाल यह होता है कि यह कितना नीचे जा सकता है। सहज प्रवृत्ति शून्य को फ़िनिश लाइन मानने की है — सबूत कि एजेंट आखिरकार बिना निगरानी चलने लायक हो गया। वह प्रवृत्ति उलटी है, और इस मापदंड की सबसे आम गलत पढ़त यही है।
जो वर्कफ़्लो हफ़्तों तक 0% हस्तक्षेप दिखाता है, उसका मतलब लगभग कभी यह नहीं होता कि एजेंट ने गलतियाँ करना बंद कर दिया। इसका मतलब होता है कि इनमें से एक हुआ: समीक्षकों ने मंज़ूरी से पहले ड्राफ़्ट सच में पढ़ना बंद कर दिया, या एस्केलेशन का रास्ता चुपचाप टूट गया — सीमाएँ ढीली हो गईं, कोई रूटिंग नियम बिना आवाज़ विफल हुआ, या ask_human ट्रिगर चलना बंद हो गया। दोनों ही स्थितियों में शून्य यह नहीं कहता कि सिस्टम को अब व्यक्ति की ज़रूरत नहीं। वह कहता है कि किसी व्यक्ति से पूछा जाना बंद हो गया, या उसने देखना बंद कर दिया।
असली लक्ष्य कभी अमूर्त रूप में कम हस्तक्षेप नहीं था। वह एक ऐसी व्यवस्था है जिसमें वे खास क्षण सामने आएँ जिन्हें किसी व्यक्ति के फ़ैसले की ज़रूरत है — और केवल वे क्षण — ताकि व्यक्ति का ध्यान वहीं जाए जहाँ सच में ज़रूरत है, हर चीज़ पर बराबर बँटने या पूरी तरह गायब होने की जगह। 12% HIR वाला वर्कफ़्लो, जिसमें उस 12% का लगभग सारा हिस्सा एजेंट का सच में अस्पष्ट या ऊँचे दाँव वाले मामलों को सही चिह्नित करना है, 2% वाले से ज़्यादा स्वस्थ है, जिसमें उस 2% का ज़्यादातर हिस्सा समीक्षक का ऐसी गलती पर ठोकर खाना है जिसे एजेंट ने कभी चिह्नित नहीं किया। कम संख्या बदतर व्यवस्था को छिपा सकती है।
एस्केलेशन हिस्सा ठीक इसी के लिए है। HIR के साथ देखने पर वह बताता है कि आप किस कहानी में हैं:
अगर HIR गिर रहा है और एस्केलेशन हिस्सा सपाट है या गिर रहा है, तो उसे अभी जीत मत लिखें। «हस्तक्षेप की ज़रूरत नहीं» लिखी कार्रवाइयों का यादृच्छिक नमूना निकालें और किसी से उन्हें ठंडे दिमाग़ से देखवाएँ, यह बताए बिना कि नमूना साफ़ चिह्नित था। देखें कि आगे के संकेत — दोबारा खुले टिकट, शिकायतें, रिफ़ंड क्लॉबैक, CSAT — उसी समय ऊपर तो नहीं खिसक रहे। गिरता HIR और बढ़ती आगे की समस्याएँ ऐसी व्यवस्था नहीं जो तेज़ी से सीखी। वह ऐसी व्यवस्था है जिसे समय पर किसी ने नहीं पकड़ा।
अगर आज इसे मापना है तो क्या दर्ज करें
इसमें से कुछ भी नए टूल से उतना नहीं माँगता जितना सही चीज़ लॉग करने से। एजेंट चलाने वाली ज़्यादातर टीमें मात्रा पहले से ट्रैक करती हैं — उसने कितने टिकट छुए, कितने काम ड्राफ़्ट किए। लगभग कोई नतीजा नहीं ट्रैक करती, और HIR को असल में बस वही चाहिए।
- हर कार्रवाई का नतीजा लॉग करें, सिर्फ़ गतिविधि की गिनती नहीं। जैसा का तैसा भेजा गया, भेजने से पहले संपादित, अस्वीकार कर दोबारा लिखा, या एजेंट ने खुद एस्केलेट किया। नतीजे-स्तर की लॉगिंग के बिना HIR निकाला ही नहीं जा सकता — आपको पता चलेगा कि एजेंट ने कुछ किया, यह नहीं कि उसे ठीक करना पड़ा या नहीं।
- अंश ठीक करने से पहले हर तय करें। तय करें कि इस वर्कफ़्लो में एक कार्रवाई क्या है — एक छुआ टिकट, एक ड्राफ़्ट किया काम — और वह परिभाषा अवधियों में स्थिर रखें, ताकि HIR का बदलाव एजेंट के फ़ैसले को दिखाए, गिनती के तरीके के बदलाव को नहीं।
- हर हस्तक्षेप पर कारण का टैग लगाएँ। «संपादित» लगभग कुछ नहीं बताता। «संपादित: $50 से ऊपर रिफ़ंड नीति गलत लगाई» ठीक बताता है कि आगे क्या सुधारना है। छोटा, एक जैसा वर्गीकरण सुधार लॉग को स्कोरबोर्ड की जगह काम की सूची बना देता है।
- एस्केलेशन हिस्सा HIR के साथ ट्रैक करें, उसकी जगह नहीं। दोनों संख्याएँ मिलकर बताती हैं कि गिरावट अर्जित है या उधार की — ऊपर की रुझान तालिका देखें।
- शून्य का लक्ष्य नहीं, एक फ़र्श तय करें। हर वर्कफ़्लो के लिए तय करें कि उसमें जितनी असली अस्पष्टता है, उसके हिसाब से एक विश्वसनीय गैर-शून्य HIR कैसा दिखता है, और जो दर उस फ़र्श से काफी नीचे गिरे उसे मनाने की चीज़ नहीं, जाँचने की चीज़ मानें।
- HIR हर वर्कफ़्लो के लिए रिपोर्ट करें, कंपनी-भर की एक मिली हुई संख्या के रूप में कभी नहीं। एक औसत छिपा देता है कि किस खास वर्कफ़्लो ने सच में कम निगरानी अर्जित की है और कौन अच्छा दिखने वाले शीर्षक के नीचे चुपचाप जोखिम जमा कर रहा है।
- «साफ़» नमूने को समय-सारणी पर दोबारा जाँचें। समय-समय पर वे कार्रवाइयाँ निकालें जो बिना हस्तक्षेप दर्ज हुईं और किसी से उन्हें यह बताए बिना देखवाएँ कि वे साफ़ चिह्नित थीं। यही एक सीधी जाँच है कि आपके समीक्षक अभी भी पढ़ रहे हैं या नहीं।
इसीलिए Loop Agent चुप स्वायत्तता की जगह ask_human, resume और चैनल-ऐप एस्केलेशन के आसपास बना है — जो एजेंट पूछने के लिए रुकता है वह आपके HIR के अंश में जानबूझकर दिखता है, वह नहीं जो संयोग से पकड़ा गया। एस्केलेशन और ड्राफ़्ट उन्हीं समूहों में आते हैं जहाँ टीम पहले से काम करती है, कार्य और नोट्स के बगल में, इसलिए जिस क्षण को व्यक्ति चाहिए था वह वहीं दिखता है जहाँ काम पहले से रहता है — किसी अलग एजेंट कंसोल में दबा नहीं जिसे कोई नहीं देखता। Enterprise पर ऑडिट लॉग IT और ऑपरेशंस को दिखाते हैं कि एजेंटों ने क्या किया और कोई इंसान ठीक कब बीच में आया, और यही वह कच्चा माल है जिससे HIR शुरू से बनता है।
इसे पठनीयता के साथ रखें — साथ का वह कॉन्सेप्ट जो अनुदान और पहुँच को भी दृश्य रखता है — और आपको वे दो सवाल मिलते हैं जिनका जवाब हर AI रोलआउट को फैलने से पहले देना आना चाहिए: कौन देख सकता है कि एजेंट क्या कर रहा है, और किसी व्यक्ति को असल में कितनी बार बीच में आना पड़ता है।
