ภาพประกอบสไตล์กระดาษตัดปะของวาฬและฝูงปลาที่เคลื่อนไปด้วยกันผ่านแนวปะการัง มีแสงส่องลงมาจากผิวน้ำ เป็นภาพของระบบที่พึ่งตนเองได้เกือบทั้งหมดแต่ยังถูกมองจากด้านบน
AI และความน่าเชื่อถือ

อัตราการแทรกแซงของมนุษย์: ตัวชี้วัดเดียวที่บอกว่าการเปิดใช้ AI ของคุณได้ผลจริงหรือไม่

บริษัทส่วนใหญ่ที่รันเอเจนต์ AI ในโปรดักชันบอกไม่ได้ว่าเอเจนต์เหล่านั้นต้องให้คนเข้ามาช่วยบ่อยแค่ไหน อัตราการแทรกแซงของมนุษย์คือตัวเลขที่ตอบคำถามนั้น — และเมื่ออ่านจบบทความนี้ คุณควรคำนวณมันได้สำหรับเวิร์กโฟลว์ที่คุณรันอยู่แล้ว

ทีมบรรณาธิการ FabricLoop
2,180 คำ
อ่าน 10 นาที

กรอบของ FabricLoop เองสำหรับองค์กร AI นิยามอัตราการแทรกแซงของมนุษย์อย่างตรงไปตรงมา: มันถามว่างานอัตโนมัติต้องใช้คนบ่อยแค่ไหน นั่นคือคำนิยาม และบทความนี้ไม่เบี่ยงจากมัน สิ่งที่ตามมาคือส่วนที่หน้าแนวคิดไม่ได้ลงรายละเอียดจนครบ: เลขคณิตจริง ๆ ที่ใช้กับเวิร์กโฟลว์จริงหนึ่งรายการ พร้อมตัวเลขที่ทำให้แนวคิดเป็นรูปธรรมแทนที่จะเป็นเพียงความปรารถนา

ตัวเลขนี้วัดอะไรจริง ๆ

อัตราการแทรกแซงของมนุษย์ (HIR) คือสัดส่วนของการกระทำของเอเจนต์ ภายในเวิร์กโฟลว์ที่กำหนดหนึ่งรายการและช่วงเวลาหนึ่ง ที่ต้องให้คนเข้ามาก่อนผลลัพธ์จะถือว่าเสร็จ «เข้ามา» มีความหมายเฉพาะที่นี่: คนแก้ไขผลลัพธ์ ยกเลิกการตัดสินใจที่เอเจนต์ทำ หรือตอบคำถามที่เอเจนต์ยกขึ้นอย่างชัดเจนก่อนจะไปต่อ — สิ่งที่ Loop Agent ของ FabricLoop เรียกว่าช่วง ask_human หารจำนวนการกระทำเหล่านั้นด้วยจำนวนการกระทำทั้งหมดที่เอเจนต์ทำในช่วงเดียวกัน ก็ได้ HIR

เหตุผลที่ตัวชี้วัดนี้อยู่ข้างเวลาทำงานและความแม่นยำ ไม่ใช่ใต้พวกมัน คือมันวัดสิ่งที่ตัวเลขเหล่านั้นมองไม่เห็น เอเจนต์อาจได้คะแนนความแม่นยำ 95% ในเกณฑ์ภายในและยังเป็นการเปิดใช้ที่แย่กว่าเอเจนต์ที่ได้ 80% ถ้า 5% ที่มันผิดหลุดไปอย่างเงียบ ๆ ในขณะที่ 20% ที่มันไม่มั่นใจถูกปักธงทุกครั้ง HIR ไม่ได้ถามว่าเอเจนต์เก่งหรือไม่ มันถามว่าระบบรู้หรือไม่ว่าเมื่อใดต้องใช้คน และมีคนมาจริงหรือไม่เมื่อถึงเวลานั้น คำถามที่สองนี้คือสิ่งที่ตัดสินว่าการเปิดใช้ขยายต่อได้อย่างปลอดภัยหรือไม่

คำนวณ HIR สำหรับเวิร์กโฟลว์จริงหนึ่งรายการ

ลองนึกถึงเวิร์กโฟลว์ที่ทีม IT หรือปฏิบัติการอาจรันจริงในวันนี้: เอเจนต์คัดแยกตั๋วสนับสนุนที่เข้ามา จัดประเภท (การเรียกเก็บเงิน รายงานบั๊ก การคืนเงิน การเข้าถึงบัญชี และอื่น ๆ) แล้วร่างคำตอบรอบแรก ทุกร่างลงคิวตรวจก่อนถึงลูกค้า — ไม่มีอะไรส่งออกไปเอง ขั้นตอนตรวจนั้นโดยตัวมันเองไม่ใช่การแทรกแซง ผู้ตรวจที่กด «ส่ง» บนร่างที่ไม่ต้องแก้คือเวิร์กโฟลว์ที่ทำงานตามที่ออกแบบ การแทรกแซงคือสิ่งที่เกิดขึ้นเมื่อร่างต้องถูกทำต่อ: ผู้ตรวจเขียนใหม่ แก้การจัดประเภท ส่งตั๋วไปคิวอื่น หรือเอเจนต์เองหยุดกลางงานแล้วถามก่อนจะร่างอะไรเลย

ตัวเลขด้านล่างเป็นตัวอย่างประกอบ ไม่ใช่ข้อมูลของบริษัทจริง — แต่รูปของเรื่องและเลขคณิตข้างหลังคือสิ่งที่คุณจะสร้างจากล็อกของตัวเองพอดี

สูตร HIR
HIR = การกระทำที่ต้องแทรกแซง ÷ การกระทำทั้งหมดของเอเจนต์
เวิร์กโฟลว์เดียวกัน ช่วงเวลาเดียวกัน นับเฉพาะการกระทำที่คนเปลี่ยนผลลัพธ์ ผู้ตรวจที่อนุมัติร่างที่ไม่ได้แก้ไม่นับเป็นการแทรกแซง — และร่างที่ไม่ต้องแก้อะไรเลยก็ไม่นับ
สัดส่วนการยกระดับ
สัดส่วนการยกระดับ = คำขอที่เอเจนต์เป็นคนเริ่ม ÷ การแทรกแซงทั้งหมด
แยกทุกการแทรกแซงเป็นสองแบบ: เอเจนต์ปักธงความไม่แน่ใจของตัวเอง หรือผู้ตรวจจับความผิดที่เอเจนต์ไม่ได้ปักธง นี่คือตัวเลขที่บอกว่า HIR ที่ลดลงเป็นข่าวดีหรือไม่

ในเดือนนำร่อง เอเจนต์แตะตั๋ว 640 ใบ ในนั้น 415 ใบต้องมีการแทรกแซง — เขียนใหม่ จัดประเภทใหม่ หรือส่งต่อ — และเพียง 75 จาก 415 นั้นเป็นช่วงที่เอเจนต์ปักธงเองก่อนจะร่างอะไร ที่เหลือเป็นความผิดที่ผู้ตรวจจับได้ภายหลัง นั่นคือ HIR ที่ 64.8% โดยสัดส่วนการยกระดับเพียง 18%: เวลาที่เอเจนต์ผิด ส่วนใหญ่ผิดอย่างมั่นใจ ซึ่งเป็นรูปแบบที่แย่ที่สุดของปัญหานี้

ทีมดึงล็อกการแก้ไขและติดแท็กเหตุผลให้ทุกการแทรกแซง สองหมวดเด่น: เอเจนต์อ่านนโยบายคืนเงินผิดทุกครั้งที่มีจำนวนเงิน และร่างคำตอบที่สงบ เป็นขั้นตอน ให้ลูกค้าที่โกรธจนเห็นได้ชัด ทั้งสองอย่างแก้ได้โดยไม่ต้องแตะโมเดล — เพิ่มกฎชัดเจนว่าตั๋วใดที่พูดถึงการคืนเงินเกิน $50 หรือคะแนนอารมณ์เกินเกณฑ์ ให้เรียกการยกระดับ ask_human แทนการร่าง ที่เหลือยังร่างและตรวจเหมือนเดิม

เดือนตั๋วที่จัดการการแทรกแซงHIRสัดส่วนการยกระดับ
1 — นำร่อง 640 415 64.8% 18%
2 — หลังจากเพิ่มกฎ 810 224 27.7% 58%
3 — ปรับกฎอีกครั้ง 940 101 10.7% 79%

ถึงเดือนที่สาม HIR ลดลงมากกว่า 80% แต่ตัวเลขที่บอกอะไรมากกว่าคือสัดส่วนการยกระดับ: มันไต่จาก 18% เป็น 79% สิ่งที่เหลือส่วนใหญ่ไม่ใช่เอเจนต์ถูกจับได้ว่าผิด — คือเอเจนต์รู้จำเคสที่กำกวมจริง ๆ ได้ถูกต้อง (บัญชี VIP ข้อยกเว้นนโยบาย การคืนเงินที่ตกตรงเกณฑ์พอดี) แล้วถามก่อนลงมือ การลดลงเป็นของจริง และได้มาอย่างสมควร: การแก้ไขแต่ละรอบถูกป้อนกลับเป็นกฎชัดเจน ความผิดเฉพาะที่ก่อให้เกิดมันจึงไม่เกิดซ้ำ ขณะที่หมวดที่ยังต้องใช้วิจารณญาณยังถูกปักธงแทนที่จะร่างเลี่ยงไป

การลดลงที่สำคัญคือแบบที่เอเจนต์เก่งขึ้นในการรู้ว่าตัวเองไม่รู้อะไร — ไม่ใช่แบบที่คนหยุดตรวจอย่างเงียบ ๆ

ความผิดพลาด: ถือว่าศูนย์คือเป้าหมาย

เมื่อทีมเห็น HIR ลดลงเดือนแล้วเดือนเล่า คำถามถัดไปที่ชัดคือมันจะต่ำได้แค่ไหน สัญชาตญาณคือถือว่าศูนย์เป็นเส้นชัย — หลักฐานว่าเอเจนต์ดีพอจะรันโดยไม่มีคนดูแลในที่สุด สัญชาตญาณนั้นกลับด้าน และเป็นการอ่านตัวชี้วัดนี้ผิดที่พบบ่อยที่สุด

ทำไม 0% มักเป็นสัญญาณเตือน

เวิร์กโฟลว์ที่แสดงการแทรกแซง 0% ติดต่อกันหลายสัปดาห์แทบไม่เคยหมายความว่าเอเจนต์หยุดทำผิด มันหมายความว่าเกิดอย่างใดอย่างหนึ่งแทน: ผู้ตรวจเลิกอ่านร่างจริงก่อนอนุมัติ หรือเส้นทางยกระดับพังอย่างเงียบ ๆ — เกณฑ์ถูกผ่อน กฎจัดเส้นทางล้มเหลวโดยไม่มีเสียง หรือทริกเกอร์ ask_human หยุดทำงาน ไม่ว่าทางไหน ศูนย์ไม่ได้บอกว่าระบบเลิกต้องการคน มันบอกว่าคนเลิกถูกถาม หรือเลิกมอง

เป้าหมายจริงไม่เคยเป็นการแทรกแซงที่น้อยลงในเชิงนามธรรม มันคือระบบที่ช่วงเวลาเฉพาะซึ่งต้องใช้วิจารณญาณของคนถูกยกขึ้นมา — และเฉพาะช่วงเหล่านั้น — เพื่อให้ความสนใจของคนไปที่สิ่งที่ต้องการจริง แทนที่จะถูกแบ่งเท่า ๆ กันทั่วทุกอย่างหรือหายไปเลย เวิร์กโฟลว์ที่อยู่ที่ HIR 12% ซึ่งเกือบทั้งหมดของ 12% นั้นคือเอเจนต์ปักธงเคสที่กำกวมหรือเดิมพันสูงจริง ๆ ได้ถูกต้อง ดีต่อสุขภาพกว่าเวิร์กโฟลว์ที่อยู่ที่ 2% ซึ่งส่วนใหญ่ของ 2% นั้นคือผู้ตรวจสะดุดความผิดที่เอเจนต์ไม่เคยปักธง ตัวเลขที่ต่ำกว่าอาจซ่อนระบบที่แย่กว่า

นี่คือสิ่งที่สัดส่วนการยกระดับมีไว้ เมื่อดูคู่กับ HIR มันบอกว่าคุณอยู่ในเรื่องแบบไหน:

อ่านแนวโน้ม HIR — ตัวเลขที่ลดลงตัวเดียวกัน สองความหมาย
0% ไปเรื่อย ๆ
สัญญาณเตือน — ไม่มีใครดู ไม่ใช่ระบบไร้ที่ติ
สูงและราบเป็นเดือน ๆ
ไม่ได้เรียนรู้ — การแก้ไขไม่ถูกป้อนกลับเป็นกฎ
ลดลง สัดส่วนก็ลดตาม
ตรวจสอบ — น่าจะเป็นการอนุมัติแบบประทับตรา ไม่ใช่ความคืบหน้าจริง
ลดลง สัดส่วนสูงขึ้น
ได้รับความน่าเชื่อถือ — ระบบรู้ขอบเขตของตัวเอง

ถ้า HIR กำลังลดขณะที่สัดส่วนการยกระดับทรงตัวหรือลดตาม อย่าเพิ่งนับเป็นชัยชนะ ดึงตัวอย่างสุ่มของการกระทำที่บันทึกว่า «ไม่ต้องแทรกแซง» แล้วให้คนตรวจแบบไม่รู้มาก่อน โดยไม่บอกว่าตัวอย่างถูกปักธงว่าสะอาด ตรวจว่าสัญญาณปลายทาง — ตั๋วที่ถูกเปิดใหม่ ข้อร้องเรียน การเรียกเงินคืนกลับ CSAT — กำลังลอยขึ้นพร้อมกันหรือไม่ HIR ที่ลดพร้อมปัญหาปลายทางที่เพิ่มไม่ใช่ระบบที่เรียนรู้เร็วขึ้น มันคือระบบที่ไม่มีใครจับได้ทันเวลา

ควรวัดอะไรถ้าอยากวัดสิ่งนี้วันนี้

ทั้งหมดนี้ไม่ได้ต้องการเครื่องมือใหม่มากเท่ากับการบันทึกสิ่งที่ถูก ทีมส่วนใหญ่ที่รันเอเจนต์ติดตามปริมาณอยู่แล้ว — มันแตะตั๋วกี่ใบ ร่างงานกี่ชิ้น แทบไม่มีทีมไหนติดตามผลลัพธ์ ซึ่งเป็นสิ่งเดียวที่ HIR ต้องการจริง ๆ

  1. บันทึกผลลัพธ์ของทุกการกระทำ ไม่ใช่แค่นับกิจกรรม ส่งตามเดิม แก้ก่อนส่ง ปฏิเสธแล้วเขียนใหม่ หรือเอเจนต์ยกระดับเอง หากไม่มีการบันทึกระดับผลลัพธ์ HIR คำนวณไม่ได้เลย — คุณจะรู้ว่าเอเจนต์ทำบางอย่าง ไม่รู้ว่าต้องถูกแก้หรือไม่
  2. กำหนดตัวส่วนก่อนกำหนดตัวเศษ ตัดสินใจว่าอะไรนับเป็นการกระทำหนึ่งในเวิร์กโฟลว์นี้ — ตั๋วหนึ่งใบที่ถูกแตะ งานหนึ่งชิ้นที่ถูกร่าง — แล้วคงคำนิยามนั้นให้คงที่ข้ามช่วงเวลา เพื่อให้การเปลี่ยนของ HIR สะท้อนวิจารณญาณของเอเจนต์ ไม่ใช่การเปลี่ยนวิธีนับ
  3. ติดแท็กเหตุผลให้ทุกการแทรกแซง «ถูกแก้ไข» แทบไม่บอกอะไร «ถูกแก้ไข: ใช้นโยบายคืนเงินเกิน $50 ผิด» บอกชัดว่าต้องแก้อะไรต่อ หมวดหมู่สั้นและสม่ำเสมอเปลี่ยนล็อกการแก้ไขเป็นรายการงานแทนป้ายคะแนน
  4. ติดตามสัดส่วนการยกระดับคู่กับ HIR ไม่ใช่แทนที่มัน สองตัวเลขร่วมกันบอกว่าการลดลงได้มาหรือยืมมา — ดูตารางแนวโน้มด้านบน
  5. ตั้งพื้น ไม่ใช่เป้าหมายที่ศูนย์ ตัดสินใจต่อเวิร์กโฟลว์ว่า HIR ที่ไม่เป็นศูนย์และสมเหตุสมผลหน้าตาเป็นอย่างไร เมื่อดูจากความกำกวมจริงในเวิร์กโฟลว์นั้น และถือว่าอัตราที่ตกลงไปต่ำกว่าพื้นนั้นมากเป็นสิ่งที่ต้องสอบ ไม่ใช่สิ่งที่ต้องฉลอง
  6. รายงาน HIR ต่อเวิร์กโฟลว์ ไม่ใช่ตัวเลขผสมเดียวทั้งบริษัท ค่าเฉลี่ยเดียวซ่อนว่าเวิร์กโฟลว์ใดได้การดูแลที่น้อยลงอย่างสมควร และเวิร์กโฟลว์ใดกำลังสะสมความเสี่ยงอย่างเงียบ ๆ ใต้ตัวเลขพาดหัวที่ดูดี
  7. ตรวจตัวอย่าง «สะอาด» ตามกำหนด ดึงการกระทำที่บันทึกว่าไม่ต้องแทรกแซงเป็นระยะ แล้วให้คนตรวจโดยไม่รู้ว่าถูกปักธงว่าสะอาด นี่คือการตรวจตรงเพียงอย่างเดียวว่าผู้ตรวจของคุณยังอ่านอยู่หรือไม่
FL
FabricLoop สนับสนุนเรื่องนี้อย่างไร

นี่คือเหตุผลที่ Loop Agent ถูกสร้างรอบ ask_human, resume และการยกระดับผ่านแอปช่องทาง แทนการทำงานเองอย่างเงียบ ๆ — เอเจนต์ที่หยุดเพื่อถามคือเอเจนต์ที่โผล่ในตัวเศษของ HIR โดยตั้งใจ ไม่ใช่ตัวที่ถูกจับได้โดยบังเอิญ การยกระดับและร่างปรากฏในกลุ่มเดียวกับที่ทีมทำงานอยู่แล้ว ข้าง งาน และ บันทึก ดังนั้นช่วงที่ต้องใช้คนจึงมองเห็นตรงที่งานอยู่แล้ว — ไม่ถูกฝังในคอนโซลเอเจนต์แยกที่ไม่มีใครตรวจ บน Enterprise บันทึกการตรวจสอบให้ IT และปฏิบัติการเห็นว่าเอเจนต์ทำอะไรและมนุษย์เข้ามาเมื่อใดพอดี ซึ่งเป็นวัตถุดิบที่ HIR ถูกสร้างขึ้นมาตั้งแต่แรก

จับคู่นี้กับ ความชัดเจน — แนวคิดคู่กันที่ทำให้สิทธิ์และการเข้าถึงมองเห็นได้เช่นกัน — แล้วคุณจะได้สองคำถามที่การเปิดใช้ AI ทุกครั้งควรตอบได้ก่อนขยาย: ใครเห็นได้ว่าเอเจนต์กำลังทำอะไร และคนต้องเข้ามาจริงบ่อยแค่ไหน


ประเด็นสำคัญ
01
อัตราการแทรกแซงของมนุษย์คือสัดส่วนของการกระทำของเอเจนต์ ในเวิร์กโฟลว์หนึ่งและช่วงเวลาหนึ่ง ที่ต้องให้คนแก้ไข ยกเลิก หรือตอบคำถามที่เอเจนต์ยกขึ้นก่อนงานจะนับว่าเสร็จ มันคืออัตราส่วน: การแทรกแซงหารด้วยการกระทำทั้งหมด
02
ผู้ตรวจที่อนุมัติร่างซึ่งไม่ต้องแก้ไม่ใช่การแทรกแซง HIR วัดว่าผลลัพธ์ต้องเปลี่ยนบ่อยแค่ไหน ไม่ใช่ว่ามนุษย์มองบางอย่างบ่อยแค่ไหน
03
สัดส่วนการยกระดับ — ส่วนของการแทรกแซงที่เอเจนต์ปักธงเอง เทียบกับส่วนที่ผู้ตรวจจับได้ภายหลัง — คือตัวชี้วัดคู่ที่บอกว่า HIR ที่ลดลงสะท้อนการพัฒนาจริง หรือคนตรวจน้อยลง
04
การลดลงของ HIR ที่ดีต่อสุขภาพมาจากการป้อนเหตุผลการแก้ไขกลับเป็นกฎหรือตัวอย่างที่ชัดเจน เพื่อให้ความผิดเดิมไม่เกิดซ้ำ — ไม่ได้มาจากผู้ตรวจที่เบื่อการอ่านร่าง
05
การแทรกแซง 0% ที่คงอยู่เป็นเวลานานเกือบเสมอเป็นสัญญาณเตือน ไม่ใช่หลักชัย มักหมายความว่าผู้ตรวจเลิกอ่าน หรือเส้นทางยกระดับพังอย่างเงียบ ๆ — ไม่ใช่ว่าเอเจนต์ไร้ที่ติ
06
เป้าหมายจริงไม่ใช่ตัวเลขที่ต่ำที่สุดเท่าที่จะเป็นไปได้ มันคือระบบที่ทำให้ช่วงเวลาเฉพาะซึ่งต้องใช้วิจารณญาณของมนุษย์มองเห็นได้ — และเฉพาะช่วงเหล่านั้น — เพื่อให้ความสนใจของคนตกที่สิ่งที่ต้องการจริง
07
เพื่อตรวจทาน HIR ที่ลดลง ให้ดูสัญญาณปลายทาง — ตั๋วที่ถูกเปิดใหม่ ข้อร้องเรียน การเรียกเงินคืนกลับ CSAT — ว่ามีการเพิ่มขึ้นที่อัตราอย่างเดียวจะซ่อนไว้หรือไม่ และสุ่มตรวจตัวอย่างการกระทำ «ไม่ต้องแทรกแซง» แบบไม่รู้มาก่อนเป็นระยะ
08
เพื่อวัด HIR ได้เลย คุณต้องมีการบันทึกระดับผลลัพธ์ (ส่งตามเดิม ถูกแก้ไข ถูกปฏิเสธ ถูกยกระดับ) — ไม่ใช่แค่นับกิจกรรม ทีมส่วนใหญ่ที่รันเอเจนต์วันนี้บันทึกปริมาณและไม่มีอย่างอื่น
09
รายงาน HIR ต่อเวิร์กโฟลว์ ไม่ใช่ตัวเลขผสมเดียวทั้งบริษัท ค่าเฉลี่ยเดียวอาจซ่อนเวิร์กโฟลว์ที่ได้การดูแลน้อยลงอย่างสมควรไว้ข้างเวิร์กโฟลว์ที่กำลังสะสมความเสี่ยงอย่างเงียบ ๆ