Kadar Campur Tangan Manusia: Metrik Tunggal yang Menunjukkan Sama Ada Pelancaran AI Anda Benar-benar Berfungsi
Kebanyakan syarikat yang menjalankan ejen AI dalam produksi tidak dapat memberitahu anda berapa kerap ejen itu benar-benar memerlukan seseorang untuk masuk campur. Kadar Campur Tangan Manusia ialah nombor yang menjawab soalan itu — dan pada akhir tulisan ini, anda sepatutnya dapat mengiranya untuk aliran kerja yang sudah anda jalankan.
Rangka kerja FabricLoop sendiri untuk organisasi AI mentakrifkan Kadar Campur Tangan Manusia dengan jelas: ia bertanya berapa kerap kerja automatik memerlukan seseorang. Itulah takrifnya, dan tulisan ini tidak menyimpang daripadanya. Yang berikut ialah bahagian yang tidak dihuraikan sepenuhnya di halaman konsep: kiraan sebenar, digunakan pada satu aliran kerja yang nyata, dengan nombor yang menjadikan idea itu konkrit dan bukannya sekadar cita-cita.
Apa yang sebenarnya diukur oleh nombor ini
Kadar Campur Tangan Manusia (HIR) ialah bahagian tindakan ejen, dalam satu aliran kerja yang ditetapkan dan satu tempoh masa, yang memerlukan seseorang masuk campur sebelum hasil itu boleh dianggap selesai. «Masuk campur» ada makna khusus di sini: seseorang membetulkan output, mengatasi keputusan yang dibuat ejen, atau menjawab soalan yang ejen kemukakan secara jelas sebelum meneruskan — yang dipanggil Loop Agent FabricLoop sebagai saat ask_human. Bahagikan bilangan tindakan itu dengan jumlah tindakan yang diambil ejen dalam tempoh yang sama, dan anda mendapat HIR.
Sebab metrik ini layak berdiri di sisi masa operasi dan ketepatan, bukan di bawahnya, ialah ia mengukur sesuatu yang tidak dapat dilihat oleh nombor-nombor itu. Ejen boleh mencatat ketepatan 95% pada penanda aras dalaman dan tetap menjadi pelancaran yang lebih teruk daripada ejen yang mencatat 80%, jika 5% yang salah terlepas secara senyap manakala 20% yang diragui ditanda setiap kali. HIR tidak bertanya sama ada ejen itu baik. Ia bertanya sama ada sistem tahu bila ia memerlukan seseorang, dan sama ada seseorang benar-benar hadir apabila itu berlaku. Soalan kedua itulah yang menentukan sama ada pelancaran selamat untuk dikembangkan.
Mengira HIR untuk satu aliran kerja yang nyata
Ambil aliran kerja yang mungkin benar-benar dijalankan pasukan IT atau operasi hari ini: ejen yang menyaring tiket sokongan masuk, mengelaskannya (pengebilan, laporan pepijat, bayaran balik, akses akaun, dan sebagainya), lalu merangka balasan pusingan pertama. Setiap draf masuk ke barisan semakan sebelum sampai kepada pelanggan — tiada apa-apa dihantar sendiri. Langkah semakan itu, dengan sendirinya, bukan campur tangan. Penyemak yang menekan «hantar» pada draf yang tidak perlu diubah ialah aliran kerja yang berjalan seperti yang direka. Campur tangan ialah apa yang berlaku apabila draf itu perlu diusahakan: penyemak menulis semula, membetulkan pengelasan, mengalih tiket ke barisan lain, atau ejen sendiri berhenti di tengah tugas dan bertanya sebelum merangka apa-apa.
Nombor di bawah ialah contoh ilustrasi, bukan data syarikat sebenar — tetapi bentuk ceritanya, dan kiraan di belakangnya, tepat seperti yang anda akan bina daripada log anda sendiri.
Pada bulan perintis, ejen menyentuh 640 tiket. Daripada jumlah itu, 415 memerlukan campur tangan — penulisan semula, pengelasan semula, atau pengalihan — dan hanya 75 daripada 415 itu ialah saat yang ditanda ejen sendiri sebelum merangka apa-apa. Selebihnya ialah kesilapan yang ditangkap penyemak selepas kejadian. Itu HIR sebanyak 64.8%, dengan bahagian peningkatan hanya 18%: kebanyakan masa ejen salah, ia salah dengan yakin, dan itulah versi terburuk masalah ini.
Pasukan menarik log pembetulan dan menanda setiap campur tangan dengan sebab. Dua kategori mendominasi: ejen salah membaca dasar bayaran balik setiap kali ada jumlah wang, dan merangka balasan yang tenang serta prosedural kepada pelanggan yang kemarahannya jelas kelihatan. Kedua-duanya boleh dibetulkan tanpa menyentuh model — tambah peraturan yang jelas bahawa mana-mana tiket yang menyebut bayaran balik melebihi $50, atau melepasi ambang sentimen, mencetuskan peningkatan ask_human dan bukannya draf. Yang lain tetap dirangka dan disemak seperti sebelumnya.
| Bulan | Tiket ditangani | Campur tangan | HIR | Bahagian peningkatan |
|---|---|---|---|---|
| 1 — Perintis | 640 | 415 | 64.8% | 18% |
| 2 — Selepas peraturan ditambah | 810 | 224 | 27.7% | 58% |
| 3 — Peraturan dilaras semula | 940 | 101 | 10.7% | 79% |
Menjelang bulan ketiga, HIR telah menurun lebih daripada 80%, tetapi nombor yang lebih bermaklumat ialah bahagian peningkatan: ia naik daripada 18% kepada 79%. Kebanyakan yang tinggal bukan ejen ditangkap sedang salah — ia ialah ejen yang dengan betul mengecam kes yang benar-benar kabur (akaun VIP, pengecualian dasar, bayaran balik yang jatuh tepat pada ambang) dan bertanya sebelum bertindak. Penurunan itu nyata, dan diperoleh: setiap pusingan pembetulan dimasukkan semula ke dalam peraturan yang jelas, jadi kesilapan khusus yang menghasilkannya berhenti berulang, manakala kategori yang masih memerlukan pertimbangan terus ditanda dan bukannya dilencong dengan draf.
Penurunan yang penting ialah yang membuat ejen lebih baik mengetahui apa yang tidak diketahuinya — bukan yang membuat seseorang berhenti menyemak secara senyap.
Kesilapan: menganggap sifar sebagai matlamat
Sebaik sahaja pasukan melihat HIR menurun bulan demi bulan, soalan seterusnya yang jelas ialah berapa rendah ia boleh turun. Naluri ialah menganggap sifar sebagai garisan penamat — bukti bahawa ejen akhirnya cukup baik untuk berjalan tanpa pengawasan. Naluri itu terbalik, dan itulah salah baca paling biasa terhadap metrik ini.
Aliran kerja yang menunjukkan campur tangan 0% selama berminggu-minggu hampir tidak pernah bermaksud ejen berhenti membuat kesilapan. Ia bermaksud salah satu daripada dua perkara berlaku: penyemak berhenti benar-benar membaca draf sebelum meluluskannya, atau laluan peningkatan rosak secara senyap — ambang dilonggarkan, peraturan penghalaan gagal tanpa bunyi, atau pencetus ask_human berhenti berfungsi. Walau apa pun, sifar tidak memberitahu bahawa sistem berhenti memerlukan seseorang. Ia memberitahu bahawa seseorang berhenti ditanya, atau berhenti melihat.
Matlamat sebenar tidak pernah berupa kurang campur tangan secara abstrak. Ia ialah sistem di mana saat khusus yang memerlukan pertimbangan seseorang muncul ke permukaan — dan hanya saat itu — supaya perhatian seseorang pergi ke perkara yang benar-benar memerlukannya, dan bukannya dibahagi sama rata ke segala-galanya atau hilang sama sekali. Aliran kerja pada HIR 12%, yang hampir kesemua 12% itu ialah ejen yang dengan betul menanda kes yang benar-benar kabur atau berisiko tinggi, lebih sihat daripada yang berada pada 2%, yang kebanyakan 2% itu ialah penyemak yang tersandung kesilapan yang tidak pernah ditanda ejen. Nombor yang lebih rendah boleh menyembunyikan sistem yang lebih teruk.
Inilah gunanya bahagian peningkatan. Dilihat di sisi HIR, ia memberitahu cerita yang mana anda berada:
Jika HIR menurun manakala bahagian peningkatan kekal rata atau menurun, jangan catatkan itu sebagai kemenangan lagi. Tarik sampel rawak tindakan yang dilog sebagai «tidak perlu campur tangan» dan minta seseorang menyemaknya secara dingin, tanpa diberitahu bahawa sampel itu ditanda bersih. Periksa sama ada isyarat hiliran — tiket yang dibuka semula, aduan, penarikan semula bayaran balik, CSAT — hanyut ke atas pada masa yang sama. HIR yang menurun dengan masalah hiliran yang meningkat bukan sistem yang belajar lebih cepat. Ia sistem yang tidak ada siapa tangkap tepat pada masanya.
Apa yang perlu direkod jika anda mahu mengukur ini hari ini
Tiada satu pun daripada ini memerlukan alatan baharu sebanyak ia memerlukan merekod perkara yang betul. Kebanyakan pasukan yang menjalankan ejen sudah menjejak volum — berapa tiket disentuh, berapa tugasan dirangka. Hampir tiada yang menjejak hasil, dan itulah satu-satunya perkara yang benar-benar diperlukan HIR.
- Rekod hasil untuk setiap tindakan, bukan sekadar kiraan aktiviti. Dihantar seadanya, disunting sebelum dihantar, ditolak dan ditulis semula, atau ditingkatkan oleh ejen sendiri. Tanpa rekod pada peringkat hasil, HIR tidak dapat dikira langsung — anda akan tahu ejen melakukan sesuatu, bukan sama ada ia perlu dibetulkan.
- Tetapkan penyebut sebelum anda tetapkan pengangka. Putuskan apa yang dikira sebagai satu tindakan untuk aliran kerja ini — satu tiket yang disentuh, satu tugasan yang dirangka — dan kekalkan takrif itu merentas tempoh, supaya perubahan HIR mencerminkan pertimbangan ejen dan bukan perubahan cara anda mengira.
- Tanda setiap campur tangan dengan sebab. «Disunting» hampir tidak memberitahu apa-apa. «Disunting: dasar bayaran balik melebihi $50 digunakan secara salah» memberitahu tepat apa yang perlu dibetulkan seterusnya. Taksonomi yang pendek dan konsisten menukar log pembetulan menjadi senarai kerja, bukan papan mata.
- Jejak bahagian peningkatan di sisi HIR, bukan sebagai gantinya. Dua nombor itu bersama-sama memberitahu sama ada penurunan diperoleh atau dipinjam — lihat jadual trend di atas.
- Tetapkan lantai, bukan sasaran sifar. Putuskan, bagi setiap aliran kerja, bagaimana rupa HIR bukan sifar yang munasabah memandangkan betapa banyak kekaburan sebenar dalam aliran itu, dan anggap kadar yang jatuh jauh di bawah lantai itu sebagai sesuatu untuk disiasat, bukan diraikan.
- Laporkan HIR bagi setiap aliran kerja, jangan sebagai satu nombor campuran seluruh syarikat. Satu purata menyembunyikan aliran kerja mana yang benar-benar telah memperoleh pengawasan yang kurang dan mana yang diam-diam mengumpul risiko di bawah angka tajuk yang kelihatan baik.
- Semak semula sampel «bersih» mengikut jadual. Secara berkala tarik tindakan yang dilog sebagai tidak memerlukan campur tangan dan minta seseorang menyemaknya tanpa mengetahui bahawa ia ditanda bersih. Itu satu-satunya semakan langsung sama ada penyemak anda masih membaca.
Inilah sebabnya Loop Agent dibina di sekitar ask_human, resume, dan peningkatan aplikasi saluran, bukan autonomi yang senyap — ejen yang berhenti untuk bertanya ialah ejen yang muncul dalam pengangka HIR dengan sengaja, bukan yang tertangkap secara kebetulan. Peningkatan dan draf muncul dalam Kumpulan yang sama tempat pasukan sudah bekerja, di sisi tugasan dan nota, jadi saat yang memerlukan seseorang kelihatan di tempat kerja sudah hidup — tidak tertimbus dalam konsol ejen berasingan yang tidak disemak sesiapa. Pada Enterprise, log audit membolehkan IT dan operasi melihat apa yang dilakukan ejen dan bila tepat manusia masuk campur, dan itulah bahan mentah yang menjadi asas HIR sejak awal.
Padankan ini dengan Keterbacaan — konsep pendamping supaya pemberian akses dan kebenaran juga kelihatan — dan anda mendapat dua soalan yang setiap pelancaran AI sepatutnya dapat jawab sebelum dikembangkan: siapa boleh melihat apa yang dilakukan ejen, dan berapa kerap seseorang benar-benar perlu masuk campur.
