رسم ورقي لحوت وسرب أسماك يتحركان معًا عبر شعاب مرجانية، تضيئه أشعة من السطح، ويمثّل نظامًا يكاد يكتفي بنفسه وما زال يُراقَب من أعلى
الذكاء الاصطناعي والثقة

معدل التدخل البشري: المقياس الوحيد الذي يخبرك إن كان إطلاق الذكاء الاصطناعي يعمل فعلًا

معظم الشركات التي تشغّل وكلاء ذكاء اصطناعي في الإنتاج لا تستطيع أن تخبرك بعدد المرات التي يحتاج فيها هؤلاء الوكلاء فعلًا إلى شخص يتدخل. معدل التدخل البشري هو الرقم الذي يجيب عن هذا السؤال — وبنهاية هذه المقالة ينبغي أن تتمكن من حسابه لسير عمل تشغّله أصلًا.

هيئة تحرير FabricLoop
2,180 كلمة
10 دقائق قراءة

يعرّف إطار FabricLoop الخاص بمؤسسات الذكاء الاصطناعي معدل التدخل البشري بوضوح: يسأل عن عدد المرات التي يحتاج فيها العمل المؤتمت إلى شخص. هذا هو التعريف، وهذه المقالة لا تحيد عنه. ما يلي هو الجزء الذي لا تفصّله صفحة المفهوم بالكامل: الحساب الفعلي، مطبَّقًا على سير عمل حقيقي واحد، بالأرقام التي تجعل الفكرة ملموسة بدل أن تبقى طموحًا.

ما الذي يقيسه الرقم فعلًا

معدل التدخل البشري (HIR) هو نصيب إجراءات الوكيل، ضمن سير عمل محدد وفترة زمنية واحدة، التي احتاجت إلى تدخل شخص قبل أن تُعتد النتيجة منتهية. «التدخل» له معنى محدد هنا: شخص صحّح المخرجات، أو ألغى قرارًا اتخذه الوكيل، أو أجاب عن سؤال طرحه الوكيل صراحة قبل أن يواصل — ما يسميه Loop Agent في FabricLoop لحظة ask_human. اقسم عدد هذه الإجراءات على إجمالي الإجراءات التي نفذها الوكيل في الفترة نفسها، فتحصل على HIR.

السبب الذي يضع هذا المقياس إلى جانب وقت التشغيل والدقة، لا تحتهما، هو أنه يقيس شيئًا لا تراه تلك الأرقام. قد يسجّل وكيل دقة 95% في معيار داخلي ويظل إطلاقًا أسوأ من وكيل يسجّل 80%، إذا تسللت نسبة 5% التي يخطئ فيها بصمت بينما تُعلَّم نسبة 20% التي يشك فيها في كل مرة. لا يسأل HIR إن كان الوكيل جيدًا. يسأل إن كان النظام يعرف متى يحتاج إلى شخص، وإن كان الشخص يحضر فعلًا حين يُحتاج إليه. هذا السؤال الثاني هو الذي يقرر إن كان توسيع الإطلاق آمنًا.

حساب HIR لسير عمل حقيقي واحد

خذ سير عمل قد يشغّله فريق تقنية معلومات أو عمليات اليوم فعلًا: وكيل يفرز تذاكر الدعم الواردة، ويصنّفها (فوترة، تقرير خطأ، استرداد، الوصول إلى الحساب، وما شابه)، ويصوغ ردًا أوليًا. كل مسودة تصل إلى قائمة مراجعة قبل أن تبلغ العميل — لا شيء يُرسَل من تلقاء نفسه. خطوة المراجعة هذه وحدها ليست تدخلًا. أن يضغط مراجع «إرسال» على مسودة لم تحتج إلى تعديل هو سير العمل يعمل كما صُمم. التدخل هو ما يحدث حين تحتاج المسودة إلى عمل: أعاد المراجع كتابتها، أو صحّح التصنيف، أو حوّل التذكرة إلى قائمة أخرى، أو توقف الوكيل نفسه وسط المهمة وسأل سؤالًا قبل أن يصوغ أي شيء.

الأرقام أدناه مثال توضيحي، لا بيانات شركة حقيقية — لكن شكل القصة والحساب وراءها هو بالضبط ما تبنيه من سجلاتك أنت.

صيغة HIR
HIR = الإجراءات التي تحتاج تدخلًا ÷ إجمالي إجراءات الوكيل
سير العمل نفسه، والفترة نفسها. عدّ فقط الإجراءات التي غيّر فيها شخص النتيجة. موافقة مراجع على مسودة لم يغيّرها لا تُحسب تدخلًا — ولا مسودة لم تحتج إلى أي تعديل أصلًا.
حصة التصعيد
حصة التصعيد = طلبات بادر بها الوكيل ÷ إجمالي التدخلات
تقسم كل تدخل إلى نوعين: الوكيل علّم شكّه بنفسه، أو مراجع اكتشف خطأ لم يعلّمه الوكيل. هذا هو الرقم الذي يخبرك إن كان انخفاض HIR خبرًا جيدًا.

في شهر التجربة، يلمس الوكيل 640 تذكرة. منها 415 تحتاج تدخلًا — إعادة كتابة، أو إعادة تصنيف، أو إعادة توجيه — و75 فقط من هذه الـ415 لحظات علّمها الوكيل نفسه قبل أن يصوغ أي شيء. الباقي أخطاء يكتشفها مراجع بعد وقوعها. هذا HIR بنسبة 64.8%، مع حصة تصعيد لا تتجاوز 18%: الوكيل مخطئ بثقة في معظم الوقت الذي يخطئ فيه، وهي أسوأ صورة لهذه المشكلة.

يسحب الفريق سجل التصحيح ويوسم كل تدخل بسبب. فئتان تطغيان: الوكيل يسيء قراءة سياسة الاسترداد كلما تعلق الأمر بمبلغ مالي، ويصوغ ردودًا هادئة إجرائية لعملاء غضبهم واضح. كلاهما قابل للإصلاح من دون لمس النموذج — أضف قاعدة صريحة بأن أي تذكرة تذكر استردادًا أعلى من $50، أو تتجاوز عتبة مشاعر، تُطلق تصعيد ask_human بدل مسودة. وكل ما عدا ذلك يُصاغ ويُراجع كما من قبل.

الشهرالتذاكر المعالجةالتدخلاتHIRحصة التصعيد
1 — تجربة 640 415 64.8% 18%
2 — بعد إضافة القواعد 810 224 27.7% 58%
3 — بعد ضبط القواعد مجددًا 940 101 10.7% 79%

بحلول الشهر الثالث، انخفض HIR بأكثر من 80%، لكن الرقم الأبلغ هو حصة التصعيد: صعدت من 18% إلى 79%. معظم ما تبقى ليس أن الوكيل يُضبط وهو مخطئ — بل أنه يتعرّف بشكل صحيح على حالة غامضة فعلًا (حساب VIP، أو استثناء في السياسة، أو استرداد يقع عند العتبة تمامًا) ويسأل قبل أن يتصرف. الانخفاض حقيقي، وهو مكتسب: كل جولة تصحيح عادت إلى قواعد صريحة، فتوقف تكرار الأخطاء المحددة التي أنتجتها، بينما الفئات التي ما زالت تحتاج حكمًا تُعلَّم بدل أن يُلتف حولها بمسودة.

الانخفاض الذي يهم هو ذاك الذي يتحسن فيه الوكيل في معرفة ما لا يعرفه — لا ذاك الذي يتوقف فيه شخص بهدوء عن المراجعة.

الخطأ: التعامل مع الصفر كأنه الهدف

ما إن يراقب فريق انخفاض HIR شهرًا بعد شهر، يصبح السؤال التالي البديهي إلى أي حد يمكن أن ينخفض. الغريزة هي أن يُعامل الصفر كخط النهاية — دليل أن الوكيل صار جيدًا بما يكفي ليعمل بلا إشراف. هذه الغريزة معكوسة، وهي أكثر قراءة خاطئة شيوعًا لهذا المقياس.

لماذا تكون 0% عادةً إشارة خطر

سير عمل يُظهر تدخلًا بنسبة 0% أسابيع متتالية لا يعني أبدًا تقريبًا أن الوكيل توقف عن ارتكاب الأخطاء. يعني أن أحد أمرين حدث بدل ذلك: توقف المراجعون عن قراءة المسودات فعلًا قبل الموافقة عليها، أو انكسر مسار التصعيد بهدوء — رُخّيت العتبات، أو فشلت قاعدة توجيه بصمت، أو توقف مشغّل ask_human عن الإطلاق. في الحالتين، الصفر لا يقول إن النظام لم يعد يحتاج شخصًا. يقول إن شخصًا لم يَعُد يُسأل، أو توقف عن النظر.

الهدف الفعلي لم يكن قط تدخلات أقل في المجرّد. إنه نظام تُبرز فيه اللحظات المحددة التي تحتاج حكم شخص — وتلك اللحظات فقط — بحيث يذهب انتباه الشخص إلى ما يحتاجه فعلًا، بدل أن يتوزع بالتساوي على كل شيء أو يغيب تمامًا. سير عمل عند HIR بنسبة 12%، حيث تكاد تلك الـ12% كلها تكون الوكيل يعلّم بشكل صحيح حالات غامضة أو عالية المخاطر فعلًا، أصح من واحد عند 2%، حيث معظم تلك الـ2% مراجع يتعثر على خطأ لم يعلّمه الوكيل قط. الرقم الأدنى قد يخفي النظام الأسوأ.

هذا بالضبط ما تُستخدم له حصة التصعيد. حين تُراقب إلى جانب HIR، تخبرك أي قصة أنت فيها:

قراءة اتجاه HIR — الرقم الهابط نفسه، بمعنيين مختلفين
0%، بلا نهاية
إشارة خطر — لا أحد يراقب، لا نظام بلا عيوب
مرتفع وثابت لأشهر
لا يتعلم — التصحيحات لا تعود إلى القواعد
هابط، والحصة هابطة أيضًا
افحصه — موافقات شكلية على الأرجح، لا تقدمًا حقيقيًا
هابط، والحصة صاعدة
ثقة مكتسبة — النظام يعرف حدوده

إذا كان HIR ينخفض بينما حصة التصعيد ثابتة أو هابطة، فلا تسجّله انتصارًا بعد. اسحب عينة عشوائية من الإجراءات المسجّلة «لا تحتاج تدخلًا» وليراجعها شخص على بياض، من دون أن تخبره أن العينة وُسمت نظيفة. تحقق إن كانت الإشارات اللاحقة — تذاكر تُعاد فتحها، شكاوى، استرجاع مبالغ الاسترداد، CSAT — تنجرف صعودًا في الوقت نفسه. HIR هابط مع مشكلات لاحقة صاعدة ليس نظامًا تعلّم أسرع. إنه نظام لم يمسك به أحد في الوقت المناسب.

ماذا تسجّل إن أردت قياس هذا اليوم

لا شيء من هذا يحتاج أدوات جديدة بقدر ما يحتاج تسجيل الشيء الصحيح. معظم الفرق التي تشغّل وكيلًا تتتبع الحجم أصلًا — كم تذكرة لمس، وكم مهمة صاغ. لا يكاد أحد منها يتتبع النتيجة، وهي الشيء الوحيد الذي يحتاجه HIR فعلًا.

  1. سجّل نتيجة لكل إجراء، لا مجرد عدد نشاط. أُرسل كما هو، أو عُدّل قبل الإرسال، أو رُفض وأُعيدت كتابته، أو صعّده الوكيل نفسه. من دون تسجيل على مستوى النتيجة، لا يمكن حساب HIR أصلًا — ستعرف أن الوكيل فعل شيئًا، لا إن كان يحتاج إصلاحًا.
  2. ثبّت المقام قبل أن تثبّت البسط. قرر ما يُحسب إجراءً واحدًا في هذا السير — تذكرة مُلموسة، أو مهمة مصاغة — وأبقِ هذا التعريف ثابتًا عبر الفترات، حتى يعكس تغيّر HIR حكم الوكيل لا تغيّر طريقة العد.
  3. وسم كل تدخل بسبب. «عُدّل» لا يقول شيئًا تقريبًا. «عُدّل: أُسيء تطبيق سياسة الاسترداد فوق $50» يقول بالضبط ما يُصلح تاليًا. تصنيف قصير ومتسق يحوّل سجل التصحيح إلى قائمة عمل لا لوحة نتائج.
  4. تتبع حصة التصعيد إلى جانب HIR، لا بدلًا منه. الرقمان معًا يقولان إن كان الانخفاض مكتسبًا أو مستعارًا — انظر جدول الاتجاه أعلاه.
  5. ضع حدًا أدنى، لا هدفًا هو الصفر. قرر، لكل سير عمل، كيف يبدو HIR معقول غير صفري بالنظر إلى مقدار الغموض الحقيقي في ذلك السير، وعامل معدلًا يهبط كثيرًا تحت هذا الحد كشيء يُفحص لا شيء يُحتفى به.
  6. أبلغ عن HIR لكل سير عمل، لا كرقم واحد ممزوج على مستوى الشركة. المتوسط الواحد يخفي أي سير اكتسب فعلًا إشرافًا أقل وأي سير يراكم مخاطرة بهدوء تحت رقم عنواني يبدو جيدًا.
  7. أعد فحص العينة «النظيفة» وفق جدول. اسحب دوريًا إجراءات سُجّلت أنها لا تحتاج تدخلًا وليراجعها شخص من دون أن يعرف أنها وُسمت نظيفة. هذا الفحص المباشر الوحيد على أن المراجعين ما زالوا يقرؤون.
FL
كيف يدعم FabricLoop هذا

لهذا بُني Loop Agent حول ask_human وresume وتصعيد تطبيقات القنوات بدل الاستقلال الصامت — وكيل يتوقف ليسأل هو وكيل يظهر في بسط HIR عن قصد، لا وكيل يُضبط مصادفة. تظهر التصعيدات والمسودات في المجموعات نفسها التي يعمل فيها الفريق أصلًا، إلى جانب المهام والملاحظات، فتظهر اللحظة التي احتاجت شخصًا حيث يعيش العمل أصلًا — لا مدفونة في وحدة وكلاء منفصلة لا يراجعها أحد. في Enterprise، تتيح سجلات التدقيق لتقنية المعلومات والعمليات أن يروا ما فعله الوكلاء ومتى تدخل إنسان بالضبط، وهذه هي المادة الخام التي يُبنى منها HIR من الأساس.

اقرن هذا بـالوضوح — المفهوم المرافق لضمان أن تكون المنح والصلاحيات مرئية أيضًا — فتحصل على السؤالين اللذين ينبغي لكل إطلاق ذكاء اصطناعي أن يجيب عنهما قبل أن يتوسع: من يستطيع أن يرى ما يفعله الوكيل، وكم مرة يحتاج شخص فعلًا إلى التدخل.


أهم الخلاصات
01
معدل التدخل البشري هو نصيب إجراءات الوكيل، في سير عمل واحد وفترة واحدة، التي احتاجت شخصًا يصحّح أو يلغي أو يجيب عن سؤال طرحه الوكيل قبل أن يُحسب العمل منتهيًا. إنه نسبة: التدخلات مقسومة على إجمالي الإجراءات.
02
موافقة مراجع على مسودة لم تحتج تعديلًا ليست تدخلًا. يقيس HIR عدد المرات التي كان يجب أن تتغير فيها النتيجة، لا عدد المرات التي نظر فيها إنسان إلى شيء.
03
حصة التصعيد — الجزء من التدخلات الذي علّمه الوكيل بنفسه، مقابل الجزء الذي اكتشفه مراجع بعد وقوعه — هي المقياس المرافق الذي يخبرك إن كان انخفاض HIR تحسنًا حقيقيًا أو عددًا أقل من الناس يراجعون فعلًا.
04
الانخفاض الصحي في HIR يأتي من إعادة أسباب التصحيح إلى قواعد أو أمثلة صريحة، فيتوقف الخطأ نفسه عن التكرار — لا من أن المراجعين ملّوا قراءة المسودات.
05
تدخل بنسبة 0% مستمر عبر الزمن إشارة خطر في الغالب الأعم، لا إنجاز. يعني عادة أن المراجعين توقفوا عن القراءة أو أن مسار تصعيد انكسر بصمت — لا أن الوكيل صار بلا عيوب.
06
الهدف الفعلي ليس أدنى رقم ممكن. إنه نظام يجعل اللحظات المحددة التي تحتاج حكمًا بشريًا مرئية — وتلك اللحظات فقط — فيقع انتباه الشخص على ما يحتاجه فعلًا.
07
للتحقق من HIR هابط، راقب الإشارات اللاحقة — تذاكر أُعيد فتحها، شكاوى، استرجاع مبالغ الاسترداد، CSAT — بحثًا عن ارتفاع يخفيه المعدل وحده، وأعد دوريًا مراجعة عينة من إجراءات «لا تحتاج تدخلًا» على بياض.
08
لقياس HIR أصلًا، تحتاج تسجيلًا على مستوى النتيجة (أُرسل كما هو، عُدّل، رُفض، صُعّد) — لا مجرد أعداد نشاط. معظم الفرق التي تشغّل وكلاء اليوم تسجّل الحجم ولا شيء غيره.
09
أبلغ عن HIR لكل سير عمل، لا كرقم واحد ممزوج على مستوى الشركة. المتوسط الواحد قد يخفي سير عمل اكتسب فعلًا إشرافًا أقل إلى جانب آخر يراكم مخاطرة بهدوء.