聊天机器人和智能体的真正区别
一个回答问题。另一个决定做什么、去做、检查自己的工作,再进入下一步——不等你开口要求。这个差别不是学术讨论。它改变的是什么会出错,以及该由谁来抓住它。
聊天机器人收下你输入的内容,生成一段回应,然后停下。智能体收下你输入的内容,决定必须发生什么,去做,检查那样做是否有效,再决定下一步做什么——自己决定,往往跨过很多步——在任何人看到其中任何一步之前。区别就这些。人们争论“AI智能体”时争论的一切——风险、一套系统需要怎样的监督,以及大部分营销造成的混淆——都从这个差别推出来。
聊天机器人实际在做什么
聊天机器人是单程系统。你给它文字,它生成文字回来,交互到此结束。即使一个记得很长对话的聊天机器人,每一轮也只做一件事:读到目前为止说过的全部内容,预测下一条消息。它从不查询数据库去核对事实,从不替你发出任何东西,也从不会过后再回来看自己的回答是否站得住。它错了的话,损失是一个人读到的一句话——而在寻常过程里,这个人可以在据此行动之前抓住它。
人们让聊天机器人做的大多数事,都是这个形状,只是没人留意:总结这份文档,起草一条生日消息,解释我们的退款政策,写三个标题选项。这些都不要求系统对照现实世界核对任何东西,也不要求它在聊天窗口之外采取行动。界面叫“AI助手”或“副驾驶”而不是“聊天机器人”时,这一点仍然成立。盒子上的标签改变不了里面发生的事。
智能体实际在做什么
智能体跑的是一个循环,不是单程:计划一步,通过调用真实工具采取行动——搜索数据库、发送消息、编辑文件、访问 API——看这一行动实际返回了什么,再用这个结果决定下一步。它重复下去,直到任务完成、卡住,或者它被做成会向人确认。重要的是,沿途没有人批准每一个单独的步骤。系统自己决定下一步试什么,依据是它上次行动时实际发生了什么。它可能在每一个这样的决策点上出错,而不只是在最终答案里出错。
这个循环并不新,也不奇特。研究者描述它的各种版本——思考做什么、行动、观察结果、再思考——已经很多年了。自称智能体的产品底下实际跑的就是它,从提交报销单的软件,到打开终端、自己运行命令的编程工具。让某样东西成为智能体而不是一个话很多的聊天机器人的,是它作用于世界,看着发生了什么,然后调整。反复如此,不需要人批准每一次动作。
同一个请求,两种跑法
当两套系统拿到听起来相近的指令时,这个差别是这样的。
“总结这份文档。”
- 1读你粘贴进来的文字。
- 2生成一段摘要。
“找出逾期超过30天的三张开票,为每一张起草一封催款邮件,放进我的草稿文件夹。”
- 1查询开票系统,筛出未结清超过30天的发票。
- 2核对它实际找到的是三张,不是两张或五张——对不上就标出来,而不是猜。
- 3取出每张发票正确的金额、到期日和联系人,起草催款。
- 4通过邮件工具,把每一份草稿存进真实的草稿文件夹。
- 5回报它找到了什么、起草了什么。
把第二个问题交给聊天机器人,它仍会交回看起来像答案的东西:三封听起来合理的催款邮件,根据你碰巧粘进对话的内容生成。它不会做的,是查询你真实的开票系统、核对数量,或把任何东西放进真实的草稿文件夹。输出可以看起来相似。系统实际做的事并不相似。
这不只是语义之争
这个区分重要,是因为它改变了什么会出错,以及谁来抓住它。聊天机器人最坏的情况是一个错误答案。有人读到它,在正常过程里要么抓住错误,要么决定不据此行动——错误从不离开对话。智能体最坏的情况是现实世界里已经采取的错误行动:催款发给了错误的客户、带着错误的余额,记录被更新成错误的值,退款被开出两次——在任何人审阅任何东西之前。错误不再是一句话。它是一个事件,而事件不会自行撤销。
聊天机器人最坏的情况,是有人读到的一个错误答案。智能体最坏的情况,是已经采取的错误行动——在任何人读到任何东西之前。
所以智能体需要的监督,和聊天机器人不同。聊天机器人主要需要有人在有空时检查它的回答。智能体需要它的设计者在它运行之前就已经决定:哪些行动它可以不问就做,哪些需要人先看到计划,它卡住时会发生什么。事后才弄清楚,你就会用最疼的方式发现智能体已经做了什么。
你只能信任你能看见的东西
这和 FabricLoop 的 Legibility 是同一个想法:你只能治理你确实能看见的访问和行为。对聊天机器人,这几乎是自动的——它的全部输出是一个人读到的消息,所以行动和行动的记录是同一件事。对智能体则不是。它的行动发生在别的系统里——CRM、收件箱、数据库、文件——除非有东西记下它碰过、改过或发出过什么,否则事后无法复查,更谈不上事前阻止。Legibility 不是叠在智能体上面的合规点缀。对智能体来说,这就是全部问题,因为它的“答案”不是你可以校对的一句话,而是一组行动;除非系统被做成会把它们显示给你,否则你可能永远不知道它们发生过。
这是两个想法之间的实际联系:智能体承担的风险比聊天机器人更多,也不同,所以它才需要一条看得见的、它做了什么的痕迹,并在利害更高的情形里,在行动之前设一个检查点。FabricLoop 的 人工干预率 把这当作一个你设计和度量的数字,而不是出了事之后再补上的事后想法。
市场一直把这件事标反了
一旦有了真正的检验,标签在两个方向上说谎的频率就很明显。大量被用力营销成“AI智能体”的产品——这个词出现在首屏标题里、出现在价格档位里——底下其实是一条调好的提示:读输入,生成输出,完成。没有独立的工具调用,没有循环,没有未经人批准下一步点击就做出的决定。与此同时,大量从不用“智能体”这个词的软件——自动开票流程、自己改道流量的监控系统、重启失败服务并检查是否修好的运维脚本——正在安静地跑着上面描述的那个循环。标签上的词,并不能可靠地告诉你实际用的是哪一台机器。
1. 做这件事是否需要不止一步? 2. 下一步是什么,由它决定,还是由人一步一步、一次点击一次点击地决定? 如果每一步都是人在选,你看到的是一个多了按钮的聊天机器人——营销页怎么叫,你就怎么叫。如果系统在不止一步里自己选择下一步,你看到的就是智能体,并且必须按智能体来治理:看得见的日志,不问就能做的事有明确边界,以及谁在何时审阅它的真实答案。
FabricLoop 自己的 AI 产品 Loop Agent 跑的就是这个循环——跨 MCP 连接的工具搜索、起草、检查自己的工作——但它被做成展示自己的工作,并在利害更高的步骤之前询问,而不是默默行动、事后再报告。它使用的每一个 MCP 连接都限定在一个人身上;在 Enterprise 上,它做了什么会出现在审计日志里,而不是只活在它对这段对话的记忆中。
这和 Legibility 与 人工干预率 讲的是同一套逻辑——如果这三个想法里这是第一个让你想通的,接下来值得读它们。
应用这些,不需要技术背景。下一次有供应商或同事把某样东西叫做智能体,问它在你的指令和结果之间实际做了什么——以及这些步骤里有多少是它自己决定的。
