受治理的自主性 vs. 人工在环:为什么审批每一个智能体动作无法规模化
审批每一个智能体动作,会把财务 AI 的速度限制在人工审核的速度上。受治理的自主性让人类站在系统之上,制定的策略只依赖于已对账的数字才成立。
作者 The Rexfin team
上个季度我采访的一位财务主管,不知不觉中变成了一个瓶颈。她的团队部署了一个应付账款智能体,负责匹配发票、标记异常、排队付款。它运作得很好。问题出在审批关卡上:智能体提出的每一个动作都会落入她的审批队列。到月底,她每天要审批 400 个条目,其中一半金额低于 200 美元,她坦言自己已经不再认真看那些小额条目了。智能体的速度很快,而它前面站着的人却跟不上,于是整个系统的运行速度被压到了她一个人的速度,而她的注意力早已退化成了一种形式主义的动作。
这就是那种没人会提前警告你的失败模式,当人们向你推销“人工监督”这个概念时。把一个人放进每一笔交易里,听起来很安全。实际上,它同时造成了两个坏结果。它把吞吐量限制在一位审核人员能够思考的速度上,同时也训练这位审核人员在不看内容的情况下批准通过,因为没有人能在数百个几乎一模一样的决策中持续保持真正的审慎。你最终得到的是控制措施的成本,却没有得到任何真正的保障。
审批关卡是一个限速带
在 AI 只是一个建议引擎、交易量还很低的时候,人工在环是有道理的。每天几条建议,每一条都得到妥善审核,这是一个合理的设计。但一旦智能体能够每小时执行成千上万个动作,这个设计就不再合理了。到了那个量级,审批关卡不再是一道安全保障,它变成了一个队列,而队列的排水速度上限,取决于其中最慢的那个环节。最慢的环节就是人。
Gartner 在这个问题上的表述很直接:能够观察、建议、经审批后执行、以及完全自主执行的智能体,承担的风险并不相同,用同一种方式对待它们,是导致部署失败的一条路。该机构甚至警告说,对所有智能体统一施加治理措施,会造成企业级的失败,出现安全漏洞和生产环境回滚。财务领导者容易忽略的,恰恰是这个反向的错误。如果你对每一个工作流,无论风险高低,都套用最严格的控制手段,也就是每个动作都需要人工审批,你得到的并不是更高的安全性,而是一个无法规模化的系统,以及一位早已不再真正审核的审核人员。
所以真正的问题不是“要不要人工介入”,而是人应该站在工作流程的哪个位置。
受治理的自主性把人往上提了一层
2026 年出现的这一转变,你可以在加州大学伯克利分校 CMR 关于运营模式的研究,以及世界经济论坛的董事会指南中读到,是不再把人放进每一笔交易内部,而是把人放到系统之上。你不再是审批智能体的每一个输出结果,而是设定约束它的策略:支出阈值,它能触碰哪些账户,某个动作需要具备什么样的可逆性,什么情况下必须上报升级。人类设计边界,智能体在边界之内自由运作,在边界处戛然而止。
这是“人工在环之上”(human-on-the-loop),而不是“人工在环之中”(human-in-the-loop)。智能体运营模式相关文献中一个很有用的模式,是设置一个独立的护栏检查,在智能体的动作执行之前对其进行拦截。如果一个采购智能体在其行为基线为 10,000 美元的情况下发起一笔 50,000 美元的付款,护栏机制会拦截这个动作并转交给人工处理。低于阈值时,智能体照常执行,人类根本不会看到这个动作。审核人员的注意力现在只花在真正需要判断力的那 3% 的案例上,这意味着这份注意力重新变成了真正的注意力。
经济账也随之翻转。你不再是花钱请一位审核人员去扫一眼 400 个条目,而是花钱请一位审核人员真正深入审查十二个条目。同样的人力成本,却得到了大得多的保障,而智能体在所有常规事务上都以机器的速度运行。这是唯一一种经得起在董事会上被质询的规模化方式。
一道边界的可信度,取决于它检验的那个数字
这才是治理供应商跳过不谈的部分,而恰恰是这部分,决定了这一切能不能真正立得住。
像“低于 10,000 美元自动批准、现金影响超过当期预算 5% 就上报、绝不触碰已关闭的期间”这样的策略,本质上是一组针对数字来评估的规则。受治理自主性这整套架构,都建立在这些数字是准确的这个前提之上。如果智能体对“现金影响”或“期间预算”或“剩余余额”的理解是错的,边界就会在错误的时刻触发。更糟的是,它会悄无声息地错误触发:智能体自信地自动批准了一个本应上报的事项,因为它用来对照阈值的那个数字本身就是错的。
这正是大多数智能体化财务技术栈悄悄失效的地方。智能体伸手进入 ERP,拉取原始的总账字段,然后由语言模型做脆弱的概率性算术,来判断是否触发了某个阈值。我们之前写过为什么财务智能体必须调用工具而不是自行计算:LLM 预测一个数字应该长什么样,而不是运行公式。一个建立在预测数字之上的护栏,根本不是护栏,它只是一场带着置信度分数的表演。
受治理的自主性需要边界条件是确定性的、经过对账的。阈值检验必须针对一个与总账相符的单一财务模型来运行,运算由引擎执行,而不是由模型执行。这就是一项你能向审计人员辩护的策略,与一项你只能寄希望于它能站得住脚的策略之间的区别。
这在实践中是什么样子
具体来说,能够规模化的工作流由三个部分组成,它们分别对应 Rexfin 所处的位置。
第一,一个已对账的模型。把 QuickBooks、Xero、NetSuite、Sage、你的数据仓库,或者上传的对账单,连接到一个与总账相符的单一真相来源。策略所引用的每一个阈值、基线和预算,都从这个模型读取,而不是从智能体碰巧抓取到的任何数据读取。
第二,确定性的评估。当智能体考虑执行某个动作时,阈值逻辑通过确定性计算引擎运行,而不是通过 LLM。“这是否超过了期间现金的 5%”这个问题,每次都会得到相同的答案,并能追溯到源头。边界因此变得可审计。
第三,人站在系统之上。你的团队负责设定和调整策略,只审核被上报的例外事项,并检查一份记录,这份记录不仅记录了智能体做了什么,还记录了它检查了哪个数字,以及策略为什么允许或阻止了这个动作。最后这一点对合规至关重要,它直接关联到SOX 合规的智能体必须记录哪些内容:记录的是决策,而不只是动作。
这一切都没有去掉人的角色。它只是把人重新安置到了他们的判断力能够产生复利效果的位置,而不是被磨损殆尽的位置。
结论
审批每一个智能体动作,不是谨慎,而是一种设计,它给你一种控制感的表象,同时把你的财务职能限制在一位疲惫的审核人员所能承受的吞吐量上。受治理的自主性,是真正能够规模化的替代方案,但前提是这些边界必须建立在你信任的数字之上。一个针对幻觉数字设定的阈值,比没有阈值更糟糕,因为它会悄无声息地、貌似严谨地失效。
如果你今年正在设计智能体的自主性,先设计策略,然后问一个更难的问题:这些策略读取的数据来自哪里?如果答案是“LLM 对总账的最佳猜测”,那你建立的不是治理,而是一种更快犯错的方式。预约演示,我们会向你展示,当边界建立在一个已对账的模型之上时,受治理的自主性是什么样子。
资料来源:Auditoria, Finance AI 2026: Human-in-the-Loop Out, Governed Autonomy In;California Management Review, Governing the Agentic Enterprise;World Economic Forum, A board playbook for governing agentic AI;Gartner, Applying Uniform Governance Across AI Agents Will Lead to Enterprise AI Agent Failure。