财务智能体的四个自主层级:建议、提议、审批后执行、边界内自主
一个分层模型,把每个财务工作流映射到明确的独立性水平,并配以明确的金额阈值和可逆性判断,是安全扩展智能体式 AI 的唯一方式。
作者 The Rexfin team
供应商会告诉你,他们的财务智能体可以“运行你的结账流程”。而一位真正上线过这类系统的 CFO 会告诉你,这个智能体在结账流程里运行大约九项具体任务,其中两项在没有人点击审批之前绝不会触碰任何一条账本分录。这两句话之间的差距,正是当前智能体式 AI 被卖给财务领域时存在的全部问题所在。
给智能体一揽子的自主权,是最常见也是代价最高的错误。Gartner 预计到 2027 年底前,超过 40% 的智能体式 AI 项目会被放弃,治理薄弱是被点名的原因之一。解决办法不是放慢采用速度,而是采用一个分层模型,让每个工作流都被分配到一个具体的独立性水平,配以明确的金额阈值,并对一个问题给出清晰答案:如果智能体在这件事上出错,我们能以多快、多低的成本撤销它?
自主性是工作流的属性,不是智能体的属性
人的本能反应是问“你们的智能体有多自主”。这是错误的度量单位。同一个智能体应该在一项任务上只提供建议,在另一项任务上提出提议,在第三项任务上则可以自由行动。自主性属于它正在执行的工作流,按两个维度评分:金额影响和可逆性。
一笔分类错误的报销单只是几百美元,而且很容易撤销。一笔汇给供应商的错误电汇则是六七位数,一旦结算就基本无法挽回。把这两者当作同一个“自主设置”来对待,要么会让所有工作都堵在人工审核之后,要么更糟,会让智能体推进一个它本不应该靠近的不可逆动作。
因此,在分配任何层级之前,你要先梳理清楚工作本身。可逆且金额小的动作,在自主阶梯上可以往上走;不可逆且金额大的动作,无论模型在演示中显得多有信心,都要往下走。
四个层级
第一层:建议(Advise)。 智能体呈现分析结果、标记异常、起草差异说明,但不采取任何行动。所有决定都由人做出。这是目前大多数财务 AI 真正应该待的位置,而这并不是一个安慰奖。一个能读完整本总账,并告诉你本月哪三个科目出现了意外变动,且数字来自已核对来源的智能体,即便是由人来敲下结论,也在做真正有价值的工作。
第二层:提议(Propose)。 智能体组装出一个具体的动作,把它放进审批队列。一条日记账分录、一次重分类、一份草拟的付款批次。没有点击就不会执行。相对于第一层的价值在于,人审核的是一份完成的提议,而不是一个还需要自己动手构建的建议。
第三层:审批后执行(Execute-with-approval)。 从这一层开始引入阈值。智能体在 CFO 设定的限额以下自动执行,超过限额的交由人签字。设定金额以下的供应商付款自动清算,超过的则等待。许多团队还会设一个更高的第二档,要求两名审批人。这是智能体开始节省大量时间的层级,但只有在阈值逻辑由系统强制执行,而不是依赖模型自身判断时才有效。
第四层:边界内自主(Autonomous-within-bounds)。 智能体在一个明确定义的参数集合内行动,不需要逐笔审批。比如对在容差范围内匹配的子账本条目进行核对,或根据新的实际数字刷新预测。每一个动作都会被实时记录,并且是可逆的。这里关键的词是“边界内”,这里的自主性是被政策圈定的,而不是一张空白支票。这就是治理型自主:人在系统之上设定规则,而不是在系统内部逐笔审批交易。(我们在治理型自主与人工介入对比中深入探讨了为什么逐笔审批会把你限制在人类速度上。)
大多数分层练习悄悄崩塌的地方
团队设计出一个整洁的四层矩阵,分配好工作流,写下阈值,感觉自己已经管起来了。然后智能体做出一件无法解释的事情,复盘会议才揭示出真正的问题:没有人能重建智能体在行动时看到了什么。
层级管的是智能体被允许做什么,对底层数字是否正确却只字未提。一个在第四层以 0.5% 容差范围内进行核对的智能体,只有在它比较的数字确实与账本对得上时才是安全的。如果这个智能体是在原始总账字段上做自己的概率性算术,那么你的容差带衡量的其实是噪声,而“边界内自主”意味着在一个你无法信任的边界内自主。
这正是最容易被跳过的依赖关系。每一层,即便是“建议”这一层,都建立在一个已核对的数字层之上。自主性框架控制的是一个动作的影响范围,对触发这个动作的数字的准确性却毫无约束。你两者都需要,而且第二个必须先于第一个存在。
每一层之下的准确率底线
Rexfin 就是坐在智能体之下充当这个底线的角色。它连接你的会计和财务数据系统,包括 QuickBooks、Xero、NetSuite、Sage、SAP、Oracle、你的数据仓库,或是上传的报表,并构建出一个与账本对得上的已核对模型。智能体不在原始数据上做计算,而是从已核对的模型中检索数字,并通过一个确定性引擎而非语言模型来运行计算。(推理与执行的划分本身是一个独立话题,参见为什么财务智能体必须调用工具而不是自己计算。)
这改变了每一层实际的意义。第三层的阈值检查,是针对一个能追溯到源头的数字运行的。第四层的容差带,是针对能够核对一致的数字来衡量的。当智能体采取行动时,支撑这个动作的数值是一个你日后能够证明的数值,这正是审计师会要求的东西,也是决策级日志要有价值就必须捕捉的内容(在记录决策而不只是记录动作的审计轨迹中有讨论)。
如何真正落地推行
让所有新工作流都从第一层开始。只有当一个工作流在一段明确的时期内,针对已知正确答案持续跑得干干净净之后,才把它提升一层,而不是因为一次好的演示就提升。用董事会能认识的真实金额设定阈值,并把它们写在由系统强制执行的地方,而不是写在提示词建议的地方。保留一个应急开关,一旦某项指标出现漂移,就能把任何智能体立刻降回第一层。并每个季度重新审视这些分配,因为可逆性是会变化的,比如一条新增了当日撤回功能的支付通道,会改变什么是可以安全自动化的判断。
一个诚实的限度是:分层不会把一个糟糕的模型变好。它遏制的是一个模型可能造成的损害,并迫使你对风险保持明确态度。这已经是大部分的战役了。剩下的部分,是确保智能体之下的数字是真实的,而这一点是任何自主性矩阵都替你做不到的。
如果你正在把自己的工作流映射到这些层级,并想看看每一层坐落在一个已核对、可追溯到源头的模型之上会是什么样子,预约演示。带上你最凌乱的结账流程,那才是最值得测试的。