学习
代理式 AI 在财务领域首先需要一个可靠的数字层
在被幻觉数字驱动的财务代理会以机器的速度失败。在实现自主决策之前,你需要一个代理能够信任的经过核对的模型。原因如下。
一个自主代理不会停下来自我怀疑,这正是它的意义所在。你给它一个目标、一套工具和行动的权限,它就会一直处理这个问题直到完成。现在设想一下,这样一个代理从仪表盘上读到“第三季度收入:410 万”,而这个数字实际上是季度至今(quarter-to-date)的数字,它据此判断公司进度超过计划,并触发了一次重新预测,董事会将在周五看到这份结果。没有人输入过那个数字,没有人核实过它,代理只是根据它被提供的信息采取了行动。
这才是代理式财务中真正的风险,而它几乎与模型有多聪明无关。
代理的构想本身确实很好。你得到的不再是一个只回答问题的 AI,而是一个真正干活的 AI:提取数据、运行计算、起草差异说明、更新预测、标记异常、登记会计分录。Gartner 预计,到 2028 年,嵌入云端 ERP 的 AI 将带动财务结账速度提升约 30%,而且相当一部分财务团队已经在试点或规划代理式工作流。发展方向毋庸置疑,问题在于这些代理究竟立足于什么之上。
自主性会放大它所依赖的一切
这里有一道令人不安的算术题。一个产生幻觉数字的聊天机器人,浪费的是一位分析师一个下午的时间。一个产生幻觉数字、并据此采取三个下游行动、再把这些结果交给第二个代理的代理,则是在一条没有人实时监控的链条中传播了一个错误的数字。自主性是一个乘数,它以同样的热情放大好的决策,也放大坏的输入。
治理方面的数据应该让任何一位 CFO 都感到警觉。据 2025 年的一项估计,只有约 2% 的公司具备足够的 AI 护栏,而绝大多数组织已经至少经历过一次 AI 事故。成熟度是稀缺的,大约每五家公司中只有一家拥有成熟的 AI 治理框架。与此同时,代理还在持续上线。能力的发展正远远超过管控的速度,这是一个熟悉而又危险的模式。
所以,放慢脚步的直觉是对的。但“放慢脚步”本身不是一种战略,也经不起一个已经读过同样那些关于自主财务头条新闻的董事会的追问。更好的答案是:精确地弄清楚在让代理行动之前,什么必须是坚实可靠的,并优先把那部分建好。
三个环节会出问题,而只有一个是模型
当一个财务代理产生错误结果时,失败几乎总能追溯到以下三个地方之一。
模型推理出错。这是所有人最先去修的失败点,却也是最不常见的原因。前沿模型如今对财务概念的推理已经相当不错。
模型自己做算术。语言模型对数字进行标记化并模式匹配,而不是真正进行计算,这正是它们会自信地给出错误求和与比率的原因。我们在为什么你的 AI 会算错数字一文中拆解了这一机制。解决办法早已明确:不要让模型自己做数学运算,把计算交给一个确定性引擎。
底层数据是错误的、过时的、含糊的,或未经核对的。这是最大的一个问题,也是没人愿意谈论的问题,因为它不是一个能靠买一个更大上下文窗口就解决的模型问题。如果代理读到的数字对不上总账,它之后采取的每一个行动都建立在流沙之上。再强的模型智能也修复不了一个错误的输入。
请注意,三个失败原因中有两个完全发生在模型之下。你可以把世界上最强大的代理架设在未经核对的数据和一个带随机性的计算器之上,它依然会产生自信、无法追溯、错误的数字,而且比以前更快。
可靠数字层,定义清楚
这正是代理炒作所跳过的部分。在实现自主性之前,你需要一个完成三项枯燥但至关重要工作的层。
- 一个经过核对的模型。 从 QuickBooks、Xero、NetSuite、Sage、数据仓库或上传的报表中提取数据,并将它们归并为一个与总账对齐的单一财务模型。这不是数据的副本,而是一个经过核对的事实源,让“410 万”意味着一个具体、明确、共同认可的东西。
- 确定性计算。 当代理需要一个利润率、一个现金跑道、一个契约比率时,这个数字来自一个每次都以相同方式计算的引擎,而不是模型的即兴发挥。相同的输入,相同的答案,始终如一。这正是让一个结果可复现,而不是一次性掷骰子的关键。
- 可追溯到源头。 代理接触到的每一个数字,都可以追溯回产生它的文档和计算路径。控制人员可以点击一个数字,看到它的来源。
把这三者结合起来,你就改变了代理所行动的基础。它不再是在对着一张仪表盘截图进行推理,而是在检索经过验证的数字,针对确定性引擎进行计算,并产生可追溯到源头的输出。自主性没有变,但根基变了。
我们认为这里的操作顺序是不可妥协的:先信任数字,然后再让行动自动化。反过来做,你就是把自己自动化进了更快的错误里。这与单一事实来源:为什么经过核对的数据才是 AI 在财务领域的真正解锁点一文背后的逻辑是一致的,它是前提条件,而不是锦上添花的选项。
“直接给代理一个代码解释器不就行了”
到这里常见的一个反驳是:代理已经可以调用工具了,那就让代理运行 Python,算术问题不就消失了吗。这个说法说对了一半,而这正是危险之处。
代码解释器解决的是算术问题。代理不再会在长乘法上出错,这很好。但它对错误的输入、未经核对的数据源、缺失的溯源信息,以及财务领域大量存在的地域歧义,毫无帮助。12,345 到底是一万二千三百四十五,还是十二点三四五?这取决于这份报表来自哪里。代码解释器会欣然基于一个错误的数字进行计算,结果变得既精确又错误,这比明显的错误更糟糕,因为精确读起来像是值得信赖。我们在为什么“直接用代码解释器”并不能让 AI 在财务上足够安全一文中详细探讨了这一点。工具调用是必要的,但远远不够。
真正优秀的代理式财务是什么样的
真正从代理中获得实际价值的团队,并不是那些拥有最大自主权的团队,而是那些把自主权的范围精心界定清楚的团队。
人机协同被视为一项设计决策,而不是一个需要“毕业”摆脱的训练轮阶段。对于高影响力的行动,一个负责提议、由人负责批准的代理,在风险和问责这两个维度上都持续优于完全自主的代理。真正严肃的部署会强制执行最小权限原则,记录每一个行动,要求人工审批关键步骤,并保留一个紧急停止开关。你可以参考这份关于代理式 AI 在金融服务领域的研究综述,了解实践中的具体情况。
自动重新预测是这一模式的一个良好范例:代理监测重大差异,提出更新后的预测,展示其推理过程,再由人工签字确认。这种做法既强大又站得住脚,但前提是它检测到的差异是针对一个经过核对的基准计算出来的,而不是它半记得的一个数字。我们在代理式 FP&A 正在到来,但代理需要一个经过核对的基础一文中详细介绍了这一点。
理解这一切的一个有用视角,是将其放在更宏观的面向 AI 的可靠财务建模层这一命题之下。代理不过是这一层最苛刻的使用者。它们会比人类分析师更快、更公开地暴露出你数据中的每一个弱点。
坦诚地说清楚局限
一个可靠的数字层并不会让代理变得万无一失。它无法修复一个定义不清的目标,也无法修复一个在真正新颖的情况下推理不佳的模型,更无法解决没有人审核高风险决策的流程问题。对账本身很难,让财务数据源在各系统之间精确到分毫地一致,是一项真正的工程工作,而不是勾选一个选项就能完成的事情。我们卖的不是魔法,而是一个前提条件。
这一层真正做到的,是消除那些在财务领域不可原谅的失败模式:基于一个从未真实存在过的数字采取行动,以一种无法复现的方式计算出这个数字,以及汇报这个数字时没有任何可追溯的轨迹。剔除这些之后,剩下的风险,一支称职的财务团队已经知道如何通过权限、审批和审查来管理。
这十年里,代理将承担大量财务工作。最终获胜的团队,不会是最早部署代理的那些,而是那些代理所立足的数字确实真实可靠的团队。
如果你正在试点代理,并想看看它们在一个经过核对的模型上运行,而不是靠着一份仪表盘上的猜测运行会是什么样子,预约演示,我们会用你的数据来演示给你看。
本专题内容
- 01
AI 写回你的计划:为什么“提出建议”和“写入”需要不同的验证关卡
只读 AI 与具备写入能力的 AI 属于不同的风险类别。以下说明为什么智能体写入你的实时计划需要分阶段的自主权,而不仅仅是一个好的提示词。
- 02
为什么 AI 永远不应该自动应用科目表映射
置信度分数不是 AI 映射变更的安全关卡。为什么重新分类需要人工批准才能生效,以及真正的可撤销性。
- 03
财务领域的 MCP 正变得越来越拥挤,验证却依然缺席
如今几乎每一家 FP&A 供应商都提供 MCP 端点,或一份技能文件库。二者都无法证明底层的数字是对的。
- 04
智能体化 FP&A 即将到来。你的智能体需要的是已对账的基础,而不只是自主权
自动重新预测的智能体既强大又危险。在未经验证的数字上,它们会以机器的速度放大误差。已对账的模型才是让它们真正可靠的关键。
- 05
为什么“直接用代码解释器”并不能让 AI 在财务上安全可靠
代码解释器修好了算术,但它对错误的输入、未经核对的数据、缺失的溯源信息,以及 12,345 与 12.345 之间的歧义都无能为力。这里是真正的缺口所在。
- 06
单一真实来源:为什么已对账数据才是 AI 在财务领域真正的解锁点
FP&A 团队将近一半的时间耗费在数据清理上,而对账工作缺乏上下文就会停滞。唯有一个已对账的模型,才能让 AI 给出的答案值得信赖。
- 07
财务智能体的四个自主层级:建议、提议、审批后执行、边界内自主
一个分层模型,把每个财务工作流映射到明确的独立性水平,并配以明确的金额阈值和可逆性判断,是安全扩展智能体式 AI 的唯一方式。
- 08
为什么财务智能体必须调用工具,而不是自己计算
LLM 预测的是一个数字应该长什么样,而不是真正运行公式。智能体式财务的解决方案,是让每一次计算都通过确定性工具运行在一个已核对的模型之上。
- 09
记录决策,而非仅仅记录行为的审计轨迹:2026 年符合 SOX 要求的财务智能体必须记录什么
审计师不再接受“智能体做了 X”这样的日志。他们想知道它看到了什么、决定了什么、为什么政策允许它这么做,以及总账中发生了什么变化。以下是相关标准。
- 10
受治理的自主性 vs. 人工在环:为什么审批每一个智能体动作无法规模化
审批每一个智能体动作,会把财务 AI 的速度限制在人工审核的速度上。受治理的自主性让人类站在系统之上,制定的策略只依赖于已对账的数字才成立。
- 11
当一个智能体变成八个:多智能体财务系统中的准确性与风险
多智能体财务系统会把微小的错误层层放大,最终产出错误的报告。解决方法是让每个智能体读写同一个已核对的模型,而不是各自维护八份互不相通的私有真相。
- 12
是谁授权了这个智能体?弥合智能体式财务中的服务账户归属缺口
2026 年财务审计中最常见的发现:一个 AI 智能体通过一个与人无关联的共享服务账户接触了 ERP 系统。以下是如何弥合这个缺口。
- 13
如何评估财务智能体:在信任数字之前先建立准确率评分卡
供应商演示什么也证明不了。这是 CFO 需要用来衡量财务智能体字段级准确率、答案一致性和可追溯性,并与已核对的真实数据对照的评估框架。