先建立信任,再实现自动化:2026 年 CFO 的 AI 财务清单
87% 的 CFO 认为 AI 至关重要。看到真实投资回报的却少得多。差距不在雄心,而在信任。这是在你实现自动化之前,先弥合这一差距的清单。
作者 The Rexfin team
上个季度,一位财务负责人告诉我,她的董事会在每次会议上都问同一个问题:“我们在 AI 上是不是落后了?”她会点点头,提提那些试点项目,然后转移话题。私下里她清楚真相。试点项目确实存在,它们也产出了幻灯片。但没有一个碰过她真正愿意签字确认的数字。
这就是当下 AI 在财务领域的真实状态。不是拒绝,也不是全面采用,而是一种停滞状态。
调查数据也印证了这一点。在近期针对 CFO 的研究中,约有 85% 到 90% 的财务负责人表示 AI 对其职能至关重要或具有战略意义。而报告有可衡量投资回报的比例要小得多,常被提及的数字是百分之十几的低位。不同研究给出的具体数字各有差异,但形态从未改变:信念很高,回报很薄。热情是真实的,而回报却不然。
本能的反应是归咎于模型。换一个更聪明的模型,写一个更好的提示词,等待下一次发布。这种诊断是错的。真正横亘在 CFO 与 AI 投资回报之间的,不是模型质量,而是信任。而财务领域中的信任不是一种感觉,是一组可以核查的属性。
为什么“先自动化”总是失败
大多数失败的试点项目走的是同一套剧本。有人把一个聊天机器人连到一堆导出文件上,向它提出财务问题,得到了流畅、自信、看似合理的回答。然后一位财务主管抽查了其中一个,数字不对。不是离谱地错,只是恰好错到令人怀疑的程度。而一旦有一个数字出错,所有数字都会被怀疑,因为如果不亲自重做一遍这些工作,你根本没有办法分辨哪些是对的、哪些是错的。
于是这个试点项目就悄悄夭折了。不是在某次会议上,而是在某位财务主管的脑海中,就在她决定自己去把数字拉出来会更快的那一刻。
这里的教训在于顺序。你无法靠自动化通向信任。你必须先赢得信任,然后在其之上实现自动化。给一个未经信任的系统做自动化,只会更快地产出错误答案,而且是在没有人核查的规模上。这才是 2026 年真正值得警惕的失败模式:不是拒绝帮忙的 AI,而是自信满满地把你带下悬崖的 AI。
这种顺序问题是面向 AI 的财务可靠性层一以贯之的主线。顺序一旦弄错,下游的一切都不重要了。
清单:自动化之前要做的五件事
把接下来的内容当作一道采购筛选。如果一个工具、一家供应商,或者你内部自建的系统无法通过这五项,它就不应该靠近任何一个董事会数字。至少现在不行。
1. 落地:每一个答案都来自你的数据,而不是模型的记忆
一个没有落地的大语言模型是根据其训练数据来回答的,这意味着它会欣然给出一个与你的账本毫无关系的营收数字。第一个不可妥协的要求是,系统必须从你的已核对财务数据中检索,并且在数据不存在时拒绝回答。
测试方法很直接。问它一个你知道在已连接数据中不存在的指标。一个值得信赖的系统会说找不到。一个危险的系统会编造出一个看起来对的答案。如果你对一个无法回答的问题得到了一个自信的答案,评估到此为止,不必继续了。
2. 引用:每一个数字都能追溯回来源
一个无法追溯的数字只是一个带小数点的传闻。对于进入董事会材料或预测的任何内容,你都应该能够点击这个数字,看到它来自哪里:源数据行、期间、文档。
这也是“AI 这么说”和“这是审计轨迹”之间的区别所在,而这正是监管者或尽职调查团队会问的问题。我们在为什么仅靠检索还需要一个确定性计算层一文中深入讨论了其中的机制,因为没有正确数学支撑的引用只完成了一半的工作。
3. 确定性计算:模型负责检索,引擎负责计算
这是大多数团队最容易忽略的一点。语言模型在算术方面确实很差,而且不是靠更好的提示词就能修复的那种差。它们把数字当作文本片段来分词,然后模式匹配出一个看似合理的结果,而不是真正计算出一个结果。公开基准测试已经表明,在多位数、多步骤的数学运算上,准确率会急剧崩塌,而一次单一的损益表汇总恰恰需要做几十次这类运算。
解决办法不是换一个更聪明的模型,而是架构问题。模型决定要计算什么。真正做计算的是一个确定性引擎,方式和电子表格一样,所以 240 万加 110 万永远等于 350 万,而不是“大约 350 万”,还有 4% 的概率是 360 万。如果你想了解这一点为何如此重要的深层原因,为什么 AI 在财务数学上会出错详细阐述了分词带来的问题。
同一个查询运行十次。如果答案漂移,说明计算发生在模型内部。这就是不合格。
4. 审计轨迹:几个月后工作仍可复现
一个在六月是对的数字,到了九月被审计师问起时也需要仍然站得住脚。这意味着需要有一份不可篡改的记录,记录了当时使用了什么数据、计算了什么、答案是什么,并在产生的那一刻就被冻结下来。可复现性不是合规意义上的锦上添花,它是让你无需从零重新推导,就能坚持一个季度前报出的数字的关键。
5. 对任何离开组织的内容进行人工监督
信任是分级的,而不是非此即彼的。内部探索性查询可以自由运行。进入贷款契约计算的数字应该经过人工检查点。把你的使用场景映射到风险等级,并按风险高低要求相应比例的签核。前四项的意义就在于让这种人工审核变得快速,因为来源和计算过程已经摆在那里。监督变成了一瞥,而不是一次重新审计。
这在实践中是什么样子
请注意这五项的共同点:没有一项是关于让 AI 变得更聪明的。它们都是关于让 AI 之下的基础是否正确、可追溯、稳定的。模型是最后一公里。可靠性存在于其下的那一层。
这正是构建在一个已核对财务模型之上这一整套论证的核心。一个与账本核对一致的唯一真相来源,AI 从中检索,一个确定性引擎据此计算,每一个输出都能追溯回来源。把这一点做对,清单其余部分基本上自动成立。跳过它,你又会回到自信、错误、且快速的老路上。
我坦率承认这一方法的局限。它不会让 AI 变得万无一失。它让 AI 的错误变得可见且有边界,这与一个大多数时候是对的、其余时候保持沉默的黑箱,是完全不同的风险画像。对财务团队而言,有边界、可核查,永远胜过聪明却不透明。
2026 年最大的失误将是那位因为董事会想要一个亮眼标题,就在一个未经信任的系统上实现自动化的 CFO。而赢家将是那位先建立信任层、再让自动化在坚实基础上不断复利的人。先信任,再自动化,而不是反过来。
如果你想看看一个已核对、可引用、确定性计算的基础在真实财务数据上究竟是什么样子,预约演示,带上你最棘手的一个数字来。
所属专题 AI 在触碰你的数字之前需要的可靠性层