学习
AI 在触碰你的数字之前需要的可靠性层
AI 会捏造数字,也无法可靠地做算术。修复方式不是一个更聪明的模型,而是一套 AI 从中检索数据、并据此进行计算的已核对财务模型。
问一个前沿模型 4,182,019 乘以 7,431 等于多少。它会立刻作答,语气无比笃定,而且答案很可能是错的。不是“舍入误差”那种错,而是错了几十万,还说得跟从计算器上读出来的一样。
现在设想同一个模型在回答一个董事会关于毛利率趋势的问题:涉及三个主体、两种货币,以及年中一次科目表变更。它会用同样自信的语气回答这个问题。而你没有任何快速的方法判断这个数字是真实的还是编出来的。
这道鸿沟,存在于 AI 听起来有多确定、和它的数学实际有多可靠之间,正是问题的全部所在。这也是为什么大多数尝试把聊天机器人接到自己数字上的财务团队,最后都悄悄不再用它了。
瓶颈不在模型
财务领导层现在有一种本能反应,认为下一个版本的模型会解决这个问题。它不会,至少不会以人们期望的方式解决,因为这不是一个知识缺口,而是一个架构问题。
语言模型不会计算,它们根据文本中的模式预测下一个词元。数字被切成碎片,模型从未把它们重新组装成一个可以运算的量。所以当一个 LLM“做数学”的时候,它其实是在按模式匹配一个类似问题的答案通常长什么样。在小而常见的求和上,它表现出色,因为这类求和它见过上百万次。一旦深入更大或更陌生的算术,准确率会断崖式下跌。研究人员已经清楚地记录了这种崩溃:在简单案例上近乎完美,在较难案例上近乎无用,而且中间没有任何预警。
最后这一点应该让 CFO 感到担忧。模型在不确定的时候不会变得更谨慎,它在答对和在编造的时候,语气一样流畅。我们在《为什么你的 AI 算错了数字》中深入探讨了其中的机制,但简短版本是:一个更能言善辩的模型,不等于一个更准确的模型。
那么如果模型的算术不能被信任,AI 在财务领域到底能做什么?很多。用通俗英语理解一个问题。知道哪些数字重要。像一个敏锐的分析师那样解释一个差异。起草评论文字。这些都是语言任务,而语言正是这些系统被构建出来擅长的东西。计算才是你要从它们手里拿走的部分。
为什么“直接把数据喂给它”也行不通
第二个常见的本能反应是检索。把模型接到你真实的财务数据上,让它不再靠猜。这个方向是对的,但仅靠这一点还不够。
检索增强生成(RAG)能告诉你一个数字从哪来,却不能告诉你这个数字之上的算术对不对,也不能告诉你底层数据本身对不对得上账。把一个检索系统对准一本混乱的总账和三张导出的电子表格,你会得到速度快、引用漂亮的答案,而这些答案建立在从一开始就没有核对过的数字之上。自信、有出处,却仍然是错的。朴素的检索往往会在一个远低于财务团队能签字认可的准确率水平上就见顶了。我们在《财务领域,仅有 RAG 是不够的》一文中拆解了这个天花板。
在这背后还有一个更大的结构性问题,麻省理工学院用一个数字说明了它。一项被广泛引用的 2025 年研究发现,绝大多数企业级生成式 AI 试点项目都没有产生可衡量的利润影响。具体到财务领域,让试点项目失败的很少是模型本身,而是数据从来没有处于任何系统能够干净地进行推理的状态。数字分散在不同工具里,时点不同,“营业收入”的定义也不同。没有核对,没有共享的真相来源。我们在《百分之九十五问题》中拆解了这对财务团队意味着什么。
贯穿所有这些的模式是一样的:更聪明的提示词、更大的上下文窗口、更新的模型,没有一个能修复一个从未被真正搭建起来的地基。你必须先搭建这个地基。
可靠性层究竟是什么
以下是一套站得住的架构。三项工作,严格分离,这样擅长语言的部分就永远不会被交去做需要精确的事。
**底层是一套已核对的模型。**在任何 AI 介入之前,你从数据所在的地方(QuickBooks、Xero、NetSuite、Sage、一个数据仓库,或上传的报表)提取数据,并把它整理成一套与总账挂钩的单一财务模型。每个指标只有一个定义。一组彼此对得上的数字。这是每个人都想跳过的部分,也是其他一切都依赖的部分。
**一个用于数学运算的确定性引擎。**当一个问题需要计算时,算术在一个真正的计算引擎里运行,而不是在模型的“脑子”里。相同的输入每次都产生相同的输出。求和一列数字、构建一个比率、滚动一份预测、跑一个假设情景,所有这些都是计算出来的,不是预测出来的。LLM 提出该计算什么,它从不亲自计算。
**每一个数字都能追溯到源头。**系统报出的任何一个数字都可以被追溯回底层记录,以及产出它的确切计算路径。不是“相信我”,而是点击一下,就能看到它从哪来。这正是把一个 AI 答案变成可以放在董事会或审计师面前的东西的原因。
把这三件事做对,AI 的角色就变了。它成为界面和分析师,坐在已经核对好、并且总是被确定性地重新计算出来的数字之上。模型负责含义,引擎负责数学,模型层负责真实性。
这正是 Rexfin 平台的设计初衷,产品原理一文完整走了一遍这个流程。
请注意,这份清单里刻意缺了一步:一步“把答案交给 AI 信任”的环节。模型从不持有这个数字,它只是索要这个数字,引擎针对已核对的数据计算出结果,结果连同其血缘一起返回。这种分离就是全部重点所在。这也是为什么这种方法能优雅地降级:当模型不确定时,最坏的情况是一句含糊的话,而不是一个捏造出来的数字,因为数字从来就不是模型的工作。
这条路会通向哪里:智能体
这件事之所以每个季度都变得更重要,原因是自主性。对话正在从“被问到才回答的 AI”转向“会主动行动的智能体”:自行重新预测、在你发现之前先标记出一次契约条款违约、在某个数字变动时触发一次情景分析。大多数 CFO 都预期在未来几年内,财务智能体会成为常规操作。
一个基于捏造数字采取行动的智能体,犯下的不是一次安静的小错误。它会以机器的速度不断放大误差,并把错误传导进下一个决策。自主性提高了对地基的要求,而不是降低了要求。你无法在你无法验证的数字之上安全地实现自动化。这套已核对、可追溯的模型层,对于智能体时代来说不是一个锦上添花的选项,而是先决条件。
诚实地说说局限
这不是魔法,假装它是魔法,恰恰就是我们在警示的那种过度自信。如果你的源数据本身就一团糟,一套核对层能揭示冲突,却不能凭空发明出并不存在的一致性。混乱的多主体场景中的边缘情况仍然需要人来做判断。而语言层即便在背后的数字精确无误的情况下,也仍然可能把解释表述得笨拙。
它能保证的是真正重要的那件事:这个数字是真实的,它能追溯到源头,而且你能证明这一点。可靠性不是让 AI 听起来值得信赖,而是让信任变得可验证。这是两个不同的问题,只有其中一个值得去解决。
结论很直白:不要等一个聪明到值得把你的数字交给它的模型,因为信任本来就不是从模型那里来的。信任来自底层那一层。先把它建好,财务领域的 AI 才会从一个令人印象深刻的演示,变成一个你愿意在董事会会议上押上信誉的东西。
如果你想看看可验证、可追溯到源头的数字,在真实总账上运行的样子,请预约演示,并带上一个你真的会问你的团队的问题。
本专题内容
- 01
EPM、CPM、BPM、xP&A:这些缩写承诺了什么,又没能保证什么
EPM、CPM、BPM 描述的是一套平台做什么:计划、合并、报告。它们没有一个能说明你输出的数字是否可信。
- 02
从记账员到战略伙伴:财务团队被卡住的真正原因
财务从记账员向战略伙伴的转变,不是技能缺口问题,而是信任问题:每个数字在被使用前都要重新核对一遍。
- 03
AI 时代的财务建模最佳实践(不只是表格卫生)
输入用颜色标记、不写死数字,是旧规则。当 AI 开始读取并重新计算你的模型之后,你还需要一套新的规则。
- 04
FP&A 软件到底要花多少钱:一份公开的 ROI 与回本周期指南
大多数 FP&A ROI 指南都藏在一张表单后面,这一篇没有。真正的成本结构,以及为什么回本快慢取决于信任,而不是功能。
- 05
财务领域的 AI 锁定:为什么一层已对账的架构胜过一体化套件
FP&A 套件让你在其 AI 发挥作用之前先把数据搬进去。一层已对账的架构则能让数字保持受治理的状态,同时让智能保持可移植。
- 06
为什么 OLAP 多维立方体是财务 AI 的错误基础
立方体在切片切块上速度飞快,但它存储的是预先聚合的数字,没有回溯到总账的路径。查询立方体的 AI 无法追溯任何一个数字的来源。
- 07
为什么你的 AI 会算错数字
LLM 把数字当作文本来读并进行模式匹配,而不是真正计算。这背后是分词问题,而唯一站得住脚的解决方案是什么。
- 08
95% 问题:MIT 的生成式 AI 鸿沟对财务意味着什么
MIT 发现 95% 的生成式 AI 试点项目没有产生任何回报。在财务领域,罪魁祸首不是模型,而是未经核对的数据。以下是解决方案。
- 09
没有计算层的金融 RAG 是不够的
检索能告诉你一个数字从哪里来,却无法告诉你算式对不对。为什么金融 AI 会卡在 85% 到 92% 的准确率,以及如何突破这道天花板。
- 10
先建立信任,再实现自动化:2026 年 CFO 的 AI 财务清单
87% 的 CFO 认为 AI 至关重要。看到真实投资回报的却少得多。差距不在雄心,而在信任。这是在你实现自动化之前,先弥合这一差距的清单。
- 11
为什么电子表格是财务 AI 的错误基础(以及应该用什么取代它)
把 AI 指向 Excel,会继承电子表格中所有隐蔽的错误。正确的做法是用一个 AI 可查询的已对账建模层,而不是一张 AI 可编辑的表格。
- 12
可复现的设计:如何像证明公式一样证明一个 AI 数字
董事会和审计师现在要求 AI 生成的数字能够完全重现并可追溯到源头。只有 LLM 之下的确定性计算层才能做到这一点。
- 13
MCP 对财务来说还不够:为什么把 LLM 接入 ERP 之后算数依然会出错
MCP 让 AI 获得受治理的实时 ERP 数据访问权限,但它不能提供一个已对账的模型,也不能提供确定性计算引擎,所以算术结果依然只是猜测。
- 14
单一真实来源与足够多版本真相之争:CFO 在 AI 就绪数字问题上容易搞错什么
Gartner 说不要再执着于单一版本的真相。对于需要计算并引用数字的 AI 来说,这个建议对了一半,而人们忽略的另一半却很危险。
- 15
诚实解读基准测试:为什么 82% 的 LLM 准确率在金融领域是不及格
顶尖模型在财务电子表格上的准确率仅约 82%,在金融问答上约 90%。这听起来还不错,直到你算清楚这些错误的代价。
- 16
每一个 AI 财务技术栈都需要的四层架构
连接、对账、确定性计算、检索。跳过中间两层,你的 AI 就会给出没有任何控制人愿意签字确认的数字。原因如下。