为什么电子表格是财务 AI 的错误基础(以及应该用什么取代它)
把 AI 指向 Excel,会继承电子表格中所有隐蔽的错误。正确的做法是用一个 AI 可查询的已对账建模层,而不是一张 AI 可编辑的表格。
作者 The Rexfin team
一篇于 2024 年发表、被广泛引用的综述,回顾了 35 年的电子表格研究,给出了 94% 这个数字:在数十年研究中被检视过的商业电子表格里,有这么大比例至少包含一个错误。另有研究发现,中大型企业用于实际决策的模型中,大约有一半存在实质性缺陷。这些都不是罕见的边缘情况,而是多数财务团队目前用来做预算、预测、报价定价、向董事会汇报的基础材料。
现在想象一个 AI 助手坐在这一切之上。它读取表格,回写表格,并用通俗语言回答关于表格的问题。这套说辞是,电子表格终于能“开口说话”了。但现实是,AI 继承了每一个断掉的引用、每一个有人忘记删掉的硬编码覆盖、每一个标注着 2024 却实际取的是 2023 数据的单元格。它没有清理这个基础,而是在一个已经出现裂痕的基础上建得更快了。
电子表格从来就不是真实来源
电子表格给人一种权威的错觉,因为它是财务总监每天盯着看的东西。但权威性和可靠性是两回事。表格把输入、计算和呈现全都混在同样的单元格里,没有强制区分哪一个数字来自总账、哪一个数字是有人在截止日期前晚上 11 点手动敲进去覆盖的。它没有天生的血缘信息。问“这个数字是哪来的”,诚实的答案往往是“往上翻,相信公式栏”。
当一张表格由某个人负责时,这种模糊性是可以承受的。人会积累局部知识:哪些标签页已经过时了,哪个单元格不能动,哪个总数才是“真正的那个”。而模型没有这种部落式的经验知识。它对待一个被污染的单元格,和一个干净的单元格同样自信。所以 AI 接入 Excel 的第一个问题,并不是 AI 不够聪明,而是 AI 忠实地读取着一份从一开始就不是为充当记录系统而设计的文档。
基准测试实际显示了什么
现在已经有确凿的证据,说明语言模型具体是如何处理财务电子表格的。2026 年初发布的 FinSheet-Bench,基于模拟真实私募股权基金结构的合成投资组合数据构建了一个基准测试,测试了来自 OpenAI、谷歌和 Anthropic 的十种配置,在真实布局下的查找和数值推理能力。
最好的成绩大约是 82% 的准确率,也就是说,即便是排名最靠前的模型,平均每六个问题就会答错一个。而且复杂度一提高,情况就变得更糟:在数据集中最大的那份文件上,所有模型的平均准确率跌到了 50% 以下。论文自己的结论很直白,没有任何一个独立模型的错误率低到可以在专业财务场景中不受监督地使用。
以 CFO 的视角来理解这个数字。18% 的错误率不是一个可以用免责声明糊弄过去的小误差。如果一份预测中有六分之一的数字是错的,而你无法分辨是哪一个,那么这份预测对任何有实质后果的决策都是不能用的。这个准确率高到足以看起来是对的,又低到足以变得危险,是最糟糕的组合。
再看看这些错误是从哪里来的。有些是检索失败,模型在有基金分隔符和多行表头的杂乱布局上抓错了单元格;有些是推理失败,它自己做算术却算错了。两者都会悄无声息地失败。输出的是一个自信的数字,没有任何标记,没有来源,也无法重放它是怎么得出的。
为什么让 AI 回写会让情况更糟
读取一张有问题的表格是一种风险,而让 AI 回写这张表格,则完全是另一个量级的风险。一旦助手开始编辑单元格,它就可能把一个错误沿着关联标签页传播出去,覆盖掉一个原本有正当理由存在的手动调整,或者引入一个看起来合理、实则悄悄出错的公式。你现在有的,是一张没有任何一个人完整撰写过、正在被自动编辑不断改变、并被送进董事会材料中的电子表格。
这里还有一个更深层的结构性问题。LLM 是一个概率性系统,而财务计算本应是确定性的,即相同的输入永远产生相同的答案。当你让模型既决定要计算什么,又在一张自由格式的表格里执行计算时,你就把一个非确定性的引擎,接进了公司业务中在法律和运营上都必须可复现的那一部分。这不是一次自动化升级,而是一场等待被审计发现的控制失效。
应该用什么取代表格
解决方法不是更好的提示词,也不是更谨慎的模型,而是把真实来源整个搬出这张表格。你想要的不是一个能编辑电子表格的 AI,而是一个能查询其底层已对账模型的 AI。
具体来说,这需要一个能做到三件电子表格永远做不到的事情的层。第一,它直接接入数字实际存在的地方,QuickBooks、Xero、NetSuite、Sage、SAP、Oracle、数据仓库,或上传的对账单,而不是继承一次手动导出。第二,它把这些数据源对账汇入一个与总账对平的模型,这样收入就只有一个数字,而不是七个标签页里七个略有出入的版本。第三,它在一个确定性引擎中完成运算,而不是在模型的“脑子”里。LLM 可以推理、检索、解释,但不允许自己编造运算过程。
这种架构改变了“答案”本身的含义。当 AI 报告一个数字时,这个数字是从已对账模型中检索出来的,由确定性引擎计算得出,并且能追溯回源头交易。你可以重放它,可以向审计师展示这条路径。基准测试暴露出的准确率问题不是被打了个补丁,而是被彻底绕开了,因为负责计数的已经不再是模型本身。
这也是情景分析终于找到正确归宿的地方。CFO 确实需要多种视角:基础情形、下行情形、招聘计划的假设情形。错误做法是让这些变体在底层数据中以互相矛盾的数字形式存在。它们应该作为叠加在一个已对账基础之上的情景存在,每一个都明确说明改变了哪些假设。一套事实,多种建模出的未来,而不是多张各自宣称自己才是事实的表格。
结论
Excel 是人类思考的绝佳载体,却是机器据以计算的糟糕记录系统,而关于错误率的数据几十年来一直很清楚。给电子表格挂上 AI 并不能解决这个问题,只会把它放大。真正从财务 AI 中获得可观、站得住脚价值的团队,不是那些拥有最聪明助手的团队,而是那些不再把表格当作真实来源、并在其下方铺设了一个已对账、确定性建模层的团队。
如果你正在评估财务 AI,该问供应商的问题很简单:当你的工具给我一个数字时,你能不能准确告诉我它是哪来的,并像证明一个公式那样证明这个运算过程?Rexfin 的设计目标就是能给出肯定的答案。想看看这在你自己的数据上是什么样子,欢迎预约演示。
想了解更全面的背景,可以从面向 AI 的可靠财务建模层这篇支柱文章读起。在此基础上,MCP 用于财务还不够解释了为什么把 LLM 接到 ERP 上仍然算不对数,而单一真实来源与足够多版本真相之争则说明了情景变体真正应该归属的位置。
所属专题 AI 在触碰你的数字之前需要的可靠性层