95% 问题:MIT 的生成式 AI 鸿沟对财务意味着什么
MIT 发现 95% 的生成式 AI 试点项目没有产生任何回报。在财务领域,罪魁祸首不是模型,而是未经核对的数据。以下是解决方案。
作者 The Rexfin team
近一年来,有一个数字在董事会材料中反复出现:95% 的企业生成式 AI 试点项目没有产生可衡量的回报。这个数据来自 MIT NANDA 计划一份 2025 年的报告,名为《生成式 AI 鸿沟:商业中的 AI 现状》。研究人员考察了数百个部署案例,发现绝大多数从未真正撬动损益表中的任何一行,只有极少数做到了。
这个统计数字常被用来为谨慎态度辩护,或者被当作笑谈。两者都错过了重点。真正有意思的问题不是为什么 95% 失败了,而是另外那 5% 做对了什么。而在财务领域,答案让人有些不舒服,因为它几乎与你选了哪个模型无关。
这道鸿沟不在于模型质量
当一个财务团队的 AI 试点项目失败时,复盘往往会归咎于错误的原因。“模型不够聪明。”“出现了幻觉。”“我们需要 GPT-5,而不是 GPT-4。”于是团队等待下一个版本发布,在更好的模型上重跑同一个试点,得到同样令人失望的结果。模型从来都不是瓶颈所在。
MIT 的框架指出,这道鸿沟存在于工具和工作流之间。通用型聊天助手很容易被采纳,因为它们容错性高,写封邮件、总结一份文档,即便有点偏差也无伤大雅。但那些真正要承担实际运营工作、其输出直接影响决策的系统,却常常卡住。它们无法保留上下文,不能融入团队真实的工作方式,更关键的是,没有人能信任其输出到可以直接采信、而不必逐项手动复核的程度。到了这一步,AI 到底节省了什么?
在财务领域,信任问题比几乎任何其他领域都更尖锐。一份“大体正确”的摘要放在会议纪要里没问题;一个“大体正确”的毛利率,放进董事会材料里就是一个错误的数字,而且署名是你的。
财务领域失败的原因不同
在财务之外,失败的常见模式是工作流摩擦。而在财务内部,底下还藏着一个更具体的障碍:AI 所依据的数据本身就从未真正可信过。
不妨走一遍实际发生的过程。团队把某个 AI 工具指向 QuickBooks 或 NetSuite 的数据,或者上传几份导出文件,然后开始提问。会计系统说的是一回事,CRM 对同一批客户又说了另一回事。上个月的董事会材料里,营收数字还有第三个版本,因为有人在一份从未回写到总账的电子表格里做了手动调整。AI 对这一切一无所知,它自信地对这团乱局取平均,然后给出一个对不上任何东西的答案。
这不是模型的缺陷,而是模型忠实继承下来的数据缺陷。FP&A 团队对这种痛苦再熟悉不过了,一次又一次的调查发现,分析师每周有相当大一部分时间,往往接近三分之一到近一半,都花在了任何分析开始之前的数据收集和核对上。正是那种手动核对的工作,才让一个数字变得可信。省略这一步,AI 就会变得又快又错,而不是又慢又对。
所以,财务领域实现 AI 投资回报的真正前提,并不是更好的模型,而是一个经过核对的单一数据源:一个数字真正能与总账对齐的财务模型,在 AI 接触它之前就已经建立好。这正是为什么可信赖的财务 AI 需要底层的核对模型这一问题的核心所在。
成功的那 5% 有什么共同点
剥去炒作,那些真正奏效的部署项目有一个平淡无奇的共同特征:它们是有依据的。AI 不是在一堆文档上自由联想,而是从一个明确的、受治理的数据源中检索,使用者也能清楚看到每个答案的来源。
这就是全部关键所在。有依据的检索,把一个听起来合理的系统变成了一个真正站得住脚的系统。当财务主管可以点击一个数字并追溯到源交易时,AI 就不再是负担,而是杠杆。当他们做不到这一点时,每一项输出都需要人工审计,生产力方面的收益也随之崩塌:你增加了一个步骤,而不是省掉了一个步骤。
这里还有一个相关的陷阱值得指出。即便有了良好的依据,让语言模型去计算答案仍然会重新引入误差,因为大语言模型在算术上确实很不擅长(具体机理我们在为什么 AI 会算错财务数字中有详细展开)。正确的做法是让 AI 负责检索和解读,而把真正的计算交给一个确定性引擎。检索为输入提供依据,引擎则保证计算的正确性。二者缺一不可。
按顺序,如何跻身那 5%
如果你是一位 CFO,正在决定今年的 AI 预算会不会重演去年的失望,那么顺序比工具选择更重要。大致如下:
- 先做核对。 建立一个模型,让营收、利润和现金在所有已连接的数据源之间都能与总账对齐。任何你不敢签字确认的数字,都不值得在其上运行 AI 步骤。
- 让 AI 以该模型为依据,而不是以原始导出数据或一堆文档为依据。AI 应该从已核对的数据源中检索,每一个数字都能追溯回它的出处。
- 把计算交给确定性层。 让模型来决定要计算什么,让一个真正的引擎来完成计算,这样同一个问题每次都会得到同一个答案。
- 然后再自动化。 一旦你信任了这些数字以及得出它们的路径,再扩展到报表、差异分析和情景模拟。自动化是信任的回报,而不是信任的替代品。
大多数失败的试点项目把这个顺序反了过来。它们先做自动化,发现数字靠不住,然后悄悄关停。那 95% 并不是对 AI 的判决,而是对从错误的地方起步的判决。
结论
MIT 并没有证明 AI 在财务领域行不通,它证明的是,建立在未经核对数据之上的 AI 行不通,而这一点任何一位财务主管本来都能免费告诉你。模型如今已是一种商品化的东西,而其底层那个经过核对、可追溯的财务层,才是真正困难、也真正决定你落在鸿沟哪一侧的部分。
如果你希望下一个 AI 项目跻身那 5%,那第一步、也是最不起眼的一步,就是把数字修正好。这正是 Rexfin 要做的事。预约演示,我们会展示当每一个数字都能追溯回源头时,AI 是什么样子。
所属专题 AI 在触碰你的数字之前需要的可靠性层