跳到正文
新功能:向 Rexfin 分析师智能体询问你的模型,每个数字都附带出处
← 学习

学习

财务数据中的 AI 幻觉:阻止 AI 凭空捏造数字

AI 会捏造出看起来正确、实则错误的财务数字。本文呈现证据、真实世界的损害,以及唯一真正站得住脚的防线:一个对账后的模型。

一位财务管控人向 AI 助手询问上季度的毛利率。它两秒内给出答案:61.4%。数字干净利落,语气自信,精确到小数点后一位。唯一的问题是没人能找到 61.4% 是从哪来的。总账上写的是 58.9%。这个模型不是提取了错误的单元格,它凭空产出了一个从未存在过的数字。

这就是幻觉,而在财务领域,这不是一个怪癖,而是它的失效模式。

令人不安的地方在于,这个捏造出的数字看起来多么合理。一个幻觉出的营收数字不会带着红色警示登场,它会与其他正确数字一起,出现在同样平静的语句中,往往还嵌在一张整洁的表格里,甚至引用了一个说法略有出入的来源。这个模型并不是在人类意义上的“说谎”,它只是在做它被设计来做的事:预测最可能出现的下一个词元。“最可能”不等于“真实”。而当讨论的对象是你的损益表时,这道鸿沟就是全部问题所在。

数字场景下的“幻觉”究竟意味着什么

人们一听到幻觉,就会联想到 LLM 编造一个不存在的法律案例或引用来源。但在财务数据中,这种失效更安静,也更危险,因为数字自带一种不该有的精确感。

三件事会出错,而且会相互叠加:

  • 捏造。 模型生成一个在任何来源中都不存在的数字。它是插值出来的,是模式匹配出的一个“感觉上”像是一家同类公司毛利率的数字。
  • 归属错误。 数字本身是真实的,但模型把它安到了错误的期间、实体或科目上。第二季度被标成了第三季度,某个子公司的现金被报告成了集团现金。
  • 算术错误。 输入是对的,模型算出的总数却是错的,因为大语言模型将数字当作文本进行分词,靠模式匹配来“算”算术,而不是真正计算。我们在为什么你的 AI 会算错财务数学一文中深入探讨了这一机制。

还有一种特定于表格的失效。财务数据存在于网格之中。围绕表格推理的研究,包括表格问答忠实度评估的 FAITH 系列工作,反复揭示出同一个弱点:模型会搞混哪一行对应哪一列,在存在合并表头、脚注和小计的密集报表中尤为明显。资产负债表恰恰是这种最容易让模型出错的对象。模型明明读的是正确的文档,却依然返回了错误的单元格。

证据已经不再单薄

一段时间以来,你还可以把这归为早期阶段的噪音。现在不行了。

最强大的通用模型在基准任务上的幻觉率已降到个位数的低段,但有两个事实破坏了这份安心。第一,“低”不等于零,一份包含一百个数字的董事会材料中出现 2% 的错误率,意味着你会定期发出错误的数字。第二,一旦脱离干净的基准测试条件,进入杂乱的真实财务文档和更长的推理链条,错误率会大幅攀升。某些侧重推理的模型在某些任务上的幻觉甚至不是更少,而是更多,因为更多的推理步骤意味着更多的漂移机会。

现实运营情况与实验室结果相符。一项又一项针对数据和分析团队的调查发现,绝大多数团队都至少经历过一次 AI 工具产出不准确或捏造数据的情况。当输入数据未经对账时,模型没有可以锚定的真实基准,于是就编造出一个看似合理的答案。

而这些失误也并非纸上谈兵。在财务从业者之间流传的警示故事往往如出一辙:一个幻觉出的指标一路蒙混过尽职调查,直到有人核查了来源;一份基于模型捏造数字构建的自信预测;一个对不上总账的董事会数字。我们在那笔一千五百万美元的教训一文中讲述了其中一个案例:一个混淆的数字,在一笔融资交割前几天浮出水面。模式始终如一:数字看起来是对的,所以没人核查,直到风险迫使人们不得不核查。

为什么你惯用的防线拦不住它

如果幻觉明显是错的,这本不该成为问题,你会发现垃圾数据并把它剔除。它们之所以危险,恰恰是因为能通过肉眼检查。

人们常用的三种防线,以及它们各自为何单独不足:

“我们会审核输出结果。” 审核在错误可见时有效。一个夹在四十个正确数字中的幻觉出的 61.4% 并不可见。你得手动重新推导每一个数字,这就违背了使用 AI 的初衷。抽查能发现明显的错误,却漏掉了看似合理的错误。而看似合理的那些,恰恰是代价最高的。

“我们用了检索增强,所以是基于我们的文档的。” 检索增强确实有帮助,但并不足够。找到正确的文档,只能告诉你一个数字应该从哪里来,并不能保证模型读取了正确的单元格、将其归属到了正确的期间,或者之后正确地完成了计算。朴素的检索增强生成(RAG)方案会在一个远远达不到财务需求的准确度天花板前停滞不前,而且它们最终仍会把最后的计算交给那个不擅长计算的模型。这正是我们在RAG 对财务来说还不够一文中拆解的问题。

“更新的模型幻觉更少。” 在基准测试条件下,平均而言,缓慢地,确实如此。但你运营的不是平均数,而是那个具体的、模型混淆了两个实体的季末结账。更低的基础错误率是件好事,但它不是一项控制措施。你无法在给董事会的脚注里写上“这个模型通常是对的”。

坦率的总结是:提示词工程、审核和模型升级都能降低幻觉数字出现的频率。但没有一样能给你 CFO 真正需要的东西,也就是对任意一个数字,都能确知它是正确的,并证明它是从哪来的。

唯一站得住脚的防线:让 AI 扎根于一个对账后的模型

这里是关键的转变。不要再试图让语言模型在数字上变得可信,它做不到,因为它是算术和归属这项工作的错误工具。相反,在它下面铺设一层可信的基础,让模型在这个基础上工作。

这一层就是一个对账后的财务模型:一个与总账相符的真实来源。不是一堆让 AI 翻找的文档,而是一个单一的、结构化的、对账后的模型,其中营收就等于营收,小计能加总,每一个数字都绑定着它的源交易。

有了这一层,AI 的行为方式会发生三点变化:

  1. 它检索,而不是捏造。 当“上季度毛利率是多少”这个问题的答案是对账模型中的一个具体数值时,AI 的工作就是把它取出来,而不是生成一个“像毛利率”的东西。你已经消除了编造的空间。如果模型中没有这个数字,诚实的答案就是“不可用”,而不是一个猜测。
  2. 它以确定性方式计算。 毛利率、增长率、现金跑道、情景计算,没有一样应该经过词元预测器。一个确定性引擎对已验证的输入进行算术运算,每次都返回相同的答案。模型负责编排和解释,而不负责计算。
  3. 每个数字都能追溯到来源。 因为每个数字都绑定着它所来自的交易和报表,你可以点击任何输出结果,查看其来源脉络。这正是让答案在审计师、投资人或董事会面前站得住脚的原因。我们在为 AI 财务构建审计轨迹一文中,将可追溯性视为一项首要要求。

这正是 Rexfin 所构建的东西。它连接你的会计和财务数据平台,或者上传的报表,将一切对账整合为一个与总账相符的模型,然后将这个模型开放给 AI,用于检索、确定性计算、假设情景分析,以及可追溯到来源的洞见。AI 得以发挥作用,却无权凭空编造你的数字。

好的标准具体是什么样子

如果你正在评估任何一款用于财务的 AI,评判标准很容易说清楚,但很难蒙混过关。对它报告的每一个数字,你都应该能对以下所有问题回答“是”:

  • 这个数字是否存在于一个与总账相符的对账模型中,还是模型凭空产出的?
  • 计算是由确定性引擎完成的,还是由语言模型完成的?
  • 我能否点击这个数字,看到源文档和计算路径?
  • 如果数据不存在,系统是会如实说明,还是会猜测?

一个无法达到这个标准的工具,并不是在报告你的数字,而是在用出色的语言组织能力临场发挥。关于这整套体系为何必须存在的更深层论证,见我们的专题AI 财务可靠性层

结论

财务数据中的幻觉不是一个下一代模型发布就能悄悄修复的漏洞。它是要求一个文本预测系统同时充当计算器和记录系统所带来的结构性后果。你无法靠更加信任模型来解决这个问题,而应该给模型无从捏造的东西:让它扎根于一个对账后的真实来源,把计算交给一个确定性引擎,并让每个数字都绑定它的来源。

那个怀疑性的问题(能否信任 AI 处理你的财务数据?)有一个精确的答案:只能信任到你能追溯它所告诉你的内容的那个程度。除此之外的一切,都只是一个自信的猜测。

如果你想看看能对上总账、并能追溯到来源的数字,预约演示,带上一个你通常需要反复核实的数字。

本专题内容

动态循环演示:从一份申报文件中提取数字,并将每个数字追溯到其引用来源。

预约演示

亲眼看到您的数字对得上账。

预约一场 30 分钟的演示。带上一个您总是无法快速回答的问题,我们将基于真实财务数据现场为您建模。