跳到正文
新功能:向 Rexfin 分析师智能体询问你的模型,每个数字都附带出处
· 阅读约 7 分钟

AI 数字读对了,数学算错了:一类隐藏的财务幻觉

许多 AI 财务错误并非检索不良。模型拿到了正确的数字,却把一个比率算反了,或混淆了绝对变化和百分比变化。原因何在,又该如何修复。

作者 The Rexfin team

一位财务负责人向 AI 助手询问两个季度之间营业利润率的变化。模型正确地引用了两个数字:上季度 18.2%,本季度 14.9%。两个数字都与报表相符。然后它把变化报告为“下降了 3.3%”。这是错的。利润率下降了 3.3 个百分点,相当于 18%的相对降幅。这是两个不同的事实,其中一个是错的,而错的那个,恰恰是进入董事会材料的那个。

这是一类几乎没有人筛查的错误。当团队担心 AI 编造内容时,他们脑海中浮现的是虚构的收入或捏造的引用。这些确实会发生,而且很容易被发现,因为那个数字在来源中根本不存在。而更隐蔽的失效方式不同:每一个输入都是正确的,答案却是错的,输出中没有任何看起来可疑的地方。模型检索得很好,只是推理得很糟。

输入正确,算术出错

近期关于财务问答的基准测试一再得出同样的结论。在一项对模型失误的分析中,计算错误和四舍五入或精度问题各占全部错误答案的约三分之一,合计超过总数的三分之二(arXiv,类 FinanceQA 评估)。另一项关于多模态模型在财务任务上表现的研究,把大约 42%的失败具体归因于计算和推理错误,而非检索问题(arXiv,FAITH 基准)。这个模式是一致的:模型找到了正确的单元格,却在如何处理它们上出了差错。

在财务工作中,有几种错误形态反复出现:

  • 绝对变化与百分比变化混淆。 把百分点的变动误认为相对的百分比变化,正如上文的利润率例子。
  • 比率反转。 问的是负债权益比,答的却是权益负债比,或是在覆盖率比率上把分子和分母颠倒了。两个数字都是真实的,只是关系反了。
  • 现金流符号出错。 把现金的使用当成来源,或是把一笔融资流入与一笔经营流出相抵消,导致自由现金流的方向被反转。
  • 单位和量级漂移。 把千和百万混用,或是把一个以基点表示的数字带入一个预期为小数的计算中。

以上这些都不会触发检索检查。源数字都存在且准确。这正是这类错误危险的地方。你的本能,以及审核者的本能,是去核实 AI 拿到的数字对不对。它们是对的。缺陷在更深一层。

语言模型为什么会这样

理解其中的机制,而不是把它当成随机的不稳定,会有帮助。语言模型不做计算。它根据文本中的统计模式预测下一个 token。数字是按语言而非数学来分词的,一个单一数值常常被拆分成多个 token,因此模型从未真正对表达式的数学结构进行运算(arXiv,分词与算术)。它也学到了“从 18.2 到 14.9 的变化”后面经常跟着“下降了 3.3%”这样的措辞,因为这种说法在文本中很常见,即便它并不精确。模型复现的是人们谈论这项计算的方式,而不是实际执行这项计算。

它没有必须遵守的草稿纸,没有要求在各步骤之间保留的中间状态,也没有内部检查来确认一个比率算出来的方向是否正确。研究者已经测量出这有多脆弱:问题表述方式上的微小变化,能让准确率在算术推理基准测试中来回摆动几十个百分点,这一稳健性差距在多项基准测试中被反复记录下来。这样脆弱的过程,用来起草一句话没问题。用来做契约计算就不行。

公平地说一下这种担忧的边界:前沿模型已经进步很多,在一些精心策划的财务幻觉基准测试上,最强的模型如今能达到 90%以上的准确率。但当输出会影响决策、且失误对快速浏览而言不可见时,“90%的时候数学是对的”描述的是一个问题,而不是一种安慰。一个你看不见的 9%错误率,比一个你能看见的 20%错误率更糟糕。

修复方法是结构性的,而不是更好的提示词

你无法可靠地靠提示词摆脱这个问题。要求模型“展示计算过程”或“再检查一遍数学”,能降低出错率,但无法消除它,因为负责检查的正是产生错误的同一个有缺陷的机制。要彻底消除这整类算术错误,唯一的办法是根本不再让语言模型去做算术。

这正是 Rexfin 背后的设计原则。我们把当前工具混为一谈的两项工作拆分开来。语言模型擅长理解意图、找到相关数字、用通俗语言解释结果。所以我们让它恰好只做这些,不多做别的。实际的运算,每一个比率、每一次同比环比变化、每一个现金流符号,都通过一个确定性计算引擎执行,每次都以相同的方式执行既定公式。对引擎而言,百分点和百分比变化是两种不同的运算,而不是两种可能被混淆的措辞。一个比率只定义一次,分子和分母固定,因此不可能被反转。

它之所以有效,是因为这些数字一开始就不是来自自由文本。Rexfin 连接到你的会计和财务数据来源,或连接到上传的报表,构建一个与账本核对平账的单一已核对财务模型。AI 从这个单一真相来源中检索,引擎负责计算,每一项输出都能追溯到产生它的数字和公式。当一个数字出现在你面前时,你既能看到它从哪里来,也能看到它是如何推导出来的。

该怎么做

不要再只通过检查源数字是否正确来验证 AI 的财务输出。它们通常是对的。这道检查会通过,而一个被反转的比率或一个百分点与百分比混淆的错误,却会从下面悄悄溜过。如果你想要一个实用的筛查工具,我们的董事会材料验证清单列出了应该关注的要点;如果你正在评估某款工具,构建一个已知答案计算的黄金数据集,会在这类失误触达客户之前把它暴露出来。

更宏观的一点是:一款把数学交给模型的工具,是在要求你信任一个从来就不是为算术而设计的过程。任何 AI 财务供应商,值得问的一个简单问题是:*计算实际发生在哪里?*如果答案是“在语言模型内部”,你已经知道自己承担的是什么风险。如果你想看看当答案是“一个与你的账本核对平账的确定性引擎”时会是什么样子,预约演示

所属专题 财务数据中的 AI 幻觉:阻止 AI 凭空捏造数字

继续阅读

预约演示

亲眼看到您的数字对得上账。

预约一场 30 分钟的演示。带上一个您总是无法快速回答的问题,我们将基于真实财务数据现场为您建模。