跳到正文
新功能:向 Rexfin 分析师智能体询问你的模型,每个数字都附带出处
· 阅读约 8 分钟

2026 年,哪些 AI 模型的财务数据值得信任?批判性地看待排行榜

幻觉率如今从不到 2% 到超过 25% 不等,取决于模型和任务。这篇文章解释了为什么这个头条数字,并不能告诉你你的 AI 在你的财务数据上是否安全。

幻觉率如今从不到 2% 到超过 25% 不等,取决于模型和任务。这篇文章解释了为什么这个头条数字,并不能告诉你你的 AI 在你的财务数据上是否安全。

作者 The Rexfin team

上个季度,一位财务总监转发给我们一份供应商的宣传材料。头条写着:“我们的模型幻觉率只有 1.8%。”言下之意是:选对模型,数字问题就消失了。事实并非如此。那个 1.8% 来自一个文档摘要基准测试,测的是干净的散文文本,由自动化评审打分。它几乎无法说明,当源文件是一份来自两本互不一致的总账、拼凑出来的合并试算表时,同一个模型能否算对你 Q3 的毛利率。

2026 年的幻觉率是真实的、公开的、有用的,也常常被误读。如果你要选择一款 AI 工具把数字放到董事会面前,你需要知道这些排行榜到底测了什么,没测什么,以及两者之间的鸿沟恰恰是财务错误滋生的地方。

这些数字到底说明了什么

以 Vectara 的幻觉评测排行榜为例,这是被引用最多的公开基准。截至最近一次更新,顶尖模型聚集得相当紧密,少数几个低于 2%。来自 OpenAI、Google 和 Anthropic 的几款主流模型在原始测试中处于个位数低端。所有被评测模型的分布,从最好到最差,跨度从不到 2% 一直到超过 20%。

宣传材料里跳过的部分是这样的:Vectara 测的是一件很窄的事情,即一个模型在总结一份手头短文档时,引入无依据说法的频率。这是一个针对文本的忠实度测试,不是一个算术测试,不是多文档核对测试,也不是测试模型能否在不错位列的情况下读懂一张财务表格。

当 Vectara 在 2025 年末用更难的输入重建这个基准时,包括长达约 32,000 个 token 的更长文档,以及涵盖财务在内的更广泛领域,那些在个位数低端得分的同一批推理模型,分数跳到了 10% 以上。同样的模型,更难、更贴近现实的任务,错误率翻了几番。这一个事实本身,就应该重置你解读任何排行榜的方式:分数是测试本身的属性,不只是模型的属性。

为什么排行榜的分数不能照搬到你的账本上

有三件事把一份基准测试文档和你真实的财务数据区分开来,而每一件都会以头条数字从未捕捉到的方式拖累模型表现。

第一,你的数据是杂乱且多源的。摘要基准给模型的是一份干净的文档。而你真正的问题,比如“上个季度调整后 EBITDA 是多少”,涉及的是一本总账、几笔存在于电子表格里的手工调整,或许还有一个滞后过账的子账本。模型必须先在所有这些来源里找到正确的数字,才能进行任何计算。这里的检索错误在输出中看起来和推理错误一模一样,而没有任何文档忠实度分数能预测它们。

第二,你的数据里有表格和 PDF。当源文件是一份扫描件或图像而不是干净的文本时,模型在财务数字上的准确性会大幅下降。一个能忠实总结一篇文章的模型,依然可能读错资产负债表里的一个单元格,因为列标题往上错了两行,而模型只是猜了个对齐方式。

第三,也是最重要的一点:财务是算术,而算术恰恰不是这些基准所评分的对象。一个模型可能完美地检索出收入和销货成本,然后却把毛利率算成了差值而不是比率,或者算反了,或者套用了去年的数字。这一切在忠实度排行榜上都不会被记作“幻觉”。它的说法是有依据的,只是算错了。我们之前在《AI 把数字读对了,把数学算错了》一文中写过这类隐藏的错误,而这恰恰是排行榜完全看不见的那一类。

模型无关的立场

那么财务数据到底该信任哪个模型?对一位 CFO 来说,诚实的答案是:这个问题本身问错了方向。

如果你的准确性取决于这个季度选了哪个模型,你就搭建了一套脆弱的系统。模型一直在变化。二月的排行榜领跑者,到八月很少还是领跑者。供应商不断发布新版本,弃用旧版本,并悄悄重新调整行为。把报告的完整性押在某个具体模型上,意味着每次版本号一跳,你就得重新验证整个财务工作流,而大多数团队并不会这么做,这就意味着他们一直在跑一个从未真正测试过的模型。

有一个更稳固的立场。让模型成为可以变化的那个部分,把那些绝不能变的东西放在模型之下,放到任何模型都碰不到的地方。

这意味着有一层机制在任何 AI 看到数据之前就完成核对,让每一个数字都能追溯回总账。这意味着把每一次计算,包括利润率、增长率、方差、比率,都交给一个确定性引擎去处理,而不是让 LLM 自己做算术。模型决定要计算什么,引擎则以每次都相同的方式来计算。而且这意味着每一个答案都带着一条追溯回源头的路径,让一位财务总监能够像证明一个公式那样证明一个数字,而不是靠信任照单全收。

当这一层存在时,模型的幻觉率就不再是一个承重的数字。一个较弱的模型只会产出更笨拙的文字,而不会产出错误的毛利率,因为它从来就没做过那道算术题。你可以在周二把 GPT 换成 Gemini 再换成 Claude,而你报出的数字不会因此变化。这就是模型无关真正带来的东西:对那个你无法控制的变量的免疫力。

如何看待下一份宣传材料

当供应商用一个幻觉率作为卖点时,问三个问题。这个数字是在什么任务上测出来的,摘要还是算术?用的是什么数据,干净的文本还是杂乱的多源表格?当底层模型下个季度变化时,你的数字会发生什么?如果对最后一个问题的诚实答案是“我们得把一切都重新测一遍”,那说明准确性活在模型里,而模型是流沙。

这些排行榜值得一读。它们是一个真实的信号,说明模型正在进步,而且有些模型确实在保持有据可依这件事上明显优于其他模型。只是不要把在别人文档上测出的忠实度分数,误当作对你自己账本的保证。真正值得信赖的数字,不是出自最好的模型,而是在模型看到它之前就已经核对过、之后由某个确定性的东西计算出来的那个。

如果你想看看模型无关的准确性在你自己的财务数据上,而不是某个基准测试上,是什么样子,预约演示,带上一个你从未信任过任何 AI 能算对的数字。如果想了解为什么即便是很强的基准分数,对于无人监督的财务工作来说依然是不及格的论证,可以延伸阅读董事会报告数字核验清单,以及 AI 财务数据幻觉分支

所属专题 财务数据中的 AI 幻觉:阻止 AI 凭空捏造数字

继续阅读

预约演示

亲眼看到您的数字对得上账。

预约一场 30 分钟的演示。带上一个您总是无法快速回答的问题,我们将基于真实财务数据现场为您建模。