跳到正文
新功能:向 Rexfin 分析师智能体询问你的模型,每个数字都附带出处
· 阅读约 9 分钟

诚实解读基准测试:为什么 82% 的 LLM 准确率在金融领域是不及格

顶尖模型在财务电子表格上的准确率仅约 82%,在金融问答上约 90%。这听起来还不错,直到你算清楚这些错误的代价。

顶尖模型在财务电子表格上的准确率仅约 82%,在金融问答上约 90%。这听起来还不错,直到你算清楚这些错误的代价。

作者 The Rexfin team

一家供应商的幻灯片上写着,他们的模型在财务问答上达到了 90% 的准确率。会场里的人频频点头,听起来像是 A 减的成绩,在学校里,90% 是荣誉榜的水平。

把这个数字放到金融的视角下再看一遍,它就不再像 A 了。90% 的准确率意味着十个数字里有一个是错的。把这个比例放进一份有四十个数字的董事会材料,平均下来会有四个数字是错的。你不知道是哪四个,模型也不知道,它会用同样流畅自信的语气为全部四十个数字辩护。这不是荣誉榜,在一个全部职责就是把数字算对的领域里,这是不及格。

这些基准测试值得比标题数字更细致的解读,因为你看得越深入,“把数学彻底从语言模型手里拿走”这个方案的说服力就越强。

这些基准测试到底在衡量什么

先从 FinanceBench 说起,这是一套基于上市公司公开申报文件构建的开放式金融问答测试集。这套测试设置对模型相当友好:问题与包含答案的确切文档配对,取材于 40 家美国大型上市公司的申报文件。这已经是这份工作最轻松的版本,没有人把 10-K 藏起来。

但结果并没有同样友好。在原始研究中,GPT-4-Turbo 搭配一套检索系统,在较难的配置下,答错或拒答的比例约达 81%。在各种配置之间,GPT-4 的正确率大约在 19% 到 89% 之间波动,而这道宽幅波动区间正是最值得停下来细看的部分。同一个模型,同一类任务,准确率却能因上下文的排列方式不同而波动几十个百分点。有一项研究发现,仅仅把上下文从问题之后移到问题之前,就能把 GPT-4-Turbo 的准确率从约 25% 拉到约 78%。这说明模型不是在朝一个稳定答案推理,而是在对提示词的排布方式做出反应。

再看电子表格这一侧,这更贴近金融团队的实际工作方式。FinSheet-Bench 在基于真实私募股权基金结构构建的财务电子表格任务上评估模型:简单端是查找,困难端是多步骤数值推理。测试中表现最好的配置 Gemini 3.1 Pro,在整套评估文件上达到了约 82.4% 的准确率。紧随其后的 GPT-5.2 和开启推理模式的 Claude Opus 4.6 都聚集在 80% 左右。

把这个数字当作头名成绩来看,它依然意味着大约每六个问题就有一个出错。论文本身的结论说得很直白:在测试的 OpenAI、Google、Anthropic 各家配置中,没有一个独立模型的错误率低到能在专业金融场景下无监督使用。这不是 Rexfin 的营销说辞,这是研究的结论。

为什么“换个更好的模型”不能弥合这道差距

每一次,人们的本能反应都是等下一个版本发布。分数确实逐年攀升,那条线迟早会跨进安全区间,不是吗?

有两件事让这种乐观显得代价高昂。

第一,这些错误不是能相互抵消的随机噪声。一个把比率颠倒过来、把千为单位的数字读成百万为单位、或者把现金流出的正负号弄反的模型,犯的不是一个小错误,而是一个自信的、结构性的错误,而且它恰恰发生在人类审阅者最不可能去复核的地方,因为周围的叙述读起来干净顺畅。一个错误表现规律的 90% 分数是一回事,一个 10% 里混着数量级错误的 90% 分数,是审计主管签不下去的东西。

第二,基准测试的准确率是在整洁、经过整理的数据上测出来的。你的数据不整洁,它散落在 QuickBooks、一个来自并购的 NetSuite 实例、三个数据仓库,以及某人扫描歪了的一叠 PDF 文件夹里。干净申报文件上的准确率是天花板,不是地板。你自己那些凌乱、多来源财务数据上真正会得到的数字,比任何排行榜上的都要低,而且没有哪个基准测试会公布这个数字,因为没有哪个基准测试用的是你的账本。

所以诚实的说法不是“模型不行”。前沿模型在阅读、总结和解释方面确实很强。诚实且更有用的说法要窄一些:它们不是可靠的算术引擎,而且它们从一开始就不是为此而生的。要求 LLM 计算一个同比变化,等于要求一个被训练来预测合理文本的系统,转而产出一个精确、可辩护的数字。有时候那个看似合理的字符恰好也是正确的字符,但在困难场景中,有 18% 的时候它不是。

应该改变架构、而不是换供应商的那个数字

这就是基准测试指向的那一步。如果语言模型的弱点是对真实数字做精确计算,那就不要再要求它去计算。

让模型做它擅长的事:理解问题、找到正确的数字、写出解释,而把每一次真正的计算都交给一个针对你账本的经对账模型运行的确定性引擎。LLM 负责检索和推理,数学作为代码运行,就像它在公式里运行的方式一样。相同的输入,每一次都得到相同的输出,并且能一路追溯回总账中的原始行。

这一次拆分改变了这些基准数字对你的意义。18% 的电子表格错误率和 FinanceBench 那道宽幅波动区间,衡量的都是模型在做算术这件事。把算术从它的任务清单上拿掉,那些错误模式,颠倒的比率、错误的数量级、反转的正负号,就不再是概率性的了,它们变成了一个你可以测试一次、然后信任的函数。模型仍然可能读错一个问题,人类仍然要审阅问题的框定方式,但它再也不能悄悄地递给你一个偏差十倍的数字,再配一句读起来干净顺畅的话。

这是其他一切的根基所在。这也是为什么电子表格是让 AI 写数字的错误场所,因为你继承的是每一个静默错误,而不是消除了这一整类错误。这也是为什么一个 AI 算出的数字应当像公式一样可重放:相同的输入产生相同的数字,并附带可追溯的路径,这正是一个确定性层能给到的东西,而一个独立模型给不了。更完整的论证参见《面向 AI 的可靠金融建模层》这一支柱页面。

更直白的版本

下次有基准数字出现在会议上时,不妨当场把它翻译一遍。90% 是十个数字里错一个。82% 是六个答案里错一个。然后问一句:团队愿意不去核查的是材料里的哪六个数字?因为这就是信任原始模型输出的真实含义。

这些基准测试不是让你继续等一个更好的模型的理由,它们是支持一种不同架构的理由:推理留在模型里,数学放进一个不会产生幻觉的层。只有在这种配置下,幻灯片上的分数和你报告里的数字,才被允许是同一件事。

如果你想看看把算术从模型手里拿走、放到一个经对账的事实来源上运行是什么效果,预约演示,带上你最棘手的对账任务。那才是真正说明问题的测试。

所属专题 AI 在触碰你的数字之前需要的可靠性层

继续阅读

预约演示

亲眼看到您的数字对得上账。

预约一场 30 分钟的演示。带上一个您总是无法快速回答的问题,我们将基于真实财务数据现场为您建模。