跳到正文
新功能:向 Rexfin 分析师智能体询问你的模型,每个数字都附带出处
· 阅读约 8 分钟

为什么 AI 会读错你的 10-K:财务幻觉背后的 PDF 与图像问题

在扫描版 PDF 和文档图像上,LLM 对财务数字的准确率会大幅下降。解决办法不是更好的提示词,而是结构化提取与核对层。

在扫描版 PDF 和文档图像上,LLM 对财务数字的准确率会大幅下降。解决办法不是更好的提示词,而是结构化提取与核对层。

作者 The Rexfin team

给一个能力不错的模型一份干净、机器可读的现金流量表,它几乎每次都能准确读出数字。给它同一份报表的截图,或是一份 2014 年传真过来的扫描版 PDF,同一个模型就开始编造。4 变成了 9。“上年”那一栏的数字被当成了本期数字来报告。合并单元格里的小计迁移到了错误的行。文字内容没有变,变的是像素,而这就足以让答案出错。

这正是财务 AI 幻觉中提示词工程无法触及的部分,因为损害在模型对任何内容进行推理之前就已经发生了。它发生在文档变成 token 的那一刻。

准确率不是渐进下降,而是断崖式下跌

有一种令人心安的假设,认为图像输入只是“略差于”文本输入。基准测试并不支持这种心安。在干净的表单和信函上,视觉语言模型的读取准确率能达到 95%到 98%。把同样的模型对准密集的财务文档,也就是构成真实 10-K 的多列、合并单元格、注脚密布的表格,报告出的生产环境准确率会跌到 75%到 80%的区间。当图像压缩变得激进时,准确率被测出会跌向 60%。图表解读更糟:研究显示,模型从图表中读取数值的准确率大约在 34%到 62%之间,具体取决于图表类型和模型。

直白地说,同一个在整洁的 CSV 上看起来可靠的系统,在 PDF 里的财务图表上的可靠程度接近抛硬币。仅仅因为文档的到达方式不同,准确率就会摆动十五到二十多个百分点。对多数工作流来说,这个差距是隐形的,直到某个季度不再隐形,而一个被读错的数字已经埋进了董事会材料的第三页幻灯片里。

为什么财务偏偏是最难的情形?有三个结构性原因:

  • 表格是所有基准测试中表现最差的元素。 多列跨度、合并单元格和嵌套层级结构,打破了 OCR 和视觉模型对阅读顺序的假设。研究者一再指出,密集、层级化、多页的表格是失效区。
  • 错误看起来很合理。 一个被读错的数字,产生的仍然是一个看起来像真实数字的数字。没有红色波浪线,没有异常抛出。它会顺流而下,看起来和正确值一模一样。
  • 财务对哪个数位出错毫不宽容。 在散文中,1%的提取误差是噪音。在财务报表中,错误单元格里的错误数位,就是契约违约和干净季度之间的区别。

“用更好的模型”是错误的直觉

每隔六个月就有新模型宣称解决了文档理解问题,而头条的基准分数确实令人印象深刻,在精选数据集上能达到 97%。陷阱在于该基准与你的档案柜之间的差距。独立报告显示,相较基准条件,生产环境下的性能会下降 15%到 25%,仅表格错位一项就占生产环境失败案例的约 30%。

所以你可以去追逐前沿模型,能拿到几个百分点的提升。但你得不到可审计性,也得不到“模型读出来的数字就是页面上的数字”这一保证。无论哪种情况,模型给出的答案都很自信。自信不等于正确,而在一张扫描图像上,当关键时刻到来时,你没有廉价的方法把两者区分开来。

诚实地说:更好的模型确实有帮助,但它们无法弥合这个差距,因为这个差距本质上不是关于推理的问题。它关乎的是从像素到数字的一次有损转换,而这个转换没有被任何人拿真相来源核实过。

修复方法是一个层,而不是一句提示词

如果失效发生在提取环节,修复就应当落在提取环节。这意味着不要把文档当成 LLM 随便扫一眼的东西,而要把它当成需要被解析、结构化、并且在任何 AI 被允许对其进行推理之前先经过核对的东西。

具体来说,这看起来是一条流水线,而不是一次单一调用:

  1. 结构化提取。 专门的表格解析和版面分析把数字提取到具有已知坐标的单元格中,而不是依赖模型对阅读顺序的最佳猜测。每个被提取的值都保留一个指向其在页面中来源位置的指针。
  2. 与账本核对。 提取出的报表数字要被核对平账。各行项目相加是否等于小计?资产负债表是否平衡?提取出的收入是否与会计系统报告的一致?一个被误读为 9 的扫描版 4,一旦与报表其余部分核对,就会在算术层面失败。误读会以核对错误的形式浮现,而不是以一个自信的错误答案浮现。
  3. 一个已核对的模型作为真相来源。 与其让 AI 每次被提问时都重新读取 PDF,不如让它查询一个已经与账本核对平账的单一财务模型。像素只被读取一次、核实一次,并被锁定。
  4. 在其之上进行确定性计算。 当 AI 需要计算一个比率或增长率时,算术运算通过计算引擎完成,而不是由语言模型完成。LLM 决定要计算什么并解释结果,它绝不会对一个自己从图像中目测出的数字进行运算。

这正是 Rexfin 所构建的架构。我们连接到会计和财务数据平台,包括 QuickBooks、Xero、NetSuite、Sage、SAP、Oracle、数据仓库,或者连接到上传的报表,构建一个与账本核对平账的已核对财务模型。AI 从这个模型中检索数字,并通过一个确定性引擎运行计算,因此一个答案可以追溯到你能够审计的来源,而不是追溯到某个视觉模型自认为看到的一个数位。

重点不是说 OCR 毫无用处。重点是 OCR 的输出必须被当作一项需要核实的主张,而不是一个可以直接信任的事实。核对正是纯提示词方法完全跳过的验证步骤。

这对财务团队意味着什么

如果你正在评估一款 AI 财务工具,该问的问题不是“你们用的是什么模型”,而是“在 PDF 和答案之间发生了什么”。一款把文档图像直接灌入 LLM 并返回数字的工具,交付给你的是那 75%到 80%的表格准确率,而且没有任何办法捕捉遗漏。一款进行提取、核对并与账本对平的工具,交付给你的是一个数字,如果它错了,会大声地失败。

关于即便提取环节完美无缺仍会存活下来的失效,可参阅我们的姊妹文章,AI 数字读对了,数学算错了。在任何 AI 得出的数字送达管理层之前,先跑一遍我们的 财务团队验证清单。这两者都属于我们关于 财务数据中的 AI 幻觉 这一更广泛主题的一部分。

结论很简单,但很重要:最危险的财务幻觉,往往不是来自模型推理得不好。它们来自模型在一份没人核对过的文档上读得不好。修复阅读环节,核对结果,幻觉就无处藏身。

如果你想看看提取加核对针对你自己的报表如何运行,预约演示,带上你手头最凌乱的扫描版 PDF。

所属专题 财务数据中的 AI 幻觉:阻止 AI 凭空捏造数字

继续阅读

预约演示

亲眼看到您的数字对得上账。

预约一场 30 分钟的演示。带上一个您总是无法快速回答的问题,我们将基于真实财务数据现场为您建模。