没有计算层的金融 RAG 是不够的
检索能告诉你一个数字从哪里来,却无法告诉你算式对不对。为什么金融 AI 会卡在 85% 到 92% 的准确率,以及如何突破这道天花板。
作者 The Rexfin team
检索系统可以把 10-Q 中营业收入所在的确切页面、导出文件中的确切单元格、总账中的确切行号,直接递给你的 AI。而 AI 依然可能告诉你一个错误的毛利率。
这道鸿沟正是把 RAG 当作金融领域答案的整个问题所在。
检索增强生成的名声是实打实挣来的。给语言模型接上向量检索,喂给它你的文档,它就不再凭空编造事实。对于“我们的退款政策是怎么写的”或“总结一下 MD&A 章节”这类问题,它确实有效。模型把答案锚定在真实存在的东西上,你通常也能点回原始来源。对很多知识型工作来说,这已经够了。
金融不是一般的知识型工作。金融是必须对得上的算术。
检索回答的是“在哪里”,而不是“对不对”
这里有一个容易被忽略的区别。RAG 非常擅长溯源,它能告诉你一个数字从哪里来。它不擅长计算,因为计算仍然要经过语言模型,而语言模型是文本预测器,不是电子表格。
于是你会看到一种奇怪的失败模式。AI 检索到了正确的营业收入数字,检索到了正确的销货成本。然后它通过预测接下来最可能出现的字符来计算毛利率,得出的数字看起来合理,却偏差到足以造成实质影响的程度。每一个输入都是对的,输出却是错的。而且因为这些输入确实是从你的数据中真实检索出来的,这个答案还裹着一层引用来源,显得可信。
这比明显的错误更糟。明显的错误会被发现。一个被自信地引用出来的错误数字,会被直接粘进董事会材料。
研究这个问题的学者们反复撞到同一堵墙。嵌入文本很容易,因为文字承载的语义能被向量捕捉到。表格化的财务数据很难,因为数字本身几乎不携带语义信号。对嵌入模型来说,一列数字就只是一列数字。近期一项关于文本与表格联合检索基准的研究发现,即便系统精准命中了正确的行,模型依然无法可靠地解析表格来推导趋势,作者由此得出结论:这项任务需要一个真正的计算步骤,而不是更好的检索。(T²-RAGBench 直接点出了这一点,见原文。)
这句话值得再读一遍。更好的检索修不好数学问题,因为检索本身就已经是对的。
没人愿意公开宣传的准确率天花板
在金融文档上做朴素 RAG,数值问答的准确率往往会停滞在 85% 到 92% 之间,具体取决于测量方式。这个数字乍一听还算体面,直到你仔细想想它意味着什么。
在金融领域,92% 的准确率不是良好水平。有一篇研究财务审计的论文说得很直白:如果那 1% 的错误是资产负债表上的正负号反转,那么 99% 的准确率产生的运营信任度是零。本该为正的利润率算出来变成负的,一项负债被读成了资产。综合评分看起来很漂亮,具体答案却不能用,而你根本无从知道哪些答案落在了那道坏区间里。
这道天花板有结构性成因,不是靠调优提示词就能解决的:
- 数字本身不好嵌入。 语义检索找到的是读起来相似的内容,不是计算正确的内容。
- 多步推理会漂移。 模型每经过一次算术跳转,就多一次四舍五入、错位或凭空产生某个步骤的机会。
- 没有对账机制。 检索从某一个来源拉出一个数字,却不检查它是否与总账中其他地方的同一个数字一致。
- 地区格式存在歧义。
1,250是一千二百五十,还是一点二五?模型只能猜。
这些都不能靠索引更多文档或换一个更聪明的基础模型来解决,它们是“让文本预测器去做记账”这件事本身的属性。
真正能改变结果的做法
真正突破这道天花板的研究,有一个共同点:它们不再要求语言模型自己做数学。
有两个关键动作。第一,让检索感知元数据和不确定性,使系统不仅知道自己找到了什么,还知道该有多大把握。将贝叶斯、不确定性感知的检索应用于金融问答,与标准方法相比,幻觉减少了约 28%,同时在传统检索失效的地方也能拉出精确数字。(贝叶斯 RAG 报告的降幅是 27.8%,见原文。)强制引用与细粒度验证方法把可靠性推得更远,方式是将一个答案拆解为一个个原子级的论断,逐一对照来源核实,而不是把整段回答当作一个整体来打分。
第二,也是大多数团队最容易跳过的一步:把真正的计算交给一个确定性引擎。模型负责决定需要哪些数字、要执行什么运算;一个独立的、可审计的引擎在经过校验的输入上执行这项运算,每一次结果都一样。模型从不亲自做加减乘除,它负责编排,不负责算术。
把这两点结合起来,局面就变了。具备元数据感知的检索加上一个确定性计算层,能把可靠性推过 93%,更重要的是,它让错误答案变得可见,而不是被隐藏起来。当引擎在经过对账的输入上做确定性计算时,你可以把任何输出一路追溯回计算过程、追溯回总账中的原始数字。这个数字不只是被引用了,它是可复现的。
为什么必须先有一个经对账的模型
在这一切之下还有一个环节,是检索本身做不到的。检索拉出一个数字,却不会检查这个数字在你的各个系统之间是否自洽。你的计费平台、你的会计导出文件和你的数据仓库,完全可能对同一个月份分别报出略有差异的营业收入数字,而检索会毫不犹豫地把它先找到的那一个交给 AI。
这正是为什么一个确定性计算层只有跑在经对账的模型上才能真正发挥作用:一个在任何 AI 触碰之前就已经与总账对平的单一事实来源。我们在《单一事实来源:为什么经对账的数据是金融 AI 真正的解锁点》一文中已经论证过这个基础,参见原文。它也与一个更根本的问题相呼应,即为什么 AI 会在财务数学上出错,这本质上是这些模型读数字方式的一种属性。
这正是 Rexfin 所依托的架构。连接你的会计和财务数据源,建立一个经对账的模型,然后让 AI 从中检索数字,并针对一个确定性引擎进行计算,而不是自己动手算。检索负责溯源,对账负责建立信任,确定性计算负责让算术真正对得上。更完整的论证参见《面向 AI 的可靠金融建模层》这一支柱页面。
结论
RAG 解决了一个正确的问题,却解决在了错误的层面。它让 AI 的回答变得可溯源,这正是金融领域迫切需要的。但可溯源和正确,不是一回事,检索单独作战时,恰恰会在金融最经不起出错的地方触顶。数字被引用了,不代表算式是对的。真正让算式对得上的,是跑在经对账数据上的确定性引擎。
如果你的 AI 能引用来源,却依然无法信任它算出来的数字,计算层就是你缺失的那一块。预约演示,我们会向你展示一个被引用的数字和一个真正对得上的数字之间的区别。
所属专题 AI 在触碰你的数字之前需要的可靠性层