仅有置信度分数还不够:AI 金融中真正的数据锚定是什么样子
AI 自报的确定性和具备不确定性感知能力的 RAG 都有帮助,但两者在处理表格时仍会出错。持久的信任来自将每一个数字锚定到一个已对账的模型中。
作者 The Rexfin team
某个模型告诉你,它有 94% 的把握认为第三季度毛利率是 41.2%。而账本里的真实数字是 38.7%。这个置信度数字衡量的并不是正确性,而是这个错误答案听起来有多流畅。
这正是大多数财务团队在开始信任 AI 处理数字时踏入的陷阱。输出结果裹着一个看起来像概率的百分比,而一个看起来像概率的百分比会让人感觉像是一种把控。事实并非如此。置信度分数告诉你模型对自己猜测的把握有多大,却完全无法告诉你这个猜测是否与你的账本对得上。
置信度分数究竟衡量的是什么
大语言模型普遍存在校准失衡的问题,主要的失效模式是过度自信。这种模式在各类任务、模型和数据集中都普遍存在。即便模型在一个干净、符合训练分布的提示词上看起来校准良好,这种校准也十分脆弱,一旦输入偏离了训练时见过的内容,校准就会崩溃。而财务表格无时无刻不在“偏离”:合并单元格、经脚注调整的小计、混合单位、重述的对比数据。
在这背后还有一个更令人不安的发现。近期关于金融领域幻觉检测的研究表明,高的 token 置信度反而可能预示着更高的幻觉风险,而非更低。模型恰恰在最错的时候表现得最笃定。因此,“只给我展示置信度 90% 以上的数字”这种筛选本能,反倒可能优先呈现出编造的内容。
这正是把自我报告的确定性当作把关标准的核心问题所在:你是在让制造错误的系统去给这个错误打分。一个持怀疑态度的 CFO 绝不会接受一位人类分析师这样的操作,也没有理由对模型网开一面。
具备不确定性感知的 RAG 更好,但仍然不够
显而易见的下一步是,不再询问模型“你怎么想”,而是让它基于检索到的文档进行锚定。检索增强生成(RAG)相比依赖模型的参数化记忆,确实能减少幻觉,而更新的、具备不确定性感知能力的变体是真正的进步。2026 年一项关于贝叶斯 RAG 的研究,利用蒙特卡洛 dropout 将认知不确定性直接内建到检索环节,在苹果和微软的 10-K 文件上报告了约 93% 的答案准确率,以及比基线好约 27% 的不确定性校准水平。这是实实在在的进步,值得认真对待。
但要看清它衡量的是什么。它量化的是检索本身的不确定性,即系统是否找到了正确的段落。它并不能保证那段文字中的数字被正确读取,不能保证从一张四十行的表格里选中了正确的行项目,也不能保证之后的运算是可靠的。即便是优秀的 RAG 实现,在底层数据不完整、不相关,或者仅仅是从表格中解析错误时,依然会给出听起来很有把握的答案。检索锚定回答的是“这个数字来自哪里”,而不是“这个计算对不对”或“这是否与账本一致”。
对表格来说,这个缺口正是问题所在。一份 10-K 文件大部分内容都是表格。模型可以检索到正确的页面,清清楚楚地给出引用,却仍然可能因为两列共用了同一个表头,而把错误的业务分部的营收给你。置信度会很高,引用也是有效的,但数字是错的。
真正的锚定要对上账本,而不是对上提示词
这里有一个关键的区分,而整个行业一直在混淆这两者。
第一种是文本锚定:答案指向一份来源文档。这有用,但一份 PDF 并不是事实来源本身,它只是事实来源的一种呈现,而且往往是失真的呈现。
第二种是账本锚定:AI 返回的每一个数字都能对应到一个与总账对账一致的、已对账的财务模型中的具体数值。不是提到这个数字的一段话,而是这个数字本身,并且能追溯到产生它的那些交易。
真正的锚定是第二种。它改变了“核实”的含义。控制人不再需要点开一份源文档、重新阅读一张模型已经读错的表格,而是沿着数字向下追溯,追到产生它的计算,再追到它所依赖的已对账余额。这种信任不是概率性的,而是结构性的。
这正是 Rexfin 所构建的已对账数字方法。我们连接你的会计和财务数据系统,包括 QuickBooks、Xero、NetSuite、Sage,以及你的数据仓库,或者你上传的报表,构建出一个与账本对账一致的模型。AI 并不自己计算毛利率,而是从这个模型中检索数字,并通过一个确定性引擎运行计算,就像受控电子表格中的一个公式那样。答案返回时附带完整轨迹:涉及哪些余额、哪些期间、哪些调整。不需要置信度分数,因为整个路径都是可核查的。
为什么确定性计算能补上最后一道缺口
锚定输入是必要条件,但并不充分,另一半是数学本身。即便大语言模型检索到了正确的数字,它仍然可能把一个比率算反,把绝对变化和百分比变化搞混,或者把现金流出的符号弄反,这是一类我们在AI 数字对了,数学错了一文中探讨过的错误。置信度分数抓不住这类问题,因为在模型看来,这个运算结果听起来是合理的,于是它表现得很笃定。
让每一次计算都通过确定性引擎运行,能够彻底消除这类失效。相同的输入永远产生相同的输出,而且结果可以被复现。这正是一个数字能在董事会或审计师面前站得住脚的原因:不是因为模型很自信,而是因为这个计算可以被复现和追溯。同样的道理也解释了为什么 AI 数字只有经过核实才能进入董事会汇报,而这种核实应当是一次结构性检查,而不是看一个百分比感觉靠不靠谱。
结论
置信度分数和具备不确定性感知能力的检索都是真实存在、也在不断进步的技术,但两者单独存在时都不够。它们告诉你模型对自己的答案有多大把握,以及它去哪里找了资料,但都无法告诉你这个答案是否与你的账本对得上。对财务而言,这才是唯一重要的问题。
不要再依据模型听起来有多确信来评判 AI 的输出,而要依据每一个数字是否能对应到一个已对账的模型、是否经过确定性计算、是否可以追溯到来源。这才是站得住脚的锚定。
如果你想看看一个数字一路追溯到账本底层时是什么样子,预约演示,带上一个上一个 AI 工具算错的数字。
所属专题 财务数据中的 AI 幻觉:阻止 AI 凭空捏造数字