跳到正文
新功能:向 Rexfin 分析师智能体询问你的模型,每个数字都附带出处
· 阅读约 8 分钟

可解释性与可验证性:每家 AI 财务厂商都爱说的信任词(以及它遗漏了什么)

每家 FP&A 厂商都承诺“透明玻璃盒”。可解释性展示的是 AI 如何猜出答案;可验证性则将答案与账本核对,核对不了就拒答。

作者 The Rexfin team

打开几乎任何一家 FP&A 厂商的信任页面,你都会看到大同小异的一句话:我们的 AI 完全可观察,没有任何黑盒,你可以右键点击任意单元格查看背后的逻辑。有的 CTO 出品视频系列,标题就叫“逃离黑盒”。到处是带着小放大镜图标的透明玻璃盒图解。整个赛道几乎在十八个月之内不约而同地趋同到了同一套说辞。

它们都不会告诉你真正重要的那一件事:当 AI 无法证明一个数字时会怎样。它会如实说明吗?还是会给你展示一段非常有说服力、关于一个它编出来的数字的解释?

这个差距,正是可解释性与可验证性之间的区别。而现在,几乎整个市场都在卖第一种,却暗示自己卖的是第二种。

可解释性给你一个理由,可验证性给你一个出处

可解释性意味着系统能够复述自己的推理过程。问它为什么第三季度的营销支出看起来是这样,它会带你走一遍步骤:它调取了总账科目、应用了一个筛选条件、对某个区间求和、再对一笔应计项目做了调整。这种叙述本身确实有用。但仅凭它本身,并不能保证这个数字是对的。

透明玻璃盒的演示往往一带而过的是这一点:大语言模型完全能够为一个它凭空生成的数字,编出一段流畅、结构清晰、看起来完全合理的解释。可解释性是“叙述”这件事本身的属性。它告诉你模型声称自己遵循的推理形状,但不会告诉你这段推理是否真的触碰过实际的账本。你可以右键点击一个单元格,看到一个故事。这个故事可以是错的,读起来却依然自信、条理清晰、前后一致,因为生成一段听起来合理的推导过程,恰恰是语言模型擅长的那类任务,与底层数字是否真实无关。

可验证性则是完全不同的一种主张:系统除非能对照源数据证明一个答案,否则就无法给出这个答案。不是叙述一条听起来合理的推导路径,而是像审计员那样去证明,把这个数字追溯回一笔具体的交易、报表行,或一条已对账的分录。可验证的系统不会向你展示它的推理,它会向你展示凭证。而且关键在于,如果不存在凭证,一个可验证的系统会如实说明,而不是照样推理出一个数字。

两者并非完全对立,严格来说,一个好的系统应当兼具两者。但它们解决的是不同的失效模式,而厂商们几乎无一例外地在营销那个更容易做出来的一个。

可解释性可验证性
展示什么模型声称自己走过的推理路径数字所对应的源记录
证明什么输出“听起来”是推导出来的输出“确实”是推导出来的
失效方式自信地叙述一个错误的数字无法悄无声息地失效:没有出处就没有答案
容易伪造吗容易,流畅的叙述对大语言模型来说成本很低不容易,引用要么能核实,要么不能
AI 不确定时会告诉你什么通常什么都不说,它照样解释它会拒答

为什么可解释性赢了,并成了整套话语体系

“透明玻璃盒”何以吃下整个赛道,不难理解。用现有的模型就能实现可解释性。你提示它展示推理过程,把思维链格式化成可点击查看的界面,一两个迭代周期内就能拿到一个适合演示的功能。它上镜好看。它回应的正是买家会当面提出的那个疑虑(“我不信任一个黑盒”),而完全不需要改变数字在底层是如何算出来的。

可验证性则是一个更难的工程问题,因为它要求这个数字从一开始就是在某个确定性、可追溯的地方被计算出来的,早在 AI 触碰它之前就要如此。你无法给一个模型在自己“脑子里”算出的数字事后补上一条引用。如果算术是在大语言模型内部完成的,而这恰恰常常是一段流畅解释背后真正发生的事,那就没有账本条目可以指向,只有一段听起来像有出处的叙述。我们关于 财务数据中 AI 幻觉 的支柱文章更深入地解释了为什么模型即便检索正确,算术也会算错,而这恰恰是一段好的解释可以掩盖过去的那种失效。

于是市场大规模地做了那件可以实现的事,给它套上一套听起来温暖、透明的话语体系,而这套话语体系本身成了信任信号,不管底层的流程管道是否真的具备拒答能力。

两问演示测试

要分辨这两者,你不需要审计任何人的架构。你只需要在任何厂商的演示中,按顺序问两个问题。

问题一:“给我准确展示一下这个数字是从哪里来的。”

现在几乎每家厂商都能通过这一关。你会看到一个高亮的单元格、一张悬浮卡片、一个可点击查看的“推理步骤”。这测试的是可解释性,到 2026 年,这已经是入场基本要求,已经无法区分厂商高下了。

问题二:“现在让它拒答一次。问它一个它无法验证的问题,让我看看它会如实说明,而不是去猜。”

这才是真正把厂商分出高下的问题。要求一个系统没有干净出处可以给出的数字:一个横跨两个未对账系统的指标、一个需要某个从未有人输入过的假设的数字、一个存在数据缺口的期间。一个只靠可解释性支撑的系统,通常仍然会给出答案。它会生成一个数字,给它裹上一层流畅的解释,而这层解释看起来会和那些真正正确的数字的解释一样精致。这就是陷阱所在:你从外部无法分辨差异,因为当底层数字是编造出来的时候,叙述的质量并不会随之下降。

一个可验证的系统会做出不同的反应:它会停下来。它会告诉你它无法给出这个数字,并说明原因,是哪个来源缺失、哪项对账没有完成、哪个假设从未被确认过。当场按要求拒答,才是真正的试金石。如果一家厂商无法让自己的产品拒答,那它做出来的是一个解释器,而不是一个验证器。

拒答真正需要什么

要让一个系统可信地拒答,拒答必须是一个结构性属性,而不是有人后加的一句客套提示。这意味着 AI 被允许陈述的每一个数字,在被允许陈述之前,就必须能够对应到一条针对已对账来源的引用,而不是事后作为一个已经生成的答案的装饰品补上去。如果引用无法核实,答案就不会被生成。这就是 引用或拒答机制:模型负责推理和检索,但底层有一个确定性的层,会在每一个数字被允许离开系统之前,检查它是否能对应到出处。没有出处,就没有输出,不管模型内部的推理感觉有多自信。

这也意味着拒答必须在最关键的那一刻依然成立:导出环节。一个在聊天窗口中礼貌地拒答的演示,与一个不会让未经核实的数字进入董事会报告包的系统,不是同一种保证。这正是 导出关卡 存在的意义:对生成文档的一道硬性技术拦截,而不是一个用户可以点掉的警告标签。也值得明确说明一下,为什么一个置信度分数不能替代以上两者:一个百分比仍然会让一个低置信度的数字带着一句提醒放行,这只是可解释性同一种失效的一个较温和版本。我们关于 为什么置信度分数不够 的文章详细说明了这种方法在真实财务报表上会在哪里失效。

结论

可解释性回答的是“你是怎么得到这个数字的”。可验证性回答的是“你能不能证明这是真的”,而在这两者之中,只有它愿意说“不能”。现在几乎每家 FP&A 厂商都能给你展示一条推理轨迹,这场军备竞赛已经结束,而它其实从未真正保护你免受一个带着自信解释、最终进入董事会报告的幻觉数字所带来的伤害。真正还能区分厂商高下的测试,是这家厂商的 AI 能否在被要求时,在数字无法证明的情况下拒答。在演示中问出这个问题。如果他们拿不出一次拒答,你就明白了他们的透明玻璃盒到底是用什么做的。

Rexfin 的构建核心是拒答能力,而不仅仅是一条推理轨迹。预约演示,让它拒答一次给你看。

所属专题 财务数据中的 AI 幻觉:阻止 AI 凭空捏造数字

继续阅读

预约演示

亲眼看到您的数字对得上账。

预约一场 30 分钟的演示。带上一个您总是无法快速回答的问题,我们将基于真实财务数据现场为您建模。