可复现的设计:如何像证明公式一样证明一个 AI 数字
董事会和审计师现在要求 AI 生成的数字能够完全重现并可追溯到源头。只有 LLM 之下的确定性计算层才能做到这一点。
作者 The Rexfin team
在电子表格中点一下单元格,你就能证明其背后的数字。公式栏会显示运算,运算指向其他单元格,那些单元格再指向输入项。你可以手工重建这个数字,并且每次都得到相同的答案。这个属性在审计工作中有一个名字:可复现(replay)。相同的输入,相同的路径,相同的结果。
现在,把同一个问题问语言模型两次,看看会发生什么。
在一项被广泛引用的测试中,一个 2350 亿参数的模型在 1000 次相同的运行中产生了 80 种不同的完成结果,即便温度参数设为零。研究人员追溯问题根源,发现在硬件本身:浮点运算中的舍入差异,加上注意力层和归一化层中不确定的 GPU 内核。将温度设为零只是缩小了分布范围,并没有真正消除它。一个模型可能对你要向董事会汇报的数字自相矛盾。
这就是本文要讨论的差距。问题不在于 AI 能否在金融领域发挥作用,而在于一个 AI 生成的数字能否像公式一样被证明。答案完全取决于运算发生在哪里。
“可复现”真正要求什么
当审计师或审计委员会说他们希望 AI 输出可审计时,即便措辞不同,他们通常在要求三件事。
第一,确定性:相同的输入产生相同的数字,无论是今天,还是十八个月后有人重新打开文件时。第二,可追溯性:每一个数字都能追溯到一笔账本分录或一个明确陈述的输入,而不是对它的转述。第三,独立性:第二方可以重新执行这项工作,并在容差范围内得到相同的结果。
这些并不是为 AI 新发明的要求,而是金融业一直以来遵循的相同管控原则。新的地方在于,监管框架已经开始明确提出可复现性这一要求。欧盟《人工智能法案》对高风险系统的可审计性要求、NIST 人工智能风险管理框架,以及美国银行业监管指引,都依赖于相同输入下的一致性。2026 年发布的 COSO 生成式 AI 内部控制指南,用管控的语言表达了同样的观点:“设置后放任不管”对概率性模型行不通,监控本身要成为一项管控活动,而不是事后补救。
一些审计团队走得更远,把可以接受的标准明确写了下来。已经出现了带有明确抽样频率和 正负 5% 容差带 的复现标准,用于独立重跑。仔细读一下这句话:容差带是当你已经承认系统无法精确复现时才会设定的东西。对于资产负债表的对账而言,正负 5% 不是舍入误差的容忍空间,而是一个漏洞。
为什么模型永远不能充当计算器
面对模型的波动性,本能反应是把温度调低,寄希望于问题解决。我们见过团队这样做,并说服自己问题已经解决了。这做法减少了短答案中肉眼可见的波动,却把其余部分藏了起来。
更深层的问题在于概念本身。语言模型预测的是下一个词元。它极其擅长识别出一个问题是在问毛利率,而毛利率涉及收入和销货成本。但它不是计算器。当它“计算” 4,182,665 减去 3,114,209 时,它产生的是一串看似合理的数字序列,而不是真正执行了减法运算。大多数时候,这串看似合理的数字是对的。问题恰恰在于“大多数时候”。你不能在脚注里写“通常是对的”。
一份专门研究财务工作流的报告将这种失效模式称为 输出漂移(output drift):同一个提示词在不同供应商之间运行,或跨越不同模型版本,又或者只是在某个普通的周二运行,返回的数字就对不上了。漂移在被对账发现之前是不可见的,而对账恰恰是团队最想自动化掉的那一步。
因此,模型必须保留自己真正的优势,也就是语言和意图理解,同时放弃它从来就不擅长的那份工作。运算必须转移到一个确定性的地方去执行。
让数字可被证明的那一层
这正是 Rexfin 的设计理念所在,一旦把两项工作分开,道理就显而易见了。
Rexfin 连接到你数字本已存在的系统,包括 QuickBooks、Xero、NetSuite、Sage、SAP、Oracle 及你的数据仓库,或上传的报表。基于这些数据源,它构建出 一个与账本完全对齐的财务模型。每一个数字都基于这一个单一模型进行计算。这一点为何重要,在 面向 AI 的可靠财务建模层 支柱文章中有详细说明,而把一份工作表当作这一基础所隐藏的陷阱,则是 为什么电子表格是 AI 金融的错误基础 一文的主题。
当你提出问题时,语言模型负责它擅长的部分:理解你的意图,并选出相关的数字和运算。真正的数学运算通过 确定性计算引擎 执行,而不是由 LLM 完成。该引擎针对已对齐的模型执行运算,返回数字,并记录从输入到结果的完整路径。下个季度用相同的数据再问一次同样的问题,你会得到相同的数字。交给第二位审阅者,他们得到的也是相同的数字。这就是电子表格意义上的可复现性,重新回归。
有必要说清楚,为什么通过某种协议把模型连接到你的 ERP 并不等同于这件事。一次连接给了模型访问数据的 权限,但并没有把 运算 从模型身上移走。我们在 MCP 对金融来说还不够 一文中详细拆解了这个区别。没有确定性引擎的访问权限,只会让模型取到真实数字,然后对它们做不可靠的运算。
这改变了会议室里的什么
想象一下审计对话的场景。有人对管理报告中的某个数字提出质疑。在“模型参与循环”的方式下,诚实的回答是:这个数字是生成出来的,大概率是对的,但不保证可以复现。这样的回答经不起管控审查。
有了确定性层,答案就不同了。这个数字可以追溯到具体的账本分录。产生它的运算被记录了下来。重新运行一次,得到的还是同一个值。你不再是在为一个生成出来的数字辩护,而是在展示你的推导过程,就像展示一个公式一样。
情景分析也是同样的对待方式。当你在 Rexfin 中为某个假设情景建模时,引擎会针对已对齐的模型做确定性重新计算,因此你向董事会展示的下行情景,可以逐行复现,而不是重新生成后悄悄发生变化。你可以在 用例页面 上看到这在真实财务工作流中的效果。
这一切并不会让模型变得不那么有价值。恰恰相反,它通过赋予模型一份它真正能胜任的工作,让模型变得可信:理解问题、讲述答案,把运算留给一个可以复现的层去做。抛开其他一切,这就是全部论点所在。一个你无法复现的数字,不是一个你能够对外汇报的数字。
如果你的团队被要求把 AI 生成的数字呈现给审计师或董事会,首先要解决的问题就是:这些数字能否复现。预约演示,我们会用确定性引擎把你的一项对账工作跑两遍,让你对照账本核实结果。
所属专题 AI 在触碰你的数字之前需要的可靠性层