跳到正文
新功能:向 Rexfin 分析师智能体询问你的模型,每个数字都附带出处
· 阅读约 8 分钟

记录决策,而非仅仅记录行为的审计轨迹:2026 年符合 SOX 要求的财务智能体必须记录什么

审计师不再接受“智能体做了 X”这样的日志。他们想知道它看到了什么、决定了什么、为什么政策允许它这么做,以及总账中发生了什么变化。以下是相关标准。

审计师不再接受“智能体做了 X”这样的日志。他们想知道它看到了什么、决定了什么、为什么政策允许它这么做,以及总账中发生了什么变化。以下是相关标准。

作者 The Rexfin team

我今年春天采访过的一位财务总监,描述了一个正变得越来越常见的场景。她的外部审计师调出了季度结账期间由一个 AI 智能体过账的一笔凭证,然后提出了一个日志无法回答的问题:不是问过的账,而是问智能体为什么认为自己有权这么做。系统记录了这个行为,记录了时间戳、用户令牌、金额,但没有记录智能体检索到的数字、它核对过的政策、它比对的阈值,以及它在行动前生成的推理过程。走查到这里就卡住了。

这个缺口正是 2026 年的整个故事。审计标准提高了,而许多财务工具没有跟上。

旧式日志回答的是错误的问题

几十年来,符合 SOX 要求的审计轨迹意味着一份行为记录:谁在何时对哪条记录做了什么。这种模式假定行为主体是人,而人的判断存在于他们的脑海中,可以通过询问和走查来获取。你问分析师为什么要计提这笔应计费用,她解释,你核对支持材料,然后继续往下走。

一个自主智能体打破了这个假设。判断不再存在于任何人的脑海中,而是存在于一次瞬时的模型调用中,默认情况下不留任何痕迹。如果你只记录行为,你记录的只是容易的那 20%,而丢掉了审计师真正关心的部分:决策本身。

COSO 今年的指引对此说得很直接。提示词、输入、输出、模型和配置版本,以及人工审核的证据,都被视为审计轨迹的一部分,而不是附属品。所定的标准是:留存的记录是否足以重建AI 所依据的内容,并证明该控制按设计发挥了作用。“重建”是关键词。一行写着 agent_posted_JE_4471 的记录,什么都重建不了。

决策级日志必须承载的四层内容

如果你认真对待“重建”这个标准,那么智能体每一个有实质影响的步骤,其日志条目都需要四层信息。多数失败案例缺的是一整层,而不是缺一条日志。

智能体看到了什么。 输入决策的确切数字、记录和上下文,并锚定到它们的来源。不是笼统的“第一季度收入”,而是具体的已对账余额、底层数据的版本,以及回溯到总账的血缘信息。如果输入无法被重现,下游的一切都无法被证明。

它决定了什么。 输出结果,以及它考虑过的候选路径。一次对账匹配有一个置信度,一项被标记的异常有一个量级,一笔拟议凭证有被排序并被否决的备选方案。只记录被选中的路径,会掩盖这个选择是否合理。

为什么政策允许它这么做。 授权该行为的控制措施,以及通过的评估。这是几乎所有人都会跳过的一层。“智能体拥有权限”不算数。记录应该显示,智能体是在一个明确界定的范围内运作,比如一个审批阈值、一个自主等级、一条职责分离规则,并且这个具体决策在那一刻满足了这个范围的要求。

下游发生了什么变化。 从决策到其在账目中产生的实际影响之间的关联。如果智能体的决策导致了一笔凭证过账、一次预测修订或一次重分类,轨迹就必须把两者连接起来。审计师如今明确要求端到端的交易可追溯性,并且每一个 AI 触点都应对应到它所影响的财务认定,比如存在性、完整性、计价等等。

把这四层放在一起,你就能在审计师提问之前先回答这个问题。漏掉其中任何一层,你就又回到了询问的老路上,只是这次没有人可以被询问。

你无法记录一个你无法追溯的输入

接下来这部分会让人不太舒服,但值得说清楚,因为它限定了单靠日志记录能带来多少价值。

一份决策日志的可信度,取决于其中所载数字的可信度。如果智能体从一张没人对账过的电子表格中提取了“现金余额”,你可以把这一步记录得非常漂亮,完整的提示词、完整的推理过程、不可篡改的时间戳,但你得到的只是对一个不可靠决策的完美记录。这份日志证明了智能体的行为是一致的,却无法证明这个决策是正确的,因为输入本身从未与任何东西对平过。

这正是为什么 2026 年关于数据血缘的讨论和关于智能体日志的讨论,其实是同一个讨论。审计师要求的是列级血缘,能把每一个财务字段沿每一次转换一路追溯回源头,正是为了在自动化控制接触数据之前,证明输入该控制的数据是完整且准确的。一份引用了无法追溯数字的决策级日志,满足了形式,却违背了实质。

所以,一个符合 SOX 要求的智能体,真正的前提条件不是一个更好的日志库,而是一个已对账的真实来源,一个与总账对平的财务模型,智能体看到的每一个数字都能追溯到它。做对这一点,日志才会有意义:每一项输入都有血缘,每一项输出都指回一个来源,“智能体看到了什么”就成了一个可复现的事实,而不是一种寄予希望的断言。这也正是让更广义的AI 财务审计轨迹在走查中站得住脚的同一个基础。

推理和运算不是同一条轨迹

审计师开始探究的另一个区分点是:当一个智能体“计算”一个契约比率或一个差异时,到底是什么在做这个数学运算。

如果是语言模型算出了这个数字,你的决策日志记录的就是一个本质上概率性系统的输出。同样的提示词在不同的日子可能得出不同的数字,而且没有确定性的产物可供重新运行。这作为一项自动化控制是很难站得住脚的,因为审计师提供的自动化应用控制基准豁免,是建立在控制逻辑稳定、结果可复现这一前提之上的。

站得住脚的模式,是把这两者分开。智能体负责推理该运行哪个计算、使用哪些数字;一个确定性引擎执行运算;日志则捕获输入、被调用的函数以及精确的结果。下个季度用相同的输入重新运行,每次都会得到相同的数字。正是这种可复现性,才把一条日志记录变成了证据。我们在为什么财务智能体必须调用工具,而不是自行计算一文中完整论证了这一区分,它也和受治理的自主性自然呼应,因为约束智能体行为边界的那个政策层,同样也是在日志中产出“为什么这一行为被允许”那一行的层面。

在审计师提问之前,先问问你自己的技术栈

一个简短却不太好受的测试。选出你的智能体上个季度做出的一个决策,只凭日志尝试回答:它看到了哪些数字,我能否把每一个都追溯到来源?它决定了什么,又否决了什么?哪一项控制授权了它,这个决策是否通过了那项控制?账目中因此发生了什么变化?

如果任何一个问题的答案都需要你耸耸肩、去问某个人,或者重新跑一遍模型然后祈祷,那你就不是符合 SOX 要求,而是正暴露在 SOX 风险之下,而且持续监控发现这一点的速度,会比年度抽样快得多。

智能体会继续过账、继续修订预测,这一趋势已经不可逆转。问题在于,它们的每一个动作,是否留下了一份审计师无需你在场就能重建的记录。这份记录始于能追溯到已对账真实来源的数字,经过一个确定性引擎,最终落入总账。如果你想看看建立在这样的基础上,一条决策级轨迹是什么样子,欢迎预约演示,带上你最棘手的那笔凭证。

所属专题 代理式 AI 在财务领域首先需要一个可靠的数字层

继续阅读

预约演示

亲眼看到您的数字对得上账。

预约一场 30 分钟的演示。带上一个您总是无法快速回答的问题,我们将基于真实财务数据现场为您建模。