跳到正文
新功能:向 Rexfin 分析师智能体询问你的模型,每个数字都附带出处
· 阅读约 8 分钟

FP&A AI 采购清单:避免黑箱预测的 12 个问题

一份怀疑论者视角的 AI FP&A 工具采购清单:可追溯性、确定性运算、对账、情景可复现性,以及能经得起董事会质询的审计轨迹。

一份怀疑论者视角的 AI FP&A 工具采购清单:可追溯性、确定性运算、对账、情景可复现性,以及能经得起董事会质询的审计轨迹。

作者 The Rexfin team

演示环节是评估 FP&A 工具最不靠谱的场合。数据是干净的,情景是排练过的,屏幕上的数字总能对上,因为有人确保了这一点。真正的考验发生在五个月后的董事会上,当一位董事指着修订后的预测问:“为什么 Q3 比你们三月给我们看的数字低了 11%,那个毛利率假设是从哪来的?”如果你的工具能在会议室里当场回答这个问题,那你买对了。如果不能,你买到的只是一个自信的讲故事者。

大多数 AI FP&A 产品的推销演示,是为了赢得演示本身,而不是为了应对董事会的质询。所以采购环节的任务,就是在你还有议价空间的时候,提前拷问第二种场景。以下是十二个问题,按照真正会拖垮这类工具的四种失败模式分组:数字无法追溯、模型自己编造的运算、对不上账的基础数据,以及无法复现的情景。按照能最先暴露最薄弱环节的顺序提问。

可追溯性:每个数字都能回溯到源头吗?

一个预测数字的可靠程度,取决于你能否重构它的来龙去脉。如果工具给出一个数字,而对“这是从哪来的”这个问题诚实的回答是一次向量检索加上语言模型的最佳猜测,那你买到的就是一个彬彬有礼的黑箱。

**1. 点击预测中的任意数字。它能显示确切的源数据行、公式路径,以及产生该数字的输入吗?**不是指向某个文档的引用。而是真正的血缘关系:总账明细行、驱动因子、计算过程。“它能引用来源”这个门槛比很多人想的要低。引用只能说明某个数字在哪里被提到过,而血缘关系说明的是这个数字是如何被推导出来的。

**2. 当 AI 给出一段叙述(比如“营收因季节性因素而增长”)时,这个说法是关联到模型中真实存在的数字,还是由提示词生成的?**这决定了解读究竟是根植于数据,还是听起来像根植于数据。要求同一段解释重新生成两次。如果支撑数字发生了漂移,说明这段叙述从一开始就没有真正绑定任何东西。

**3. 一位非建模人员(你的审计师、董事会成员、新入职的分析师)能否在没有你在场的情况下自行追溯?**只有搭建者才能读懂的可追溯性算不上审计轨迹,那只是一本日记。

确定性运算:到底是谁在做算术?

这个问题区分出真正靠谱的工具和看起来令人印象深刻的工具。语言模型是模式引擎,不是计算器。它们非常擅长生成看起来正确、实际上是错的数字,而且这种失败是隐形的,因为输出在语法上无懈可击。关于 AI 生成财务数字的研究恰恰记录了这一点:一个季度数字被当成年度数字读取,导致某项指标被夸大了 400%,而模型却说得斩钉截铁。修复方案不是换一个更好的模型,而是彻底把算术从模型的职责中拿掉。

**4. 数字在计算时,是由 LLM 计算,还是由确定性引擎计算、LLM 只负责描述结果?**这里没有可以接受的中间答案。如果是模型在做数学运算,那么每一个数字都带有幻觉风险,没有任何置信度分数能给这种风险定价。

**5. 用完全相同的输入运行同一个查询两次。你得到的是逐字节完全一致的数字吗?**确定性引擎每次都返回相同的答案。而靠采样得出答案的模型不会。这是一个三十秒就能完成的测试,而且诊断力极强。让他们现场跑一遍。

**6. 面对财务人员真正会争论的计算项目(调整后 EBITDA、ARR 桥接、多主体抵消、货币折算),这个工具是怎么处理的?**通用算术很容易做对。真正能在审计师面前站得住脚的计算,才是黑箱崩溃的地方,因为这些定义本身带有主观判断,而且每个会计期间都必须以同样的方式应用。

这个区别足够重要,我们为此写了一篇完整的文章,讨论为什么驱动因子预测应当保持算术的确定性,同时让 AI 负责杠杆参数和语言表达。

数据源对账:基础数据能对上总账吗?

建立在对不上账的基础数据之上的预测,本质上是一个装扮成模型的猜测。在评估任何预测方面的巧思之前,先检查一下这些巧思到底建立在什么样的地基上。

7. 连接你的会计系统或上传报表之后,该工具能否产出一个能与总账对上账的、统一的调和模型,并向你展示对账过程?“它能连接 QuickBooks”只意味着它能读取数据,并不能说明由此得出的数字是否与你的账本一致。要索要对账报告,而不是连接器的商标。

**8. 当同一个指标存在于两个系统中时(比如 CRM 里的营收和 ERP 里的营收),以哪个为准?这条规则是明确写出来的,还是每次查询时临时决定的?**如果工具悄悄地自行选择,那么根据你问的时机和内容不同,你得到的数字也会不同。以单一数据源为准应当是工具强制执行的一个明确决定,而不是检索顺序偶然造成的结果。

**9. 当底层总账被重述,或者上一期以不同方式结账时,会发生什么?**预测必须知道自己现在站在已经变化的地面上。那些只做一次快照就再也不更新的工具,过不了下一个结账周期就会悄悄过时。

情景可复现性与审计轨迹:六个月后你还能为它辩护吗?

本文开头那个董事会问题,本质上是关于时间的。数字会变,而你必须解释为什么会变。这就要求工具具备记忆能力。

**10. 调出上个季度的预测版本。你能否看到确切是哪些输入、驱动因子和假设产生了这个版本,并把它与当前版本进行对比?**没有版本化、可复现的情景,“为什么这个数字变了”这个问题就没有诚实的答案。你只能靠记忆去重构,而这正是可信度被侵蚀的方式。

**11. 是否存在一份不可篡改的日志,记录谁在何时更改了哪个假设,以及变更前后的数字分别是多少?**对任何触及你所汇报数字的工具来说,这都是最基本的要求。这也越来越成为一项合规要求,而不只是锦上添花。没有真正审计轨迹的工具,最终会在审计师或监管机构面前让你付出代价。

**12. 你今天能否重新运行一个过去的情景,并复现出当时展示给董事会的确切数字?**不是大致相近,而是完全一致。如果无法重放,你就无法为它辩护,而一个你无法辩护的预测,只不过是一个带仪表盘的负债。

该如何真正开展这场评估

不要接受供应商提供的数据。带上你自己的一份杂乱数据摘录,一个真实的月份,包含那些公司间的怪癖,以及那个人人都会分类错误的科目。要求在会议现场、用你自己的数据,当场做确定性重跑测试(问题 5)和点击溯源测试(问题 1)。大多数失败的工具都会在这里悄无声息地露馅,而当你要求它们把同一件事做两遍时,失败会立刻显现出来。

一个有用的思维模型是:AI 应当是解释数字的分析师,而绝不能是计算数字的会计。一旦这两个角色的边界模糊,屏幕上的每个数字都会继承模型的不确定性。一个站得住脚的预测,其全部意义就在于:数字来自一个与你的总账绑定的确定性引擎,而 AI 的工作是检索、情景构建,以及可追溯到源头的通俗语言解释。

如果你想看看通过全部十二项测试在实践中是什么样子(对上账的基础数据、确定性运算、可重放的情景、完整的血缘关系),这正是 Rexfin 要向你展示的。预约演示,带上你最糟糕的数据集来。董事会那个问题才是唯一重要的考验,其他一切都只是排练。

想了解这一切如何融入一套你能够站得住脚的预测流程,请从可在董事会上站得住脚的 AI FP&A 自动化这篇支柱文章开始,或阅读团队如何在不失去掌控的情况下转向持续预测

所属专题 AI FP&A 自动化:能在董事会上站得住脚的预测

继续阅读

预约演示

亲眼看到您的数字对得上账。

预约一场 30 分钟的演示。带上一个您总是无法快速回答的问题,我们将基于真实财务数据现场为您建模。