如何评估财务智能体:在信任数字之前先建立准确率评分卡
供应商演示什么也证明不了。这是 CFO 需要用来衡量财务智能体字段级准确率、答案一致性和可追溯性,并与已核对的真实数据对照的评估框架。
作者 The Rexfin team
一位供应商走进你的会议室,在一个精美的聊天框里输入“我们上个季度的毛利率是多少,为什么会变动”,四秒钟后一段自信的答案带着图表出现了。会议室里的人纷纷点头。有人说“就用它了”。
那场演示只证明了一件事:这个智能体能够对供应商选定的问题、在供应商准备好的数据上,给出一个看起来合理的答案,而你完全没有办法核实这个数字是否正确。这是一场表演。而“看起来对”和“确实对”之间的差距,正是职业生涯终结的地方。
令人不安的基准测试数据印证了这一点。在 FinanceBench 上,一套取自真实 SEC 备案文件的问答证据三元组测试集里,模型只答对了约 47% 的现实问题,26% 完全答错,其余的要么失败要么拒答。一个被广泛引用的 GPT-4-Turbo 配合检索的配置,在大约 81% 的问题上遗漏或回避了答案。这些不是玩具级任务,而是财务团队每天都要做的“读备案文件、找到数字、进行推理”式工作。
所以在任何智能体触碰你的报表之前,你需要自己的一套测试,不是供应商的,是你的。
为什么单个演示问题是错误的度量单位
更深层的问题在于,单次答对不能告诉你下一次会怎样。大语言模型是概率性的。即使把温度参数锁定为零,由于浮点数舍入、GPU 内核行为和批处理规模效应,同一个问题问两次也可能得到两个不同的数字,而这些因素都不在你的掌控之内。已发表的关于财务工作流输出漂移的研究测量到,相同的运行之间准确率波动可达 15%,最好和最差情况之间的差距还要更大。
对 CFO 来说,这就是全部关键所在。一个 90% 时间正确的工具,并不是一个你能预先规划出那 10% 错误的工具,而是一个每次运行都会在不同、不可预测的 10% 上出错的工具。你无法在这样的基础上签署董事会材料,也无法把它拿到审计师面前。
准确率评分卡的意义,就是把“演示时感觉挺对”转化为一个你能够站得住脚的数字:一个针对已知正确答案、可以随时重新运行的实测通过率。
评分卡必须衡量的三件事
大多数评估工作只衡量一件事,即答对了没有,然后就止步了。这对财务来说是不够的。你需要三个维度,因为一个智能体可能以三种独立的方式出错。
字段级准确率。 数字是否与已核对的真实值精确一致,精确到分或正确的舍入位?不是“答案是否在合理范围内”。当账本显示 4870 万美元时给出 4820 万美元的营收,不是接近正确,而是错误。对每一个数字按已知值做严格的对错判定。
答案一致性。 对同一个问题分别在五次独立运行中提问,最好是在不同的日子。每次得到的数字是否相同?不一致本身就是一种独立于准确率之外的失败模式。一个在第一次运行时正确、却在第四次运行时悄悄漂移的智能体,比一个持续稳定地给出错误答案的智能体更危险,因为后者你至少能发现。
可追溯性。 对每一个数字,智能体能否展示它的来源,即哪个科目、哪个期间、哪条源记录,以便人工重演这条路径?一个无法追溯的答案,就是一个无法被审计的答案。我们在记录决策而不只是记录动作的审计轨迹中讨论过为什么可重演性是一项硬性要求,而不是一个附加功能。
没有标准答案,就无法给测试打分
这是大多数人都会跳过的部分。要衡量字段级准确率,你需要一份真实数据:一组你已经知道并信任其正确答案的财务问题。而这些答案必须来自一个能与账本对上的地方,不是来自第二个 AI,不是来自控制人员的记忆,也不是来自上个季度的材料。
大多数评估项目正是在这里悄悄崩塌。团队会发现自己实际上并没有一个干净的真实来源可供打分。他们的数字分布在三个互相在边界处对不上的系统里、六七份电子表格中,以及一份只有一个人真正理解的合并工作簿里。如果你的“正确答案”本身没有核对过,那么你的评分卡衡量的只是智能体相对于一个猜测的表现。
因此,建立标准答案才是真正的工作。挑选 50 到 100 个能覆盖真正重要类型的问题:定点查询(期末现金余额)、计算类问题(毛利率、同比变化、契约比率)、跨期比较,以及至少几个错误最容易藏身的多主体或合并类问题。对每一个问题,锁定与你已核对模型一致的正确答案。这组数据就是你的黄金数据集,也是整个练习中最有价值的产出。我们在如何压力测试一款 AI 财务工具中深入讲解了如何构建这样一个数据集。
实际运行:评分卡的落地方式
一旦标准答案建立起来,测试框架就是机械化的。事先设定一个阈值,我们不会让任何字段级准确率低于 95% 的东西接近对外报表,然后据此打分。
- 准确率通过率。 与真实数据精确匹配的数字所占的百分比。按问题类型分别报告,而不仅仅是汇总;一个智能体可能在查询类问题上表现完美,却在每一道计算题上都出错,而汇总分数会掩盖这一点。
- 一致率。 在所有重复运行中返回相同答案的问题所占的百分比。数字类问题的这一比例只要低于 100%,就值得深入了解再往前推进。
- 可追溯率。 附带人工可以追溯回账本的来源路径的答案所占的百分比。
- 漂移。 每月重新运行整套评分卡。模型会被悄悄更新,你的数据也会变化。一个三月份还通过测试的工具,到六月份可能就会失败,只有一套常设测试才能告诉你这一点。
一个直白的看法:如果供应商抵触让自己的工具跑一遍你的黄金数据集,或者想要“帮你准备问题”,那你已经了解到你需要知道的一切了。评分卡的意义就在于,他们不能自己挑选测试内容。
没人愿意宣传的那个约束条件
如果算术是由智能体自己完成的,以上这一切都无从谈起。一个每次运行都重新计算比率的 LLM,每次运行都会出现漂移,这不是一个调优问题,而是这种架构本身的行为方式。能通过一致性测试的智能体,是那些从一个已核对的模型中检索数字、并把每一次计算都交给一个确定性引擎处理的智能体,这样相同的输入在结构上就必然产生相同的输出。推理部分可以保持概率性,数学部分不可以。这种切分正是智能体式 AI 信任层的核心论点所在,也是我们把 Rexfin 构建成让数字来自单一、与账本对得上的真实来源,答案始终能追溯回该来源的原因。
评分卡是让你停止信任演示、开始信任证据的方式。建立你的黄金数据集,设定阈值,让每一个工具,包括我们自己的工具,都必须在你已经知道正确的数字面前证明自己。
如果你想看看当每一个数字都能追溯到已核对来源、数学计算是确定性的而不是猜出来的,财务智能体会是什么样子,预约演示,并带上你自己的问题。