AI 撰写财务评论的引用测试
AI 撰写的董事会叙述听起来都很权威,无论其中的数字是否有来源可查。这里是一个一键测试,能告诉你自己拿到的是哪一种。
作者 The Rexfin team
在你的董事会材料中,随便挑一段 AI 起草的差异说明。找到其中的一个数字,一个百分比、一个金额、一个基点变动。点击它。会发生什么吗?
对于当今市场上大多数 AI 评论工具来说,答案是不会。没有任何东西可以点击。这个数字只是文字,生成方式和它周围的句子一样,都是统计上最可能出现的下一个 token,而不是从账本中检索出来的值。这个差距很容易被忽略,因为散文不会像电子表格单元格那样自行宣告不确定性。单元格角落里的一个红色三角提示“这里有点不对劲”。而一句流畅的句子什么都不会说,无论其中的数字是对是编。
为什么叙述是最容易藏匿错误数字的地方
表格会强迫人仔细审视。行和列会引导目光去核对一个总计、发现一个缺口、注意到一个与上两行不匹配的数字。散文则恰恰相反。一句结构完整的句子读起来是一个完整的意义单元,读者对整句话的信任,建立在它写得多好之上,而不是建立在其中每个嵌入事实是如何推导出来的之上。“毛利率下滑了 180 个基点,主要由于向低毛利率的企业级交易转移的产品组合变化”,这听起来像分析师的结论。无论 180 这个数字是真实的还是听起来合理的猜测,这句话都带着同样的权威语气。
这是语言模型特有的一种已知失效模式。当模型被要求“解释这一差异”来自一份预算文件时,它并不是在检索一个数字,而是在根据训练数据中类似句子的模式,预测最可能出现的一系列词。多数时候这会产生接近正确的结果,因为财务评论遵循可识别的模式,而模型见过大量此类文本。但“多数时候”不是任何人会接受作为电子表格公式标准的东西,也没有原则性的理由,仅仅因为一句话读起来流畅,就接受它同样的标准。
一个能暴露差距的买家测试
你不需要一份基准测试报告,也不需要供应商的一面之词。你只需要花三十秒在你正在评估的产品上做一件事。
- 在工具内生成一段 AI 差异或董事会评论。
- 挑出散文中嵌入的任意一个数字。
- 尝试点击它,或要求工具显示它的来源。
- 看看会发生什么。
有三种可能的结果,而它们能清晰地把供应商分门别类:
| 结果 | 意味着什么 |
|---|---|
| 该数字链接到具体的账本行、账户或已提交的报表 | 该数字是被检索或计算出来的,然后被插入到围绕它撰写的散文中 |
| 工具只显示一个笼统的“来源:你的 ERP”提示,没有行级追溯 | 来源存在于系统层面,但不存在于数字层面,你无法证明这个具体数字 |
| 什么都不会发生,该数字只是文字 | 该数字没有可追溯的来源。它可能是对的,但你没有办法在不亲自重新推导的情况下知道 |
第三种结果比买家预期的更常见,因为评论生成功能常常是作为便利特性附加在聊天或分析层之上的,底层模型拿到一份粗略的数据集和一句“写一段评论”的提示词,而不是引用的义务。工具自己的文档甚至可能间接承认了这个差距,把“财务人员审核以确保准确性”包装成防护措施:期望由人工在错误上线前发现问题。这不是没有意义,但它悄悄地把整个验证负担转移回了那个本应因为这款工具而节省时间的人身上,而且它依赖于这个人在没时间从头重新推导的情况下,注意到一段自己没写的段落中一个看起来合理的错误。
为什么“让财务审核一下”不等同于有据可查
人工审核是一种真实的管控手段,但作为结构化引用的替代品,它是薄弱的,原因很简单:审核力度会随怀疑程度而增减,而流畅的散文不会触发怀疑。一名审核人员在扫描一段文字寻找错误时,寻找的是读起来不对劲的东西,一个不合理的数字,一个与自己记忆相矛盾的说法。而一个仅仅略微偏差的错误数字,嵌在其余部分都正确、且审核人员本来就半预期会看到的差异说明中,正是一句自信满满的句子最擅长在深夜十一点、董事会开会前蒙混过一个疲惫读者的那种错误。
对比一下电子表格如何强制验证:一个公式要么引用一个单元格,要么是硬编码的数字,任何审计这份表格的人都能在几秒钟内追溯这个引用。没有嵌入引用生成的评论,移除了这道结构性检查,取而代之的是“应该会有人注意到”。这是一种以写作特性作为包装的验证标准降级,值得被直接点明,而不是想当然地以为它显而易见,因为从外部看,一个格式精美的 AI 评论面板和一个真正带有引用的面板,在你点击之前看起来是一模一样的。
逐行引用的评论真正需要什么
解决这个问题不是一个提示词技巧。它需要重构模型被允许做什么,而不只是被要求做什么。
差异叙述中的数字(百分比变动、金额差值、期间对比),必须在任何语言模型接触之前,由一个确定性引擎从一个已经与账本核对平账的模型中计算出来。rexfin.ai 底层可靠的建模层 的存在,正是为了让差异数学、同比变动、阈值标记都成为对已核对数据的算术运算,而不是语言生成。一旦这个证据区块存在,模型就可以撰写衔接性的散文(“主要由于”“部分抵消了”),但只能基于已经计算好的数字,绝不能凭空编造。一道引用真实性检查随后会拒绝任何引入证据区块中不存在的数字的草稿,这与支配着 Rexfin 产品导览中关于有引用的 AI 叙述的文章 和 精确到页的引用 的纪律是一致的,后者能让读者把任何数字点击回它在报表中的原始来源页面。
这与让 自动化差异评论真正有用而非真正有风险 的那种分工是同一件事:模型负责写作,引擎负责计数,两者的角色永远不会互换。一个无法描述这种分工的供应商,其评论功能只能指向下游的人工修改作为防护措施,也就是说,他们没有把引用构建进生成过程本身。他们造出了一段文字,然后寄希望于有人能抓住错误。
购买前该问的问题
如果一款供应商的评论功能是你评估的核心,以下四个问题能把结构化引用和寄希望于运气的安全网区分开来:
- 我能否点击生成段落中的任意一个数字,看到它确切来自哪一行账目或哪一份已提交的数字? 不是“来自系统”,而是具体到行。
- 如果模型找不到一个可引用的数字来支撑它想表达的说法,会发生什么? 诚实的答案是它会拒绝作答或回退到模板,而不是照样用它手头最好的猜测写出这句话。
- 当评论被导出到幻灯片时,同样的引用检查是否依然运行,还是只在实时应用中运行? 一个在屏幕上可点击、但在 PDF 董事会材料中无从溯源的数字,只解决了一半问题。
- 评论中的计划或预算数字,是否与经审计的实际数字有不同的标注? 未经审计的输入在叙述中出现时,应该读起来与已提交的数字不同,而不是混入同样自信的句子里。
如果一场演示无法针对你自己的数字,现场回答这些问题,那么文档里那句“财务人员审核以确保准确性”所承担的责任,已经超出了它应有的分量。
结论
流畅的散文不是数字有据可查的证据,它只是模型语言流畅的证据。判断 AI 撰写的评论是否值得信赖的测试,不在于它读起来多好,而在于其中的数字能否经受住一次点击的检验。叙述生成需要和财务报表同等严格的引用纪律,而不是更宽松的标准,因为风险不在于这段散文缺乏说服力,而在于无论它是否正确,它都同样有说服力。
所属专题 财务数据中的 AI 幻觉:阻止 AI 凭空捏造数字