Rexfin 如何衡量答案质量(而不只是宣称它)
Rexfin 让每个 AI 答案都接受一套分级测试集的检验,评分标准包括引用准确性和拒答行为,任何导致质量倒退的发布都会被拦截。
作者 The Rexfin team
每一家 AI 财务供应商都会说某个版本的“你可以信任我们的答案”。但几乎没有人能说清楚他们是怎么知道这一点的,除了某次演示效果不错。这正是本文要讨论的差距:断言可靠性,与持续地衡量可靠性,让一次糟糕的更新无法悄悄蒙混过关,这两者之间的差距。
Rexfin 对其 AI 答案的核心承诺表述简单,但很难作假:每一个数字类主张,要么有真正支撑它的引用,要么 AI 就拒绝作答。我们内部也不会仅凭信任接受这一承诺,而是把它当作一套分级测试来运行,就像测试任何一个必须在压力下正确运作的软件一样。
实际评分的内容
测试集是一个由真实问题组成的题库,这些问题针对真实的、经过预设的财务文件提出,是 CFO 或分析师真正会问的那种问题,被划分为资产负债表数据、现金流、比率、披露查询等类别,还有一个刻意设置的类别,专门包含文件确实没有回答的问题。每个问题都配有人工核实的正确答案:准确的数值、它出自的确切页码,以及,对于文件未涉及的问题,确认该数字确实缺失,而不仅仅是难以找到。
AI 产生的每一个答案都会同时在多个维度上接受检查。数字对不对?是否有引用,并且这个引用是否确实指向支撑它的证据,一个正确的数字如果没有可追溯的引用,算作失败而非通过,因为无支撑的数字正是这整套系统存在的目的所要防止的失败模式。而对于那些文件中确实没有答案的问题,AI 是否正确地拒绝了作答,还是自信地编造了一个数字?后一种情况,也就是在本应拒答的问题上捏造出一个数字,被视为该测试框架能检测到的最严重的结果,因为那正是最终会在董事会材料里出错的数字。
为什么一个混合评分会掩盖问题
一个“92% 准确率”的单一头条数字可能隐藏很多东西。完全有可能利润表相关的查询把整套测试集的平均分拉到一个看起来还不错的水平,而现金流相关的问题,因为需要正确整合多个数字,私下里表现得差得多。因此结果会按类别拆分呈现,而不是只报告一个数字,并且最薄弱的类别会被明确指出,而不是被平均掉。这在实践中很重要:一个专门询问现金流数据的尽职调查团队,得到的是关于现金流数据的答案,而不是与更容易的问题混合过的数字。
这套测试框架还会检查超越精确数字之外的一个层面:AI 周围的评论,也就是围绕某个数字的叙述性句子,是否真的源自它所引用的证据,而不是用自信的语言包装出一个无支撑的主张。这正是竞争对手的“AI 洞察”功能最容易暴露问题的失败模式,因为一个叙述性的主张不会像错误数字那样明显地出错。
每次变更都会运行,而不只是运行一次
衡量这件事的意义不在于制作一份只出现一次的报告放进演示文稿里。它被嵌入到产品发布变更的同一个流程中:对检索、提示词或底层模型的任何改动,在合并之前都必须先跑过这套测试集,如果引用准确率或拒答正确率跌破约定的下限,该变更就不会发布。一次悄悄让 AI 变得不太愿意拒答的重写,也就是用一个自信的猜测取代安全的“我没有这个数据”,会在到达任何人的董事会材料之前,在这里被拦下,而不是事后才被发现。
诚实的局限
这并不意味着 AI 永远不会犯错,而是意味着错误被衡量、按类别追踪,任何倒退都会在发布前被发现,而不是由客户发现。这也依赖于测试集本身持续锚定在真实文件和确实缺失的数字之上,这本身就是一门功课,参见规范原子存储了解底层事实最初是如何锚定到源文档的,以及校准与信任调优了解同样这种以证据为先的衡量方式如何决定一项检查何时有权阻止导出。
结论
“信任我们的 AI”是一句话。一套在每次变更时都评估引用准确率和拒答行为、并会拦截任何导致其中一项倒退的发布的测试套件,才是证据。如果你想看看一个答案的证据和判定被保留下来供日后查看会是什么样子,请阅读答案审计日志,或前往平台内部分类页了解这一切是如何拼接在一起的。