点击任意数字,直达原始页面:溯源抽屉
在 Rexfin 中,点击一个实际单元格会打开数字所在的确切原始 PDF 页面,并圈出该数字,这不是一条引用,而是文档本身,在渲染前经过重新校验。
作者 The Rexfin team
大多数号称具备“可追溯性”的工具,指的其实是一个公式检查器:点击一个数字,查看是哪些单元格汇入了它,或许还能下钻到总账交易或其背后的假设。这一切都止步于系统对该数字的内部记录本身,没有一个能回答一位持怀疑态度的董事会成员或审计师真正会问的问题:让我看看这个数字来自哪一页。
Rexfin 给出的是字面意义上的答案。点击一个有来源的单元格,溯源抽屉会打开该数字实际提取自的那一页 PDF 原文,并把确切的数字在页面上圈出来。
点击后会打开什么
抽屉是一个单一的侧边面板,但它会同时解析四件事。第一,原子明细卡:打印出的数值、货币和单位比例(例如,以千迪拉姆为单位)、期间,以及该数字属于合并实体还是母公司实体。第二,一条对账信息,显示该数值是否仍与报表网格当前展示的内容一致,以及母公司小计是否平衡。第三,一个后端一致性徽章,显示有多少个独立的提取引擎从这一页读出了同一个数字,这正是多后端一致性校验背后那个具体的置信度数字。第四,一张链路图:一条从页面上的来源区域,到提取出的数据点,到报表行,再到你所点击单元格的简短可视化路径。
如果点击的是一个小计而不是一条明细行,抽屉不会只展示一个原子,而是会展开为构成它的每一个组成部分,每一个都可独立下钻。
这个页面是渲染出来的,而不只是一个链接
这项功能的早期版本只展示元数据和一个“打开该页”的链接,那是一种只说不做的问题。现在抽屉会直接内联渲染实际的原始 PDF 页面,取自那些已经过哈希校验的同一份字节数据,并通过在页面文本层中匹配确切的打印文本来圈出被引用的数字。如果像”4,914,644”这样以空白分隔的数字组旁边带有一个脚注引用符号,圈选依然会落在正确的数字上,因为匹配要求数字位数完全一致,所以一个较短的引用编号不会被误认成你点击的那个数字。
在该页面被展示之前,客户端会独立地对获取到的字节重新计算哈希,并与可信的文档哈希进行比对。如果哈希不匹配,该页面就不会渲染,你会得到一个明确的“完整性校验失败”状态,而不是一个看似已校验、实则未必可信的页面。这弥补了一个缺口:同一份文档若以不同方式提供服务,原本可能在未经重新校验的情况下,依然顶着一个绿色徽章渲染出来。在浏览器端哈希 API 不可用的纯 HTTP 连接下,渲染仍会基于服务端自身的判定结果继续进行,这项额外校验是增量能力,而不是基本使用的隐藏前提。
你得不到什么,以及为什么这正是重点
建模或预测的单元格永远不会打开抽屉。一个假设不存在可展示的“来源”,所以这个交互入口干脆就不存在,不会有捏造的引用,也不会有假装是来源的模糊“估算”标签。如果底层原子无法解析,抽屉会明确说明并给出该原子的 id,而不是悄悄地把单元格数值当作有来源的数据展示出来。如果某个数字自模型建立以来经过重新提取而发生了偏移,你会得到一个过期警告,而不是一个虚假的绿色对齐提示。
访问权限在各处都以同样的方式受限:如果你看不到某份文档所在的文件夹,抽屉就会拒绝渲染其内容,不显示数值,不显示页面,也不透露该文档存在的任何迹象,即便你能在网格本身中看到该单元格的数值也是如此。这种拒绝发生在服务端,而不仅仅是界面层面,因此一个精心构造的请求同样无法绕过它。
为什么这是整条信任链的关键所在
一个能够对账、却无法追溯到文档的数字,依然只是一句声明。一个能够追溯到 PDF 页面、但提取过程未经独立校验的数字,依然只是单一解析器的一家之言。抽屉正是这两者相遇的地方:一个已对账的数字,紧挨着它所来自的页面展示出来,并且实时校验到字节层面。这正是“信任我们的工具”变成“你自己去核对这一页”的那一刻,同时也正是董事会材料导出在离开模型之前必须通过的确切证据。想了解信任链其余部分如何与这个抽屉相连,请从产品导览枢纽页面开始。