不是整份文件:为什么 Rexfin 的每一条引用都指向一个具体页面
Rexfin 的引用从不只是标注一份来源文件的名称。在每一个圈选出的数字和每一条 AI 答案背后,都有一个定位索引和一个自我校验的分块语料库,它们不允许任何引用解析为低于一个页面、一个具体位置的东西。
作者 The Rexfin team
问大多数财务工具一个数字的出处,你得到的回答是一个文件名。“2024 年年度报告。”如果幸运的话,还会有一个页码,是构建该模型的人手动输入的,而且往往在文件重新分页的那一刻就已经过时。这是指向一个文件夹的引用,而不是指向证据的引用。它告诉你从哪里开始找,而不是你找到之后会看到什么。
Rexfin 把“第 42 页”当作一个起点,而不是一个答案。每一条引用,无论是报表网格中的一个单元格,还是 AI 聊天答案中的一行文字,都会解析到一个具体页面,以及该页面上一个具体的位置。这种精确性并非表面功夫。它由两套独立的基础设施构建而成,二者必须相互印证,一条引用才被允许存在。
生产端:一个页面,一份稳定的产物
在一份文件可以被引用之前,其中每一页都会被转换成属于自己的规范产物:一份稳定的、页面级别的渲染结果,无论被重新处理多少次,都会得到字节级一致的输出。这种稳定性远比听起来重要:如果对同一份 PDF 重新运行提取,每次都产出略有不同的页面,那么上周捕获的一条引用,可能会指向一个如今已与审阅者看到的内容不再匹配的页面。
与这些规范页面并列存在的,是一个定位索引。它的职责单一而明确:给定一份文件和一个页码,解析出该页面对应的规范页面产物,以及该证据在页面上的确切地址。这就是“这个数字在第 42 页的某处”与“这个数字在第 42 页这一具体渲染结果的这一位置”之间的区别,而这种区别只有在你真正需要把页面展示给别人时才会显现出来。这正是在溯源抽屉中点击一个被引用的单元格时所发生的事。抽屉不会去猜测数字位于页面的哪个位置;它会向定位索引发起查询,而后者早已根据页面自身的几何结构算出了答案,即通过重建行结构、并锚定在列标题上,而不是假定某个数字每次都会出现在同一个位置。
消费端:一个无法宽松引用的问答引擎
报表单元格是一回事。AI 聊天答案更难以精确定位,因为它取材于叙述性披露和附注,即三张主表之外的材料,而不仅仅是网格中的数字。这正是聊天背后那个被引用过的分块语料库存在的原因:一条条检索记录,每一条都锚定到一个标明文件和页码的引用,涵盖封面附注和叙述性披露,以及问答引擎进行推理所需的分类和摘要信息。
真正保证这一切诚实可靠的,是一个写入时的校验机制:每一个分块的引用在被允许进入语料库之前,都会与规范页面索引进行比对。一个引用无法解析到真实页面的分块,不是一条带有小瑕疵的引用,而是被当作缺陷剔除在外。建立在这个语料库之上的 AI 答案,只能引用已知存在且已知可达的页面,因为任何不具备这一保证的内容,都无法进入问答引擎可以引用的内容池。
为什么文件本身不是关键的计量单位
一条只标注文件名、不标注页码的引用,要求你信任摘要本身。一条只标注页码、不标注位置的引用,要求你相信自己能在页面上印着的诸多数字中找到正确的那个。二者都不是验证,归根结底都还是别人的一面之词。Rexfin 的引用是从能够被实际核实的最小单位反向构建起来的:一个具体页面的一份具体、稳定的渲染结果上的一个具体位置。下游的一切,抽屉里被圈出的数字、聊天答案中可解析的一行文字、你最初看到的网格单元格,都是建立在这个单位之上,而不是围绕它拼凑出来的。
关于这如何与整个信任链条相契合,请参阅产品导览中心。