当一份申报文件无法被引用时:Rexfin 不会跌破的提取底线
当一份扫描件或质量退化的申报文件无法被读到 Rexfin 的证据标准时会发生什么:这个数字不会上线,产品会明说,而不是靠猜。
作者 The Rexfin team
Rexfin 展示的每一个数字,理应都是可引用的,能追溯到具体的申报文件和具体的页码。在一份干净的数字化 PDF 上,这是一个很直接的承诺。但在一份扫描件上,比如一份低分辨率的法定申报文件、一份传真质量的年度报告、一页版式已经退化到连一位细心的分析师都会眯起眼睛才敢信任其中数字的页面,这个承诺就难得多。Rexfin 对这种困难的回应,不是更努力地尝试、寄望读得对,而是设定一条底线:低于这条线,一个数字就不会成为一项可引用的事实,不论屏幕有多想显示点什么。
为什么一次读取还不够
在数据摄取过程中,一页内容可能由不止一个独立的提取引擎读取。只有当其中至少两次读取收敛到同一个数值时,该数值才会被提升为存入数据库、带有引用来源的事实。仅由单一引擎读取的数字,不管它在页面上看起来多么合理,都过不了这道门槛。它不会被展示,也不会进入下游的核对或算术校验环节。它不会被放入某个较低置信度的层级,而是直接被丢弃。
原因不是为了谨慎而谨慎。单一引擎对一个印刷数字的读取,可能在一处是对的,在另一处是错的,而仅凭这次提取本身无法判断是哪一种。同一条报表科目,由同一个单一引擎在同一份申报文件的两个对比期间分别读取,可能在一个期间落在正确的数字上,在下一个期间却落到了相邻科目的数值上,同样的流程,同样看起来的置信度,结果却截然相反。在提取那一刻,一次正确的单引擎读取和一次错误的读取看起来是一样的。这正是设置这道底线的理由所在:当对和错无法分辨时,唯一站得住脚的做法就是把两者都扣住,直到有第二次独立读取给出一致结果。
页面上对齐了,不代表其背后的一切都过关
即便一份申报文件印刷的小计确实能够对上,也就是各个组成部分加起来正好等于印刷出来的数字,这也不足以自动让与该合计相关的一切都保持可引用。Rexfin 的检查关注的是一个合计是由什么构成的,而不仅仅是加总是否对得上。如果支撑一个已核对合计的恒等式中,哪怕只有一个组成部分从未通过一致性底线,那么这个合计的引用也会被撤回,即便算术本身是对的。一个数字在页面上可以加总正确,却依然不可引用,只要它所依赖的信任建立在一个从未真正赢得这份信任的数值之上。
对于缺口而非错误,还有一条对应的规则:当某个组成部分因为触碰了底线而被扣住时,Rexfin 不会为了让某项检查得出结论而代入一个默认值,比如把一个缺失的数字当作零处理。一个被扣住的输入会让相应的检查处于未解决状态,而不是在没人要求的假设下悄悄通过或悄悄失败。
与人工录入的答案比对,而不是靠一个充满希望的形容词
这条底线本身不是靠断言得出的,而是靠测量得出的。提取结果会与黄金数据比对,也就是从真实申报文件中手工录入的报表科目和印刷小计,作为页面实际内容的参照答案,而这些比对结果决定了一个数值是否真正有资格被称为可引用。这与答案质量评估背后是同一套评分纪律:对照一个已知答案来检验,而不是凭信任接受。
你看到的不是一个错误的数字,而是这个
当一个问题依赖于一个从未通过底线的数字时,Rexfin 不会用一个编造出来的数字或者一个包装成答案的模糊说法来掩盖这个缺口。它会明确地说,这个数字没有可引用的证据支持,这与引用或拒答中描述的失败即拒答立场是一致的。这里的拒答不是一个 bug 报告,而是系统在申报文件没能给它足够诚实依据时,恰恰做了它该做的事。
这适合谁
适合任何曾经拿到一个看似自信满满的数字,后来才发现源页面是一份没人复核过的糟糕扫描件的人。如果你的工作不仅需要知道一份申报文件写了什么,还需要知道 Rexfin 对自己是否读对了有多大把握,那么这一层正是在数字触达你之前划定这条界限的地方。想了解它如何与整个流程的其他部分衔接,可以查看分支概览,或者预约演示,看看一份真正质量低劣的扫描件经过数据摄取之后,最终有哪些数字能够通过。