跳到正文
新功能:向 Rexfin 分析师智能体询问你的模型,每个数字都附带出处
· 阅读约 6 分钟

从 PDF 落地到已归类的报表:Rexfin 如何读入一份文件

Rexfin 为每份报表生成一个稳定的 ID,区分扫描页和数字页,并按标题和期间定位每张报表,否则宁可拒收文件,也不猜测。

作者 The Rexfin team

把一份 10-K 年报、一份年度报告或一份扫描的法定报表丢进大多数财务工具,得到的是一个黑箱:有些页面被读取了,有些数字出现了,却完全看不到工具究竟判断某一页是什么内容的依据。Rexfin 的接入环节恰恰相反,在任何一个数字被允许进入模型之前,每份文档都会先获得一个身份、一个分类和一份逐页地图。

每份文档永久拥有一个身份

PDF 首先经历的不是提取,而是身份识别。Rexfin 把文件的字节哈希成一个内容寻址的 doc_id,同一份 PDF 被两个人在两天内分别上传两次,会解析到同一个 ID,而不是生成一条重复记录。这个 ID 与页码配对,成为产品其他每一部分都会指回的引用地址:报表网格中数字上的标记、溯源抽屉里的来源链接,统统追溯到 (doc_id, page)

伴随这个 ID,接入环节还会捕获报表本身的元数据:货币、报告单位规模、是否经审计、声明依据哪套会计框架,以及来源。这些都不是后续根据上下文推断出来的,而是在入口处直接从报表本身读取的。

无论是数字文件还是扫描件,都必须先定位到具体页面

不是每份报表都有可用的文本层。有些是带有干净嵌入文本的数字 PDF;有些是完全扫描的图片,没有任何机器可读内容;还有越来越多的报表处于两者之间,比如一份数字封面页后面跟着扫描版的报表页面,或者一段英文内容被埋在几十页阿拉伯文之后。接入环节会先判断自己面对的是哪种情况,再决定如何读取。

对于数字页面,资产负债表、利润表、其他综合收益表、权益变动表、现金流量表等报表区域,是通过锚定的标题文本加列上方的期间横幅来定位的,这样定位的目标是“某张报表”本身,而不是一个固定页码,固定页码会在报表版式一变就失效。对于扫描页面,同样的区域是通过对每一页的标题带做 OCR 来定位的,并采用不关心词序的词匹配方式,因为扫描标题的 OCR 结果经常被打乱顺序。一份双语年报,其英文报表页埋在文档几十页之后、一大段阿拉伯文内容的后面,正是这套机制专门为之设计的版式,只要某张必需的报表仍未找到,接入环节就会继续扫描下去,而不是止步于一个固定的页码窗口。

默认动作是拒收,而不是猜测

大多数导入流程的本能反应是“提取点什么总比什么都没有强”。Rexfin 的接入环节在没有把握时恰恰相反。如果一份报表的格式不匹配任何已识别的实体档案,或者某一页无法通过真实的标题匹配来分类,它会被隔离,而不是被硬塞进某个区域。一页顺带提到了“现金流量”的扫描版附注页,不会被粘到真正的现金流量表上,分类器要求出现实际的标题词,并排除任何带有附注标题的内容,这正是为了防止一个看似合理的错误匹配打开一个本不该存在的区域。

同样的“失败即拒收”原则也适用于财政年度本身。报表中通常带有比较年度和前任审计师的日期,如果只取封面页上的第一个日期,这些日期看起来可能就是报告年度;接入环节会取最新的、合理的十二月年末日期,而不是十二月年末的日期则会被拒绝,而不是被猜测。

为什么这一步在你看到任何数字之前就至关重要

如果接入环节把页面判断错了,下游的一切都不可信。多后端提取环节负责读取一页上的数值,而它的前提是首先读取到正确报表的正确页面。IFRS 分类标注把一个印刷标签转换成一个规范概念,而它的前提是这个标签是从一个被正确识别的报表页面上提取出来的,而不是来自一条散落的附注,或一列被错误标记为当期数据的比较列。

这也是无需每次都从头重来就能实现多年度分析的原因:因为接入环节把每份报表绑定到它实际所属的财政年度,而不是一个写死的年度,同一套流程才能在多个年度间持续保有可引用的实际数据,而不需要每个报送季都重新搭建一套定制方案。

这适合谁

任何见过财务工具信心满满地把一列比较数据误标为当年实际数据,或从一页被误认成资产负债表的附注页中提取数字的人。如果你需要确信“2024 财年收入”确实来自 2024 财年的利润表,而不是来自某个扫描出的错误结果,接入环节就是在你看到这个数字之前完成这一切核查的那一层。想了解它如何与整条流程相连,可访问产品导览首页,或预约演示,现场观看一份扫描的双语报表如何完成接入。

所属专题 Rexfin 产品导览:每一个数字都可追溯

继续阅读

预约演示

亲眼看到您的数字对得上账。

预约一场 30 分钟的演示。带上一个您总是无法快速回答的问题,我们将基于真实财务数据现场为您建模。