跳到正文
新功能:向 Rexfin 分析师智能体询问你的模型,每个数字都附带出处
· 阅读约 6 分钟

把打印出来的标签,变成真正可比的概念

Rexfin 通过人工核验的映射词典,将每一条报表行项目对应到稳定的 IFRS 分类概念和标准谓词,使跨公司、跨年度、跨语言的比较真正成立。

作者 The Rexfin team

两家公司都把某一行报为“物业、厂房及设备”。第三家称之为“固定资产净额”。第四家把它拆成两行,而第五家把这两行合并为一行。这些标签背后,可能指向同一个概念,也可能不是,一个把标签文字当作事实来源的 AI 工具,会毫不犹豫地把不该放在一起比较的东西比在一起。Rexfin 不比较标签,它比较概念。

标签实际做了什么

公司主表(资产负债表、利润表、现金流量表)上的每一行,在录入时都会被映射到两样东西:来自 ifrs-full 分类体系的 taxonomy_element,以及 Rexfin 内部用来识别该行“到底是什么”的标准化 canonical_predicate,与申报方如何措辞无关。“固定资产净额”和“物业、厂房及设备净额”落在同一个谓词上。而像“非流动资产合计”这样的小计,会拥有自己独立的谓词,而不是默默继承其组成项之一的谓词,这一点比听上去更重要:一个小计和它包含的某个行项目共用同一个谓词,恰恰是重复计算悄悄混入无人复核的汇总数据的方式。

这套映射依靠的是人工核验的词典,而不是模型临时猜测同义词。这是刻意设定的约束:标准谓词是一种承诺,承诺同一个数字无论出现在何处都表示同一件事,而这个承诺只有在映射被人核实过、而非每次遇到新申报文件的措辞就临时推断出来时,才真正成立。

未标签的数字,就是被拦下的数字

Rexfin 的录入规则是:没有非空分类标签和标准谓词的主表数字,根本不能被写入模型。这听起来很严格,而它本就该如此。另一种做法,即让未映射的数字带着一个最佳猜测的标签留在模型里,恰恰是那种表面看起来没问题、直到有人在其上做比较或画趋势线才发现结果悄悄出了错的软性失败。“零人工录入”只有在每个进入模型的数字都已被解析为经人核实的概念时才有意义,而不是被算法在时间压力下临时拼凑出来的概念。

为什么这是可比性真正依赖的一层

这一步标签处理,正是让快速公司对标得以实现的原因,无需有人先手动核对标签措辞的差异。它也是带引用的 AI 回答在说出“这是总资产”时实际引用的对象:AI 并不是把你的问题去匹配某页原始文本,而是匹配标签步骤已经解析好的标准谓词,再回指到背后被引用的确切数字。

分类元素还随映射一起携带 IFRS-18 类别和营业利润小计状态的元数据。这一点很重要,因为 IFRS-18 改变了营业利润及其小计在利润表主表上的呈现方式,而这次转换所需的比较期数据,需要在新的分类方式下依然成立,而不必从头重新提取申报文件。在标签环节就携带这些元数据,正是让公司的历史报表在新的列报要求生效时依然可用,而不必在准则生效那一年被迫重新录入的原因。

目前的真实覆盖范围

目前阶段,该词典覆盖了利润表、资产负债表和现金流量表上进行干净、无重复计算映射所需的全部主表行项目,是逐个概念核实过的,而非假设出来的。要把同样的严谨程度扩展到覆盖整个 IFRS 词汇表的评分模糊匹配,让某个异常或高度定制化的标签无需先由人添加到词典中就能找到对应概念,这属于后续阶段的工作。在实现这一点之前,申报方为某一行发明的、无法与词典中任何内容干净匹配的异常标签,正是 Rexfin 宁愿标记出来、也不愿强行映射的情况。

谁会用到这个功能

任何构建跨公司或跨年度比较、曾被两份申报文件用不同措辞描述同一行、或用同一措辞描述两个不同事物所困扰过的人。如果你的分析依赖于“总资产”在模型中每次出现时都表示同一件事,这一步就是让这一点真正成立、而非只是假设成立的关键。它紧接在文档接入与分类之后,并为产品导览中的其他一切提供支撑。

所属专题 Rexfin 产品导览:每一个数字都可追溯

继续阅读

预约演示

亲眼看到您的数字对得上账。

预约一场 30 分钟的演示。带上一个您总是无法快速回答的问题,我们将基于真实财务数据现场为您建模。