文鉴智检平台核心技术解读(1)-文档目录解析
一、背景知识
文鉴智检平台经常要处理长文档。长文档中的信息通常是稀疏分布的,直接对整个文档进行信息抽取(如实体识别、关系抽取)效率极低。目录(Catalog)作为文档的骨架,能够自然地将文档切分为语义段落,从而大幅缩小搜索空间。然而,大多数文档以纯文本或PDF图像形式存在,目录结构并不直接可用。传统方法依赖正则表达式等手工规则,但面对来源多样、格式各异的文档时完全失效。因此,目录提取(Catalog Extraction from Documents, CED) 成为一个文档解析亟待解决的任务。
本文首次提出CED 文档目录抽取任务:将 OCR 碎片化文本解析为层级目录树,作为长文档信息抽取前置预处理步骤。
二、数据集 ChCatExt 构建
本文搭建首个中文标注目录数据集 ChCatExt,包含 650 份人工标注文档:招标公告(结构简单)、财报公告(标题样式繁杂)、信用评级报告(层级最深、篇幅最长);另收集 21 万 + 带目录维基文本用于预训练,模拟 OCR 文本分段缺陷适配真实业务场景。
三、核心模型 TRACER
本文提出 TRAnsition-based Catalog trEe constRuction (TRACER) 框架,将目录树构建建模为基于转移的解析过程。
1. 四大转移动作
模型维护栈 S(已构建目录树)与输入队列 Q(文本片段),通过 4 类动作迭代生成树结构:
1. Sub-Heading:当前片段为子标题节点
2. Sub-Text:当前片段为正文叶子节点
3. Concat:合并被 OCR 拆分的同一段落
4. Reduce:回退至上层目录节点 同时增加语法约束,避免生成非法树形结构。
2. 网络结构
采用轻量中文全词掩码 RoBERTa(RBT3)编码栈顶节点与输入片段,拼接后送入两层 FFN,Softmax 输出动作概率,交叉熵损失训练。
四、实验结果与核心结论
TRACER在ChCatExt上取得82.39%的整体F1,显著优于Pipeline(77.09%)和Tagging(78.27%)基线。关键发现:
- 结构关系优于直接预测层级:TRACER关注节点对的结构关系,而非直接预测深度标签,因此更灵活
- 约束有效:去除约束后F1下降0.79%,说明模型本身已较鲁棒
- 迁移学习:在维基百科上预训练的WikiBert在小样本场景(k=3~10)下表现优异,23/27组迁移实验中优于基线
五、总结与展望
本文贡献:提出全新 CED 任务、开源首个中文目录抽取标注数据集、设计首个无人工规则的转移式目录解析模型 TRACER,大幅降低长文档结构化成本。 局限与未来方向:仅对比相邻节点,缺失全局结构信息;维基预训练无法提升域内完整数据效果;后续可引入全局历史特征,优化深层嵌套目录识别精度。全文聚焦金融、招标等中文业务文档结构化,为智能文档处理(IDP)提供前置结构化解决方案,相关技术已经成功运用于文鉴智检平台,提高文档解析的成功率。文鉴智检平台通过这一技术成功解析国内学位论文模板规范(1000+以上高校),支持论文自动检测与修正。
数据集与代码已在github开源https://github.com/Spico197/CatalogExtraction,欢迎使用。