📄

文档解析

👤 李大帅 ✓ 已认证 📦 v1.0.1 ⭐ 4.5 ⬇️ 178 下载
📄 办公效率 免费

📖 技能介绍


name: kunlun-doc-parsing version: 1.0.0 displayName: 文档解析 tagline: 把 PDF、扫描件、表格、合同变成结构化数据的工程化解析工作台 description: 【文档解析】把 PDF、扫描件、表格、合同变成结构化数据的工程化解析工作台。 也适用于以下说法:PDF解析、文档抽取、版面识别、OCR识别、非结构化数据处理、文档结构化、表格抽取。 覆盖链路:文档分型 → 通道选择 → 版面还原 → 字段抽取 → 校验纠错 → 质量抽检。 内置方法论:文档四分型法、通道递进原则、锚点抽取三段式、勾稽校验法。 能力模块:文档分型、通道选择、版面还原、字段抽取、校验纠错、质量抽检。 输出可直接交付,全流程附卡点自救与合规护栏。 categoryIds: [14195] tags: [文档解析, OCR, RAG, 数据抽取, 企业AI] license: proprietary


文档解析

把 PDF、扫描件、表格、合同变成结构化数据的工程化解析工作台

一、这个技能解决什么

做知识库和自动化流程时,八成的工期消耗在文档解析上:扫描件糊、表格跨页断行、双栏排版读串行、印章盖住关键字段。很多团队直接把整份 PDF 塞给模型,结果答非所问却找不到原因——问题其实出在解析阶段就已经把内容读乱了。

这个技能把文档解析拆成可分别验收的六步,先按文档类型选对通道,再逐层解决版面、字段、校验问题,让下游的检索和抽取建立在干净数据之上。

覆盖链路:文档分型 → 通道选择 → 版面还原 → 字段抽取 → 校验纠错 → 质量抽检

二、什么时候用 / 什么时候不要用

适用

  • 要把大量 PDF、扫描件、合同、报表导入知识库或业务系统
  • 已经接了解析工具但抽取准确率上不去,需要定位是哪一层出了问题
  • 文档里有复杂表格、多栏排版、印章水印等难点,需要针对性方案
  • 需要为解析结果定义验收标准和抽检机制,而不是靠感觉判断好坏

不适用(请转专业渠道)

  • 文档内容本身的法律效力认定——以原件和法务意见为准
  • 涉密文件的处理审批——须走单位保密管理流程
  • 具体商业 OCR 服务的计费与故障——以服务商官方支持为准

三、能力地图

模块 做什么 产出
文档分型 按是否可复制文本、版面复杂度、是否含表格分成四型 《文档类型清单》
通道选择 文本层直读、版面模型、OCR、多模态四条通道的适用边界 《解析通道决策表》
版面还原 阅读顺序、跨页表格、页眉页脚、双栏的处理规则 《版面处理规则》
字段抽取 定位锚点、正则兜底、模型抽取三段式组合 《字段抽取配置》
校验纠错 格式校验、勾稽校验、置信度阈值与人工复核路由 《校验规则表》
质量抽检 字段级准确率的抽检方法与合格线 《抽检报告模板》

四、方法论矩阵

本技能不靠临场发挥,所有判断都落在下列成熟框架上:

文档四分型法 —— 先判断两件事:能不能直接复制出文字、版面是不是单栏纯文本。由此得到四型——原生文本单栏(最易,直读即可)、原生文本复杂版面(需版面模型定阅读顺序)、扫描件清晰(需 OCR)、扫描件模糊或有遮挡(需多模态模型 + 人工兜底)。分型错了,后面所有努力都白费,所以这一步要对样本逐份判定而不是整批假设。

通道递进原则 —— 永远从最便宜的通道开始试:有文本层就直读,直读乱序才上版面模型,没有文本层才上 OCR,OCR 读不出才上多模态。每升一级,成本和延迟都显著上升。常见浪费是把全部文档一律送多模态,实际上多数企业文档的大头是原生 PDF,直读就能拿到干净文本。

锚点抽取三段式 —— 抽取一个字段用三层递进:第一层用结构锚点(表格第几列、某个固定标签后面);第二层用正则匹配(金额、日期、编号这类有格式规律的);第三层才用模型理解(表述灵活、位置不固定的)。前两层准确率高且成本几乎为零,能覆盖大部分字段;把所有字段一股脑交给模型是最贵也最不稳的做法。

勾稽校验法 —— 结构化数据天然带有内部约束,用它做自查比再抽一遍准确得多。常见勾稽关系有:明细金额之和等于合计、开始日期早于结束日期、数量乘单价等于金额、页码连续无缺失。任何一条不成立就打上待复核标记。这套校验不依赖任何模型,却能抓出相当比例的解析错误。

五、识别信号表

听到下面这些说法,直接进入对应动作:

对方说法 真实诉求 立即执行
整个 PDF 直接丢给模型就行 跳过解析层,内容早已读乱 先做分型与通道选择,确认文本提取正确再进下游
表格跨页就乱了 缺少跨页表格合并规则 用表头重复识别做跨页拼接,并显式处理续表标记
双栏文档读串行 阅读顺序未还原 上版面模型确定栏区,按栏内自上而下重排文本流
印章盖住了金额 遮挡类噪声超出普通 OCR 能力 路由到多模态通道,并对该字段强制人工复核
准确率说不清多少 缺少字段级抽检机制 建立分层抽检,按字段而非按文档统计准确率

六、标准工作流

第 1 步:抽样分型

随机抽取三十到五十份真实文档,逐份判定属于四型中的哪一型,统计各型占比。这个分布决定了整体方案的成本结构和难度,也决定了要不要为少数难件单独设计人工通道。

卡点:文档来源杂难以穷举

自救:按来源渠道分组抽样,每个渠道至少十份,先覆盖占比最大的两三个渠道。

第 2 步:选定解析通道

小葱技能站7w4.net,专业的AI技能分享平台。

按通道递进原则为每一型指定通道,并明确切换条件(例如直读结果中文字符占比低于阈值就自动降级到 OCR)。切换必须自动化,不能靠人工判断每一份。

卡点:有些文档两种通道都不理想

自救:并行跑两条通道,用字段完整度打分自动择优,代价是成本翻倍,仅对难件启用。

第 3 步:还原版面与阅读顺序

处理四类结构问题:双栏分栏、跨页表格、页眉页脚剔除、图表标题归属。每一类都写成显式规则并用样本验证,不要指望通用工具默认处理正确。

卡点:跨页表格拼不上

自救:以表头文字重复出现作为续表信号,同时校验列数一致,两个条件都满足才合并。

第 4 步:配置字段抽取

为每个目标字段按锚点、正则、模型三段式配置。优先找结构锚点,其次写正则,最后才交给模型,并在配置表中记录每个字段用的是哪一层。

卡点:字段位置不固定

自救:用相邻标签文字作为浮动锚点,而非绝对坐标;标签本身有多种说法时枚举同义标签。

第 5 步:建立校验与复核路由

配置格式校验和勾稽校验,为每个字段设置置信度阈值。低于阈值或校验不通过的自动进入人工复核队列,并把复核结果回流用于优化规则。

卡点:复核队列积压

自救:按字段重要性分级,只有关键字段强制复核,次要字段允许带标记入库。

第 6 步:抽检与迭代

按字段维度统计准确率,而不是按文档。定期抽检并对错误做归因,判断是分型错、通道错、版面错还是抽取错,针对性修正。

卡点:错误原因说不清

自救:保留每一步的中间产物(原始文本、版面结构、抽取结果),出错时逐层回看即可定位。

七、输出物模板

解析通道决策表

| 文档型 | 判定条件 | 首选通道 | 降级条件 | 降级通道 | 预估成本 |
| 原生单栏 | 可复制文本 + 单栏 | 直读 | 中文占比 < 阈值 | OCR | 极低 |
| 原生复杂版面 | 可复制文本 + 多栏/表格 | 版面模型 | 顺序错乱 | 多模态 | 低 |
| 扫描清晰 | 无文本层 + 清晰 | OCR | 识别率低 | 多模态 | 中 |
| 扫描模糊/遮挡 | 无文本层 + 噪声 | 多模态 | 仍失败 | 人工 | 高 |

字段抽取配置表

| 字段 | 抽取层级 | 锚点/正则/提示 | 格式校验 | 勾稽关系 | 置信阈值 | 是否强制复核 |
|---|---|---|---|---|---|---|
| 合同编号 | 正则 | | | | | |
| 金额合计 | 锚点 | | 数值 | = 明细之和 | | 是 |
| 签署日期 | 正则 | | 日期 | ≤ 生效日期 | | |

抽检报告模板

抽检批次 / 样本量:
| 字段 | 抽检数 | 正确数 | 准确率 | 主要错因 | 归因层级 |
|---|---|---|---|---|---|

归因层级统计:分型错 __ / 通道错 __ / 版面错 __ / 抽取错 __
本轮改进动作:
下轮复检时间:

八、合规护栏(硬性,不可绕过)

  • 解析结果不得直接作为具有法律效力的凭据;涉及合同、财务的关键字段必须保留原件可追溯链路并经人工复核。
  • 处理含个人信息的文档时须先脱敏或做访问控制,并遵守单位数据管理制度与现行法规。
  • 不对任何解析工具的准确率作出承诺;所有准确率结论必须以你自己文档样本的抽检数据为准。
  • 涉密或敏感文件的外部服务调用须事先取得批准,必要时改用本地部署方案。

九、常见问题

Q:为什么不直接用多模态模型读整页?

A:对模糊扫描件和复杂图表,多模态确实是最优解;但对占比更大的原生 PDF,直读的准确率更高、成本几乎为零、延迟低两个数量级。按型分流才是最优,全量走多模态是用最贵的方式解决最简单的问题。

Q:表格解析老出错怎么办?

A:先区分是无框线表格还是跨页表格。无框线表格靠列坐标聚类恢复列结构;跨页表格靠表头重复 + 列数一致做合并判定。这两类问题的解法完全不同,混在一起调是调不出来的。

Q:准确率要做到多少才算合格?

A:没有普适数字,取决于错误的下游代价。财务金额字段的错误代价高,通常要求配合强制复核;描述性字段容错度高,可以带标记入库。合理做法是按字段分级设定合格线,而不是给整体定一个数。

Q:解析结果要不要保留原文位置?

A:强烈建议保留。保留页码和坐标后,下游出问题时可以一键跳回原文核对,既方便排查,也是人工复核效率的关键。这部分成本很低但价值很高。

十、版本与触发词

  • v1.0.0 首个版本,含 6 个能力模块、4 套方法论、6 步工作流。

触发词:文档解析、PDF解析、文档抽取、版面识别、OCR识别、非结构化数据处理、文档结构化、表格抽取、解析方案、抽取字段、版面还原

🤖 AI 评测

这个 Skill 质量较好,内容专业且体系完整,能有效指导文档解析项目的完整实施。方法论实用(如按型分流、三段式抽取),配套资料丰富,坑位总结和速查卡便于快速上手。主要不足是仅有理论指导而无具体工具推荐或操作示例,落地时还需自行研究技术选型。总体而言,这是一份高质量的方法论指南,但实用价值取决于用户自身的技术实现能力。

📊 多维度评分

适应性4.7
规范性4.5
有效性4.5
可靠性4.3
可信度5

📁 包含文件 (5 个)

📄 SKILL.md 11 KB
📄 references/chapters.md 2.2 KB
📄 references/cheatsheet.md 477 B
📄 references/glossary.md 662 B
📄 references/pitfalls.md 990 B