文档审核

👤 qiuqiu 📦 v1.0.1 ⭐ 4.5 ⬇️ 4.2K 下载
📄 办公效率 免费

📖 技能介绍

文档审核技能 (Document Review Skill)

概述

对任意类型的文档进行全维度审核,采用双层架构

层级 执行者 职责 特点
L1 量化层 Python 脚本 格式检查、文字错误检测、结构分析、数据提取 快速、确定性、可复现
L2 语义层 AI 模型 逻辑冲突检测、事实核查、逻辑混乱分析、综合评判 深度理解、语义推理、联网验证

四大核心问题

问题类型 说明 执行层级 优先级
逻辑冲突 前后矛盾、论述打架、论据与结论不一致 L2 语义层
事实冲突 数据矛盾、时间线错误、引用来源冲突 L2 语义层(+联网核查)
文字错误 错别字、语病、标点错误、格式不一致 L1 量化层
逻辑混乱 结构散乱、论证跳跃、归因谬误、重复冗余 L2 语义层

辅助评分维度

脚本在 L1 层同时计算四个辅助评分,作为文档质量的量化参考:

维度 权重 说明
格式规范性 20% 标题层级、段落长度、结构完整性
内容逻辑性 30% 论据匹配、过渡自然、无矛盾
表述清晰度 20% 模糊词汇、句子长度、术语一致性
方案可行性 30% 执行步骤、资源需求、风险评估

支持的文档格式

格式 扩展名 提取方式 备注
Word .docx pandoc → python-docx → 原始XML 三级回退
PDF .pdf pymupdf → pdftotext → OCR 扫描版自动 OCR
PPT .pptx python-pptx 含表格、备注
纯文本 .txt 自动编码检测 GBK/UTF-8/GB18030
Markdown .md 直接读取

平台集成提示:如果 WorkBuddy 的 docx/pdf/pptx 专用 Skill 可用,优先调用它们提取内容——它们对表格、图片、批注的处理更完善。脚本作为通用回退方案。


使用流程

1. 定位文件

# Windows - 搜索文件
Get-ChildItem -Path . -Recurse -Include *.docx,*.pdf,*.pptx,*.txt,*.md -ErrorAction SilentlyContinue | Where-Object { $_.Name -like "*关键词*" } | Select-Object FullName, LastWriteTime

2. 选择审核模式

模式 命令参数 检查内容 适用场景
快速扫描 --mode quick 仅 L1 层:格式+文字错误 快速过一遍,找明显问题
标准审核 --mode standard L1 全部 + L2 逻辑冲突+逻辑混乱 日常文档审核
深度审核 --mode deep L1 全部 + L2 全部 + 联网事实核查 重要文档(投标、合同、发布稿)

3. 执行 L1 量化审核(脚本)

# 单文件审核
python scripts/review_document.py "文档路径" --mode standard --output markdown

# 批量审核(多文件汇总)
python scripts/review_document.py "文件1.docx" "文件2.pdf" --batch --output json

# 排除指定检查类型
python scripts/review_document.py "文档路径" --exclude text_errors,feasibility

# 增量审核(仅审核修改部分)
python scripts/review_document.py "新版本.docx" --diff "旧版本.docx"

# 指定术语词典
python scripts/review_document.py "文档路径" --glossary "术语表.json"

术语表格式(JSON):

{
  "terms": {
    "AI": ["人工智能", "ai", "A.I."],
    "ROI": ["投资回报率", "roi"]
  },
  "preferred": {
    "AI": "AI",
    "ROI": "ROI"
  }
}

4. 执行 L2 语义审核(AI)

脚本完成后会输出结构化的文档摘要和 L1 检查结果。基于此,AI 执行以下分析:

4.1 逻辑冲突检测

读取脚本提取的章节结构和关键论点,用以下提示词驱动 AI 分析:

请仔细阅读以下文档内容,逐一标注所有逻辑冲突:
1. 前后矛盾的表述(列出矛盾双方及各自位置)
2. 论据与结论不一致的地方
3. 同一约束条件相互矛盾的地方(如"必须"与"可选"并存)
4. 范围矛盾(标题承诺"全面"但内容只覆盖部分)

输出格式:
[冲突类型] 位置A: "原文表述" ↔ 位置B: "原文表述"
分析: 矛盾原因说明
建议: 具体修改方案

4.2 事实冲突检测

提取文档中的数据、时间、引用,执行联网核查:

请从以下文档中提取所有事实性陈述,分类核查:
- 数据类:比例、金额、人数、排名(全文交叉对比一致性)
- 时间类:日期、期限、里程碑(核查时间线逻辑)
- 引用类:法规名称及条款号、标准编号(联网验证是否现行有效)
- 名称类:人物、公司、产品名(交叉验证一致性)

对每个需联网核查的项目,使用 WebSearch 工具验证。
输出格式:
[核查状态: ✓一致/✗冲突/⚠无法确认] 位置: "原文表述"
依据: 核查来源或冲突说明
建议: 修改方案

4.3 逻辑混乱分析

请分析以下文档的逻辑结构,检查:
1. 结构散乱:同一话题分散在多个章节
2. 论证跳跃:A→C 缺少 B 作为过渡
3. 归因谬误:相关性当作因果性
4. 重复冗余:同一内容反复出现
5. 归类不清:不同层级内容混放
6. 主语不清:句子主语频繁切换,代词指代不明

输出格式:
[问题类型] 位置: 问题描述
建议: 重组/删减/补充方案

5. 生成审核报告

脚本支持多种输出格式:

# Markdown 报告(默认)
python scripts/review_document.py "文档路径" --output markdown

# JSON 结构化数据(供 AI 进一步处理)
python scripts/review_document.py "文档路径" --output json

# Word 文档(可直接发送给同事)
python scripts/review_document.py "文档路径" --output word --output-file "审核报告.docx"

AI 综合报告生成后,使用 present_files 交付给用户,并用 show_widget 输出可视化报告(评分雷达图 + 问题分布图)。


审核报告模板

# 文档审核报告

**审核文档**: [文档名称]
**审核时间**: YYYY-MM-DD HH:mm
**文档类型**: [技术方案/商务文档/研究报告/etc.]
**文档规模**: XX页 / XX字
**审核模式**: [快速扫描/标准审核/深度审核]

---

## 📊 评分概览

| 维度 | 评分 | 等级 |
|------|------|------|
| 格式规范性 | XX | [优/良/中/差] |
| 内容逻辑性 | XX | [优/良/中/差] |
| 表述清晰度 | XX | [优/良/中/差] |
| 方案可行性 | XX | [优/良/中/差] |
| **综合** | **XX** | **[等级]** |

---

## 📋 问题概览

| 问题类型 | 高 | 中 | 低 | 合计 |
|----------|---|---|---|------|
| 逻辑冲突 | X | X | X | X |
| 事实冲突 | X | X | X | X |
| 文字错误 | X | X | X | X |
| 逻辑混乱 | X | X | X | X |
| **合计** | **X** | **X** | **X** | **X** |

---

## 🔍 详细问题

### 逻辑冲突

#### [高] 问题标题
- **位置**: 第X页 / [章节名]
- **冲突点A**: [原文表述]
- **冲突点B**: [原文表述]
- **分析**: [矛盾原因]
- **建议**: [修改方案]
- **状态**: [待处理/已修复/已忽略]

> 其余问题类型同此格式

---

## 💡 综合改进建议

### 必须修改(高优先级)
1. [最重要的问题及修改方案]

### 建议修改(中优先级)
2. [次要问题及修改方案]

### 可选优化(低优先级)
3. [小问题或风格优化]

---

## 🎯 总结

**整体评价**: [100字以内]

**建议**: [修改后可直接使用 / 需重大修改后使用]

**最薄弱环节**: [维度名](XX分),建议重点关注。

问题严重程度分级

等级 说明 扣分 处理建议
严重影响可信度或合规性(数据错误、法规引用错误、核心结论矛盾) 15分/处 必须修改
影响专业性或阅读体验(次要逻辑混乱、少量错别字、格式不统一) 8分/处 建议修改
轻微问题(表述可更精炼、个别用词可优化) 3分/处 可选修改

批量审核

对多份文档执行批量审核时,脚本生成汇总报告:

python scripts/review_document.py doc1.docx doc2.pdf doc3.pptx --batch --output json --output-file "批量审核结果.json"

汇总报告包含: - 每份文档的单独评分和问题数 - 跨文档一致性检查(相同数据/术语在不同文档中是否一致) - 整体质量排名


增量审核

对比文档修改前后的版本,仅审核变更部分:

python scripts/review_document.py "新版本.docx" --diff "旧版本.docx"

输出: - 新增内容审核 - 修改内容复审 - 已修复问题确认 - 新引入问题检测


平台集成

与 WorkBuddy 文档 Skill 联动

场景 联动方式
内容提取 优先调用 docx/pdf/pptx 专用 Skill,脚本作为回退
报告交付 present_files 展示报告文件
可视化 show_widget 输出评分雷达图和问题分布图
在线编辑审核 tencent-local-office-edit 联动,审核后直接在编辑器中修改
标注回写 将高优先级问题作为批注写回 .docx 原文档

标注回写流程

  1. 脚本生成审核报告(含问题位置和原文片段)
  2. AI 提取高优先级问题,生成批注内容
  3. 调用 tencent-local-office-editsave_file 将批注写入原文档
  4. 用户在编辑器中查看标注并进行修改
  5. 修改后重新审核,确认问题已解决

审核技巧

AI 辅助审核的关键策略

  1. 数据交叉验证:提取全文所有数值数据,对比同一指标在不同位置的表述是否一致
  2. 时间线梳理:提取所有时间节点,按顺序排列,检查是否有倒置或矛盾
  3. 术语统一检查:提取所有专业术语,确认全文写法统一(可用术语词典辅助)
  4. 标题层级检查:检查 H1/H2/H3 是否逐级包含、无跳跃
  5. 代词指代检查:确认"它/这/那"等指代明确,无歧义

联网核查优先级

  1. 必须核查:法规名称及条款号、国家标准编号、认证体系名称
  2. 建议核查:市场数据、行业排名、竞争对手信息
  3. 可选核查:一般性引用、历史事件描述

依赖项

# 核心依赖
pip install python-docx pymupdf python-pptx

# 可选依赖(增强功能)
pip install pytesseract pillow  # OCR 支持
pip install chardet              # 编码检测

注意事项

  1. 客观中立:审核时保持客观,避免主观偏好影响判断
  2. 有据可查:事实冲突需注明依据(来源/法规/常识)
  3. 明确位置:每个问题需标注具体位置(页码/章节/段落)
  4. 可操作建议:修改建议需具体可执行,而非泛泛而谈
  5. 区分优先级:避免将所有问题都列为高优先级
  6. 尊重原文意图:修改建议应保留原文核心意思
  7. 大文件处理:超过 500 页的文档建议使用增量审核或分章节审核
  8. 编码兼容:Windows 环境下 .txt 文件可能使用 GBK 编码,脚本已做自动检测

版本历史

  • v7.0 (2026-07-10) - 双层架构版本:
  • 统一审核框架:四大核心问题 + 辅助评分维度
  • 双层架构:L1 脚本量化 + L2 AI 语义
  • 新增审核模式:快速扫描/标准审核/深度审核
  • 新增批量审核和增量审核
  • 新增排除规则和术语词典支持
  • 补全 .pptx 格式支持
  • 新增 OCR 回退和编码自动检测
  • 新增 Word 格式导出
  • 新增平台集成:show_widget 可视化、present_files 交付、标注回写
  • 清除硬编码测试路径

    小葱技能7w4.net有更新,你可以访问看下。

  • 消除重复报告模板

  • v6.0 (2026-04-22) - 通用审核版本

  • v5.0 (2026-03-19) - 知识共建激励版本
  • v4.0 (2026-03-19) - 竞品分析专项版本
  • v3.0 (2026-03-07) - 快速定位优化版本
  • v2.0 (2026-03-07) - 功能完善版本
  • v1.0 - 初始版本

🤖 AI 评测

这个文档审核工具质量较好,优势在于审核全面细致,支持多种文档格式检查,还能自动评分和改进建议。不足之处是某些深度审核功能需要AI配合使用,实际表现可能不稳定;另外安装配置比较麻烦,需要安装好几个软件包。日常使用标准审核模式基本够用,但重要文档建议手动复查AI审核的结果。

📊 多维度评分

适应性4.4
规范性4.2
有效性4.7
可靠性4.3
可信度4.9

📁 包含文件 (4 个)

📄 SKILL.md 11.9 KB
📄 references/review_criteria.md 7.3 KB
📄 scripts/extract_docx.py 3.7 KB
📄 scripts/review_document.py 61.9 KB