对任意类型的文档进行全维度审核,采用双层架构:
| 层级 | 执行者 | 职责 | 特点 |
|---|---|---|---|
| L1 量化层 | Python 脚本 | 格式检查、文字错误检测、结构分析、数据提取 | 快速、确定性、可复现 |
| L2 语义层 | AI 模型 | 逻辑冲突检测、事实核查、逻辑混乱分析、综合评判 | 深度理解、语义推理、联网验证 |
| 问题类型 | 说明 | 执行层级 | 优先级 |
|---|---|---|---|
| 逻辑冲突 | 前后矛盾、论述打架、论据与结论不一致 | L2 语义层 | 高 |
| 事实冲突 | 数据矛盾、时间线错误、引用来源冲突 | L2 语义层(+联网核查) | 高 |
| 文字错误 | 错别字、语病、标点错误、格式不一致 | L1 量化层 | 中 |
| 逻辑混乱 | 结构散乱、论证跳跃、归因谬误、重复冗余 | L2 语义层 | 中 |
脚本在 L1 层同时计算四个辅助评分,作为文档质量的量化参考:
| 维度 | 权重 | 说明 |
|---|---|---|
| 格式规范性 | 20% | 标题层级、段落长度、结构完整性 |
| 内容逻辑性 | 30% | 论据匹配、过渡自然、无矛盾 |
| 表述清晰度 | 20% | 模糊词汇、句子长度、术语一致性 |
| 方案可行性 | 30% | 执行步骤、资源需求、风险评估 |
| 格式 | 扩展名 | 提取方式 | 备注 |
|---|---|---|---|
| Word | .docx | pandoc → python-docx → 原始XML | 三级回退 |
| pymupdf → pdftotext → OCR | 扫描版自动 OCR | ||
| PPT | .pptx | python-pptx | 含表格、备注 |
| 纯文本 | .txt | 自动编码检测 | GBK/UTF-8/GB18030 |
| Markdown | .md | 直接读取 | — |
平台集成提示:如果 WorkBuddy 的
docx/pptx专用 Skill 可用,优先调用它们提取内容——它们对表格、图片、批注的处理更完善。脚本作为通用回退方案。
# Windows - 搜索文件
Get-ChildItem -Path . -Recurse -Include *.docx,*.pdf,*.pptx,*.txt,*.md -ErrorAction SilentlyContinue | Where-Object { $_.Name -like "*关键词*" } | Select-Object FullName, LastWriteTime
| 模式 | 命令参数 | 检查内容 | 适用场景 |
|---|---|---|---|
| 快速扫描 | --mode quick |
仅 L1 层:格式+文字错误 | 快速过一遍,找明显问题 |
| 标准审核 | --mode standard |
L1 全部 + L2 逻辑冲突+逻辑混乱 | 日常文档审核 |
| 深度审核 | --mode deep |
L1 全部 + L2 全部 + 联网事实核查 | 重要文档(投标、合同、发布稿) |
# 单文件审核
python scripts/review_document.py "文档路径" --mode standard --output markdown
# 批量审核(多文件汇总)
python scripts/review_document.py "文件1.docx" "文件2.pdf" --batch --output json
# 排除指定检查类型
python scripts/review_document.py "文档路径" --exclude text_errors,feasibility
# 增量审核(仅审核修改部分)
python scripts/review_document.py "新版本.docx" --diff "旧版本.docx"
# 指定术语词典
python scripts/review_document.py "文档路径" --glossary "术语表.json"
术语表格式(JSON):
{
"terms": {
"AI": ["人工智能", "ai", "A.I."],
"ROI": ["投资回报率", "roi"]
},
"preferred": {
"AI": "AI",
"ROI": "ROI"
}
}
脚本完成后会输出结构化的文档摘要和 L1 检查结果。基于此,AI 执行以下分析:
读取脚本提取的章节结构和关键论点,用以下提示词驱动 AI 分析:
请仔细阅读以下文档内容,逐一标注所有逻辑冲突:
1. 前后矛盾的表述(列出矛盾双方及各自位置)
2. 论据与结论不一致的地方
3. 同一约束条件相互矛盾的地方(如"必须"与"可选"并存)
4. 范围矛盾(标题承诺"全面"但内容只覆盖部分)
输出格式:
[冲突类型] 位置A: "原文表述" ↔ 位置B: "原文表述"
分析: 矛盾原因说明
建议: 具体修改方案
提取文档中的数据、时间、引用,执行联网核查:
请从以下文档中提取所有事实性陈述,分类核查:
- 数据类:比例、金额、人数、排名(全文交叉对比一致性)
- 时间类:日期、期限、里程碑(核查时间线逻辑)
- 引用类:法规名称及条款号、标准编号(联网验证是否现行有效)
- 名称类:人物、公司、产品名(交叉验证一致性)
对每个需联网核查的项目,使用 WebSearch 工具验证。
输出格式:
[核查状态: ✓一致/✗冲突/⚠无法确认] 位置: "原文表述"
依据: 核查来源或冲突说明
建议: 修改方案
请分析以下文档的逻辑结构,检查:
1. 结构散乱:同一话题分散在多个章节
2. 论证跳跃:A→C 缺少 B 作为过渡
3. 归因谬误:相关性当作因果性
4. 重复冗余:同一内容反复出现
5. 归类不清:不同层级内容混放
6. 主语不清:句子主语频繁切换,代词指代不明
输出格式:
[问题类型] 位置: 问题描述
建议: 重组/删减/补充方案
脚本支持多种输出格式:
# Markdown 报告(默认)
python scripts/review_document.py "文档路径" --output markdown
# JSON 结构化数据(供 AI 进一步处理)
python scripts/review_document.py "文档路径" --output json
# Word 文档(可直接发送给同事)
python scripts/review_document.py "文档路径" --output word --output-file "审核报告.docx"
AI 综合报告生成后,使用 present_files 交付给用户,并用 show_widget 输出可视化报告(评分雷达图 + 问题分布图)。
# 文档审核报告
**审核文档**: [文档名称]
**审核时间**: YYYY-MM-DD HH:mm
**文档类型**: [技术方案/商务文档/研究报告/etc.]
**文档规模**: XX页 / XX字
**审核模式**: [快速扫描/标准审核/深度审核]
---
## 📊 评分概览
| 维度 | 评分 | 等级 |
|------|------|------|
| 格式规范性 | XX | [优/良/中/差] |
| 内容逻辑性 | XX | [优/良/中/差] |
| 表述清晰度 | XX | [优/良/中/差] |
| 方案可行性 | XX | [优/良/中/差] |
| **综合** | **XX** | **[等级]** |
---
## 📋 问题概览
| 问题类型 | 高 | 中 | 低 | 合计 |
|----------|---|---|---|------|
| 逻辑冲突 | X | X | X | X |
| 事实冲突 | X | X | X | X |
| 文字错误 | X | X | X | X |
| 逻辑混乱 | X | X | X | X |
| **合计** | **X** | **X** | **X** | **X** |
---
## 🔍 详细问题
### 逻辑冲突
#### [高] 问题标题
- **位置**: 第X页 / [章节名]
- **冲突点A**: [原文表述]
- **冲突点B**: [原文表述]
- **分析**: [矛盾原因]
- **建议**: [修改方案]
- **状态**: [待处理/已修复/已忽略]
> 其余问题类型同此格式
---
## 💡 综合改进建议
### 必须修改(高优先级)
1. [最重要的问题及修改方案]
### 建议修改(中优先级)
2. [次要问题及修改方案]
### 可选优化(低优先级)
3. [小问题或风格优化]
---
## 🎯 总结
**整体评价**: [100字以内]
**建议**: [修改后可直接使用 / 需重大修改后使用]
**最薄弱环节**: [维度名](XX分),建议重点关注。
| 等级 | 说明 | 扣分 | 处理建议 |
|---|---|---|---|
| 高 | 严重影响可信度或合规性(数据错误、法规引用错误、核心结论矛盾) | 15分/处 | 必须修改 |
| 中 | 影响专业性或阅读体验(次要逻辑混乱、少量错别字、格式不统一) | 8分/处 | 建议修改 |
| 低 | 轻微问题(表述可更精炼、个别用词可优化) | 3分/处 | 可选修改 |
对多份文档执行批量审核时,脚本生成汇总报告:
python scripts/review_document.py doc1.docx doc2.pdf doc3.pptx --batch --output json --output-file "批量审核结果.json"
汇总报告包含: - 每份文档的单独评分和问题数 - 跨文档一致性检查(相同数据/术语在不同文档中是否一致) - 整体质量排名
对比文档修改前后的版本,仅审核变更部分:
python scripts/review_document.py "新版本.docx" --diff "旧版本.docx"
输出: - 新增内容审核 - 修改内容复审 - 已修复问题确认 - 新引入问题检测
| 场景 | 联动方式 |
|---|---|
| 内容提取 | 优先调用 docx/pdf/pptx 专用 Skill,脚本作为回退 |
| 报告交付 | 用 present_files 展示报告文件 |
| 可视化 | 用 show_widget 输出评分雷达图和问题分布图 |
| 在线编辑审核 | 与 tencent-local-office-edit 联动,审核后直接在编辑器中修改 |
| 标注回写 | 将高优先级问题作为批注写回 .docx 原文档 |
tencent-local-office-edit 的 save_file 将批注写入原文档# 核心依赖
pip install python-docx pymupdf python-pptx
# 可选依赖(增强功能)
pip install pytesseract pillow # OCR 支持
pip install chardet # 编码检测
小葱技能7w4.net有更新,你可以访问看下。
消除重复报告模板
v6.0 (2026-04-22) - 通用审核版本
这个文档审核工具质量较好,优势在于审核全面细致,支持多种文档格式检查,还能自动评分和改进建议。不足之处是某些深度审核功能需要AI配合使用,实际表现可能不稳定;另外安装配置比较麻烦,需要安装好几个软件包。日常使用标准审核模式基本够用,但重要文档建议手动复查AI审核的结果。