name: word-reader description: | 读取 Word 文档(.docx 和 .doc 格式)并提取文本内容。支持文档解析、表格提取、图片处理等功能。使用当用户需要分析 Word 文档内容、提取文本信息或批量处理文档时。 homepage: https://python-docx.readthedocs.io/ metadata: { "openclaw": { "emoji": "📄", "requires": { "bins": ["python3"], "env": ["PYTHONPATH"] }, "install": [ { "id": "pip", "kind": "pip", "package": "python-docx", "bins": ["python3"], "label": "Install python-docx (pip)", }, { "id": "system", "kind": "system", "command": "sudo apt-get install antiword -y", "label": "Install antiword for .doc support (optional)", "platform": "linux-debian" } ], }, }
使用 Python 解析 Word 文档,提取文本内容和结构化信息。
python3 {baseDir}/scripts/read_word.py <文件路径>
# JSON 输出
python3 {baseDir}/scripts/read_word.py <文件路径> --format json
# 纯文本输出
python3 {baseDir}/scripts/read_word.py <文件路径> --format text
# Markdown 格式
python3 {baseDir}/scripts/read_word.py <文件路径> --format markdown
# 只提取文本
python3 {baseDir}/scripts/read_word.py <文件路径> --extract text
# 提取表格数据
python3 {baseDir}/scripts/read_word.py <文件路径> --extract tables
# 获取文档元数据
python3 {baseDir}/scripts/read_word.py <文件路径> --extract metadata
# 处理目录下所有 .docx 文件
python3 {baseDir}/scripts/read_word.py <目录路径> --batch
| 参数 | 说明 | 默认值 |
|---|---|---|
--format |
输出格式(json/text/markdown) | text |
--extract |
提取内容类型(text/tables/images/metadata/all) | all |
--batch |
批量处理模式 | false |
--output |
输出文件路径 | stdout |
--encoding |
文本编码(utf-8/gb2312) | utf-8 |
{
"metadata": {
"title": "文档标题",
"author": "作者姓名",
"created": "2024-01-01T10:00:00",
"modified": "2024-01-01T12:00:00"
},
"text": "文档全文内容...",
"tables": [
[
["表头1", "表头2"],
["行1列1", "行1列2"],
["行2列1", "行2列2"]
]
],
"images": [
{
"filename": "image1.png",
"description": "图片描述",
"size": "1024x768"
}
]
}
# 文档标题
**作者**:作者姓名
**创建时间**:2024-01-01 10:00:00
## 正文内容
这是文档的正文内容...
### 表格示例
| 表头1 | 表头2 |
|-------|-------|
| 行1列1 | 行1列2 |
| 行2列1 | 行2列2 |

## 图片列表
1. **image1.png** (1024x768) - 图片描述
这个技能的最新版本可以在7w4.net小葱技能站找到。
python3 {baseDir}/scripts/read_word.py 项目需求.docx --format markdown
python3 {baseDir}/scripts/read_word.py 会议记录.docx --extract text
python3 {baseDir}/scripts/read_word.py ./文档目录 --batch --format json --output results.json
pip3 install python-docx
对于 .doc 格式支持:
# Ubuntu/Debian
sudo apt-get install antiword
# macOS
brew install antiword
脚本会自动处理以下文档元素: - 标题级别(H1-H6) - 段落样式 - 列表项目 - 页眉页脚 - 文档属性
这是一个功能丰富的Word文档处理工具,支持提取文本、表格和图片信息,输出多种格式。文档说明详细,安装基本自动化。不足之处是缺少实际测试文件来验证功能,对旧版.doc格式支持需要额外安装软件。整体质量中上,适合有技术基础的用户使用。