name: ppt-image-extract slug: ppt-image-extract displayName: PPT图片内容识别 description: 读取 PPT 内容:导出每页为 PNG + 用多模态模型识别图片内容。基于 tiangong-wps-ppt-automation。 status: live version: "1.0.0" date: "2026-07-02"
读取 PPT 内容(含图片识别):导出每页为 PNG + 调用多模态模型识图。
tiangong-wps-ppt-automation skill(提供 COM 自动化基础)pip install pywin32qclaw/pool-minimax-m3(已验证可用)qclaw/kimi2.6(已验证可用)PPT (.ppt/.pptx)
↓ 步骤1: COM 自动化导出每页为 PNG
slides/<ppt名>/slide_001.png ~ slide_NNN.png
↓ 步骤2: 多模态模型逐张识图
识别结果(结构化文字)
↓ 步骤3: 汇总成文档
output.docx / output.md
import os
import win32com.client
def export_ppt_to_png(ppt_path, output_dir):
"""用 WPS 演示 COM 把 PPT 每页导出为 PNG"""
assert os.path.exists(ppt_path), f'PPT not found: {ppt_path}'
ppt_name = os.path.splitext(os.path.basename(ppt_path))[0]
out_folder = os.path.join(output_dir, ppt_name)
os.makedirs(out_folder, exist_ok=True)
print(f'PPT: {ppt_path}')
print(f'Output: {out_folder}')
# 优先用 WPS(支持 .ppt 旧格式),fallback 到 PowerPoint
try:
app = win32com.client.Dispatch('KWPP.Application')
except:
app = win32com.client.Dispatch('PowerPoint.Application')
app.Visible = True # WPS 必须可见
try:
pres = app.Presentations.Open(ppt_path, ReadOnly=True, WithWindow=False)
total = pres.Slides.Count
print(f'Total slides: {total}')
for i, slide in enumerate(pres.Slides, 1):
out_path = os.path.join(out_folder, f'slide_{i:03d}.png')
slide.Export(out_path, 'PNG', 1920, 1080)
if i % 20 == 0:
print(f' exported {i}/{total}')
pres.Close()
print(f'✅ Done: {total} slides exported to {out_folder}')
return out_folder, total
finally:
app.Quit()
def export_all_ppts(folder, output_root='slides'):
"""批量导出文件夹下所有 PPT"""
ppts = [f for f in os.listdir(folder) if f.lower().endswith(('.ppt', '.pptx'))]
print(f'Found {len(ppts)} PPTs')
results = {}
for ppt in ppts:
ppt_path = os.path.join(folder, ppt)
out_folder, count = export_ppt_to_png(ppt_path, output_root)
results[ppt] = (out_folder, count)
return results
def verify_exports(results):
"""验证每个 PPT 的导出数量"""
for ppt_name, (folder, expected) in results.items():
actual = len([f for f in os.listdir(folder) if f.endswith('.png')])
status = '✅' if actual == expected else '❌'
print(f'{status} {ppt_name}: expected {expected}, got {actual}')
read 工具)重要:模型必须支持图片输入。当前验证可用的模型:
- qclaw/pool-minimax-m3(MiniMax M3,原生多模态)
- qclaw/kimi2.6(Kimi K2.6,视觉理解)
调用方式(在 agent 主循环中):
# 用 read 工具读取 PNG,模型会自动识别图片内容
read(path="C:/path/to/slide_001.png")
注意:read 工具对图片返回的是模型识图结果,不是文件二进制。需要模型本身支持多模态。
不要在主会话中逐张识图(会污染上下文 + 速度慢)。
推荐方式:派子 AGENT 处理,主会话只接收汇总结果。
sessions_spawn(
task=<识图任务描述,包含图片路径清单 + 期望输出格式>,
model="qclaw/pool-minimax-m3",
runtime="subagent",
mode="run"
)
# 任务:识别 PPT 图片内容
## 图片清单
- C:/path/to/slides/plc第七讲/slide_011.png — PLC 三段等效电路
- C:/path/to/slides/plc第七讲/slide_013.png — 核心转换案例
...(列出所有要识别的图)
## 输出要求
对每张图输出:
1. 图片标题(来自 slide 编号)
2. 图片类型(电路图/梯形图/实物图/文字说明/混合)
3. 关键内容描述(200-400 字)
- 电路图:列出主要元件 + 连接关系
- 梯形图:列出 LD/AND/OR/OUT 等指令 + 梯形图结构
- 实物图:列出设备型号 + 关键特征
- 文字说明:直接摘录关键文字
4. 对应考点(如适用)
## 输出格式
Markdown 文档,每张图一段:
### slide_NNN.png
- **类型**:电路图
- **描述**:...
- **考点**:考点 4
maxConcurrent: 8)sessions_yield 等待全部完成子 AGENT 完成后会把识别结果写文件或返回报告。主会话:
import glob
results = []
for f in glob.glob(r'C:\path\to\work\*_result.md'):
with open(f, 'r', encoding='utf-8') as fp:
results.append(fp.read())
final = '\n\n---\n\n'.join(results)
如果需要嵌入图片 + 文字到 docx:
from docx import Document
from docx.shared import Inches, Pt, RGBColor
from docx.enum.text import WD_ALIGN_PARAGRAPH
doc = Document()
for item in image_results:
doc.add_heading(item['title'], level=2)
p = doc.add_paragraph()
p.alignment = WD_ALIGN_PARAGRAPH.CENTER
p.add_run().add_picture(item['image_path'], width=Inches(5.5))
cap = doc.add_paragraph()
cap.alignment = WD_ALIGN_PARAGRAPH.CENTER
run = cap.add_run(f"图:{item['caption']}")
run.italic = True
run.font.size = Pt(9)
run.font.color.rgb = RGBColor(0x55, 0x55, 0x55)
doc.add_paragraph(item['description'])
doc.save(output_path)
KWPP.Application(WPS)→ PowerPoint.Application(Microsoft)→ wpp.Application(WPS 新版)soffice --convert-to pptx 转换qclaw/pool-glm-5.2(默认模型)不支持图片识别qclaw/pool-minimax-m3 或 qclaw/kimi2.6sessions_spawn(model="qclaw/pool-minimax-m3") 指定子 AGENT 的模型mode="run" 让子 AGENT 后台运行<工作目录>/
├── slides/ # 导出的 PNG
│ ├── <PPT名1>/
│ │ ├── slide_001.png
│ │ ├── slide_002.png
│ │ └── ...
│ └── <PPT名2>/
│ └── ...
├── _recognize_results/ # 子 AGENT 输出
│ ├── batch1_result.md
│ └── batch2_result.md
└── output.docx # 最终汇总文档
tiangong-wps-ppt-automation(提供 PPT COM 自动化基础,但不含图片识别)