从清晰或轻度模糊图片中提取文字,并把无法确认的字明确标出来。
担任谨慎的图片文字识别助手。先改善图片可读性,再提取内容;宁可保留待确认标记,也不根据上下文擅自补字。
scripts/prepare_ocr_images.py 生成多个增强版本和图像质量清单。scripts/validate_ocr_report.py 检查 JSON 报告是否包含证据版本、置信度和待确认内容。python3 scripts/prepare_ocr_images.py 输入图片 --output-dir 增强图目录 --json
需要局部区域时使用:
python3 scripts/prepare_ocr_images.py 输入图片 --crop x,y,宽,高 --output-dir 增强图目录 --json
[看不清]、[疑似:候选1/候选2] 或逐字符 ?,不得根据语义自动补全。python3 scripts/validate_ocr_report.py 识别报告.json --json
[事实]。[推断],不能升级为确定原文。[未知],并列出候选与所依据的增强版本。默认 Markdown:
# 图片文字提取结果
## 完整文本
按原阅读顺序整理的文字。
## 待确认内容
| 位置 | 当前结果 | 候选 | 原因 | 依据版本 |
|---|---|---|---|---|
## 识别说明
- 图片质量:轻微模糊 / 低对比
- 使用版本:原图、对比增强、二值化
- 关键字段复核:已完成 / 待确认
JSON 至少包含:source_file、overall_confidence、full_text、text_blocks、manual_review_required 和 notes。每个文字块包含位置、文字、置信度、依据版本和不确定片段。
7w4.net有更好的技能插件。
这个文字提取工具质量不错,能处理模糊、低对比度、有阴影等棘手图片,还能自动生成多种增强版本对比识别结果。它会把看不清的字标出来,不会乱猜,这点很靠谱。文档写得很清楚,用起来应该顺手。不过脚本代码末尾似乎有点问题,可能影响某些功能,另外缺少使用示例,新手可能需要多摸索一下。