doc-ocrlisted
Install: claude install-skill jiawood2006/hermes-skills
# Doc-OCR 文档识别 + 结构化
PDF / 扫描件 / 图片 → 可编辑文字 → **结构化数据**。有文字层的 PDF 直接提取,扫描件自动 OCR(macOS Vision 自带,中英文),**版面还原**(多栏/复杂排版按阅读顺序重排,不是裸行输出),**区域过滤**(剔除页眉/页脚/水印),**可搜索 PDF**(扫描件写隐形文字层,可 Ctrl+F / 复制),OCR 后可用 LLM 抽取发票/合同字段、转表格。
> **与同类工具的关系**:跨平台批量 OCR 可以看 Umi-OCR / PaddleOCR,生成可搜索 PDF 可以看 OCRmyPDF——本技能覆盖这两者的**核心高频用途**,且**文件全程本机处理、零上传**(仅在结构化抽取时调用 LLM API)。
> 📁 **安装**:`hermes skills install jiawood2006/hermes-skills/skills/doc-ocr` 或按 README 方式二复制 → 默认在 `~/.hermes/skills/utilities/doc-ocr/`。以下命令基于该路径。
## 触发条件
用户提供 PDF/图片文件,要求:
- "提取文字""转文字""OCR"
- 处理扫描件、合同、发票、书页、截图
- "提取发票信息""合同要点""转成表格"(结构化)
## 使用步骤
### 1. 单个文件 → 文字
```bash
python3 ~/.hermes/skills/utilities/doc-ocr/scripts/dococr.py 合同.pdf
python3 ~/.hermes/skills/utilities/doc-ocr/scripts/dococr.py 发票.jpg
```
输出保存为 `<输入名>_ocr.txt`。
### 2. 批量目录(逐文件容错,坏文件不中断)
```bash
python3 ~/.hermes/skills/utilities/doc-ocr/scripts/dococr.py ./扫描件/ -o 全部.txt
# 批量完成输出汇总:成功 N/M + 失败清单(坏文件单独记录不中断整批)
```
### 3. Markdown 输出 / 多栏 PDF 强制版面还原
```bash
python3 ~/.hermes/skills/utilities/doc-ocr/scripts/dococr.py 书.pdf --md
# 多栏 PDF 文字层乱序时,强制走 Vision OCR 版面还原:
python3 ~/.hermes/skills/utilities/doc-ocr/scripts/dococr.py 双栏论文.pdf --md --force-ocr
```
### 4. 剔除页眉/页脚/水印带(`--ignore-region`)
扫描件常带页眉、页脚、水印、骑缝章文字,污染提取结果。按**归一化比例**剔除,不需要知道具体坐标:
```bash
# 去掉顶部 8% 和底部 6% 的文字带
python3 ~/.hermes/skills/utilities/doc-ocr/scripts/dococr.py 合同.pdf --ignore-region "top=8%,bottom=6%"
# 也可组合 left= / right=(去掉左侧装订线区域的花边/水印)
python3 ~/.hermes/skills/utilities/d