← ClaudeAtlas

doc-ocrlisted

文档识别+结构化。用户提供 PDF/扫描件/图片(合同、发票、书页、截图),需要提取文字、转成可编辑文本、生成可搜索 PDF、剔除页眉页脚水印、或抽取结构化字段(发票号码/合同金额/表格)时使用。扫描件自动 OCR(macOS Vision,中英文),OCR 后可接 LLM 抽取发票/合同关键字段或转表格。Document OCR: extract editable text from PDFs, scans, images — plus searchable-PDF output, header/footer/watermark region filtering, and structured field extraction (invoices, contracts, tables) via LLM.
jiawood2006/hermes-skills · ★ 0 · AI & Automation · score 78
Install: claude install-skill jiawood2006/hermes-skills
# Doc-OCR 文档识别 + 结构化 PDF / 扫描件 / 图片 → 可编辑文字 → **结构化数据**。有文字层的 PDF 直接提取,扫描件自动 OCR(macOS Vision 自带,中英文),**版面还原**(多栏/复杂排版按阅读顺序重排,不是裸行输出),**区域过滤**(剔除页眉/页脚/水印),**可搜索 PDF**(扫描件写隐形文字层,可 Ctrl+F / 复制),OCR 后可用 LLM 抽取发票/合同字段、转表格。 > **与同类工具的关系**:跨平台批量 OCR 可以看 Umi-OCR / PaddleOCR,生成可搜索 PDF 可以看 OCRmyPDF——本技能覆盖这两者的**核心高频用途**,且**文件全程本机处理、零上传**(仅在结构化抽取时调用 LLM API)。 > 📁 **安装**:`hermes skills install jiawood2006/hermes-skills/skills/doc-ocr` 或按 README 方式二复制 → 默认在 `~/.hermes/skills/utilities/doc-ocr/`。以下命令基于该路径。 ## 触发条件 用户提供 PDF/图片文件,要求: - "提取文字""转文字""OCR" - 处理扫描件、合同、发票、书页、截图 - "提取发票信息""合同要点""转成表格"(结构化) ## 使用步骤 ### 1. 单个文件 → 文字 ```bash python3 ~/.hermes/skills/utilities/doc-ocr/scripts/dococr.py 合同.pdf python3 ~/.hermes/skills/utilities/doc-ocr/scripts/dococr.py 发票.jpg ``` 输出保存为 `<输入名>_ocr.txt`。 ### 2. 批量目录(逐文件容错,坏文件不中断) ```bash python3 ~/.hermes/skills/utilities/doc-ocr/scripts/dococr.py ./扫描件/ -o 全部.txt # 批量完成输出汇总:成功 N/M + 失败清单(坏文件单独记录不中断整批) ``` ### 3. Markdown 输出 / 多栏 PDF 强制版面还原 ```bash python3 ~/.hermes/skills/utilities/doc-ocr/scripts/dococr.py 书.pdf --md # 多栏 PDF 文字层乱序时,强制走 Vision OCR 版面还原: python3 ~/.hermes/skills/utilities/doc-ocr/scripts/dococr.py 双栏论文.pdf --md --force-ocr ``` ### 4. 剔除页眉/页脚/水印带(`--ignore-region`) 扫描件常带页眉、页脚、水印、骑缝章文字,污染提取结果。按**归一化比例**剔除,不需要知道具体坐标: ```bash # 去掉顶部 8% 和底部 6% 的文字带 python3 ~/.hermes/skills/utilities/doc-ocr/scripts/dococr.py 合同.pdf --ignore-region "top=8%,bottom=6%" # 也可组合 left= / right=(去掉左侧装订线区域的花边/水印) python3 ~/.hermes/skills/utilities/d