ocr-extractlisted
Install: claude install-skill awslew/ds-vision-kit
# ocr-extract(场景层:OCR 文字/表格 → Markdown)
把图片中的文字**逐字、无损**提取为结构化 Markdown。核心是"原文第一":不改写、
不总结、不翻译,只转录 + 按结构整理(标题 / 正文 / 代码 / 表格)。
## 触发场景
- 截图 / 扫描件 / 文档图 / 聊天记录 / 长截图,需要里面的文字
- "表格转 markdown"、"OCR"、"把文字提取出来"、"转录这个截图"
- 上一轮视觉模型回答太抽象、需要逐字底稿时
## 工作流
**预处理**:
- 最长边 >1400px 先缩到 1400(JPEG q88)——大图+长 prompt 会 HTTP 500。若文字太
小看不清,不要硬缩:改用 `glance --region` 分块读,或用 `long-ocr`。
- 先 `glance <图> -q "图上有哪些文字内容类型?有没有表格/代码/列表?大概多长?"`
快速判��该走哪条路。
**分支 A — 普通图/单屏**(绝大多数情况)
```bash
glance "<图>" --ocr # 逐字转录全部可见文字
```
若图含表格或结构复杂,追加结构化转录(**关键 prompt,勿省**):
```bash
glance "<图>" -q "<结构化转录 prompt,见下>"
```
**分支 B — 长截图 / 滚动页 / 聊天记录**(高度远大于宽度,或内容多屏)
```bash
long-ocr "<图>" -o "<输出>.ocr.md" # 普通长图
long-ocr "<图>" --mode chat --resume -o "<输出>.ocr.md" # 聊天记录(JSON 结构化)
```
**分支 C — 文字太小,全图读不清**
```bash
ground "<图>" "<包含该文字的元素/区域>" # 先定位
crop "<图>" --region X1,Y1,X2,Y2 -o "<局部>.png" # 切成文件
glance "<局部>.png" --ocr # 对放大的局部 OCR
```
## 结构化转录 prompt(喂给 glance 的 -q)
> 把这张图里的所有文字逐字转录成 Markdown,遵守:
> 1. **原文第一**:逐字照抄,不改写、不翻译、不总结、不补字;拼写错误也照抄
> 2. 保留结构:标题用 #,正文用段落,代码块用 ```,列表用 -
> 3. **表格逐个枚举,一个都不能漏**:这张图里有几个表格?请把【每一个】表格都分别转成
> Markdown 表格输出,标注"表格1""表格2"……每个表格的数字逐格照抄,不要改写
> 4. 若图上没有表格,明确说"无表格";没有代码,就无需代码块
> 5. 最后用一行列出你识别到的全部文字块数量,供校对
## 输出格式
```markdown
# OCR 提取结果
来源:<图片路径>
处理方式:<glance --ocr / long-ocr / 区域 OCR>
<转录的正文 Markdown 全文>
### 表格
**表格1**:<表头说明>
| 表头 | ... |
| --- | --- |
| <逐格照抄> | ... |
### 校对提示
- 疑似漏读/不清区域:<如有>
```