← ClaudeAtlas

ocr-extractlisted

把图片里的文字逐字提取为结构化 Markdown:正文/代码/表格。OCR 文字提取、 表格转 Markdown、扫描件转录、长截图/聊天记录转文本。用户说"把这张图的 文字/表格提取出来""OCR""转录这段截图""这个扫描件转文字""表格转markdown" 并给图时自动触发。
awslew/ds-vision-kit · ★ 1 · Data & Documents · score 73
Install: claude install-skill awslew/ds-vision-kit
# ocr-extract(场景层:OCR 文字/表格 → Markdown) 把图片中的文字**逐字、无损**提取为结构化 Markdown。核心是"原文第一":不改写、 不总结、不翻译,只转录 + 按结构整理(标题 / 正文 / 代码 / 表格)。 ## 触发场景 - 截图 / 扫描件 / 文档图 / 聊天记录 / 长截图,需要里面的文字 - "表格转 markdown"、"OCR"、"把文字提取出来"、"转录这个截图" - 上一轮视觉模型回答太抽象、需要逐字底稿时 ## 工作流 **预处理**: - 最长边 >1400px 先缩到 1400(JPEG q88)——大图+长 prompt 会 HTTP 500。若文字太 小看不清,不要硬缩:改用 `glance --region` 分块读,或用 `long-ocr`。 - 先 `glance <图> -q "图上有哪些文字内容类型?有没有表格/代码/列表?大概多长?"` 快速判��该走哪条路。 **分支 A — 普通图/单屏**(绝大多数情况) ```bash glance "<图>" --ocr # 逐字转录全部可见文字 ``` 若图含表格或结构复杂,追加结构化转录(**关键 prompt,勿省**): ```bash glance "<图>" -q "<结构化转录 prompt,见下>" ``` **分支 B — 长截图 / 滚动页 / 聊天记录**(高度远大于宽度,或内容多屏) ```bash long-ocr "<图>" -o "<输出>.ocr.md" # 普通长图 long-ocr "<图>" --mode chat --resume -o "<输出>.ocr.md" # 聊天记录(JSON 结构化) ``` **分支 C — 文字太小,全图读不清** ```bash ground "<图>" "<包含该文字的元素/区域>" # 先定位 crop "<图>" --region X1,Y1,X2,Y2 -o "<局部>.png" # 切成文件 glance "<局部>.png" --ocr # 对放大的局部 OCR ``` ## 结构化转录 prompt(喂给 glance 的 -q) > 把这张图里的所有文字逐字转录成 Markdown,遵守: > 1. **原文第一**:逐字照抄,不改写、不翻译、不总结、不补字;拼写错误也照抄 > 2. 保留结构:标题用 #,正文用段落,代码块用 ```,列表用 - > 3. **表格逐个枚举,一个都不能漏**:这张图里有几个表格?请把【每一个】表格都分别转成 > Markdown 表格输出,标注"表格1""表格2"……每个表格的数字逐格照抄,不要改写 > 4. 若图上没有表格,明确说"无表格";没有代码,就无需代码块 > 5. 最后用一行列出你识别到的全部文字块数量,供校对 ## 输出格式 ```markdown # OCR 提取结果 来源:<图片路径> 处理方式:<glance --ocr / long-ocr / 区域 OCR> <转录的正文 Markdown 全文> ### 表格 **表格1**:<表头说明> | 表头 | ... | | --- | --- | | <逐格照抄> | ... | ### 校对提示 - 疑似漏读/不清区域:<如有> ```