image-qalisted
Install: claude install-skill awslew/ds-vision-kit
# image-qa(场景层:图像问答与元素定位)
底座命令(glance/ground/detect/crop/trace/pixel-diff)已覆盖通用识图能力,
本场景把它们组织成一个一致的流程和输出格式,作为看图类请求的**兜底场景**。
没有单独的新能力——是"验证底座已满足 + 统一调用方式"。
## 触发场景
- 描述照片/场景/示意图:"这张图是什么 / 描述一下"
- 关于图片的问答:"图里有几个人 / 这个页面有没有广告 / 路上是什么车"
- 定位元素:"烟囱在哪里 / 找出图中所有红色物体"
- 对比:"这两张图有什么区别"
- 判断性问答:"这个证书是真是假 / 这截图是哪个软件"
## 工作流
**Pass 1 — 先问清楚再回答**
- 对"是什么/描述/内容判断"类:`glance "<图>" -q "<问题>"`(或直接 --ocr 若问题只是读字)
- 对"对比"类:`glance "<图1>" "<图2>" -q "<问题>"` —— **一张调用里传两张图**,别分开调用
- 对"是否变化"类:先 `pixel-diff "<图1>" "<图2>"` 拿到差异框,再对差异框
`glance --region` 读内容。模型答"变了没变"是抛硬币,pixel-diff 是像素级的。
**Pass 2 — 定位与放大**
- 问"在哪里":`ground "<图>" "<目标描述>"` → 得到 `x1,y1,x2,y2` 像素框
- **"第几个同类"(如第 3 根柱)别直接 ground**:序数定位模型不稳。先 `detect "<图>" "<种类>"`
全量枚举(每个带坐标),按坐标/标签挑目标,再对框放大。实测范例:`detect 图 "bars"` 精确返回
Q1@165-255、Q2@327-417、Q3@489-579、Q4@651-741,按 x 范围即知第 3 根是 489-579。
- 框内细节看不清:`glance "<图>" --region X1,Y1,X2,Y2 -q "<问题>"`(上传裁剪放大)
- 要数"所有同类":`detect "<图>" "<种类>"`(枚举清单 + 坐标)
- 框要反复用:`crop "<图>" --region ... -o "<局部>.png"` 切出来
**Pass 3 — 交叉验证像素级事实**
- 颜色、精确尺寸、小偏移:别信 prose。用 `palette` 取色号,用 `trace`/`crop` 量几何。
## 输出格式
```markdown
## 图像问答结果
**图片**:<路径> **问题**:<用户问题>
### 回答
<直接回答,引用图上的具体证据>
### 证据(坐标 / 局部)
- 目标位置:`x1,y1,x2,y2`
- 相关局部:<crop 出的文件,供主模型/用户复���>
### 不确定点
- <哪里看不清、哪些是推测、哪些需要原图确认>
```
## 工具与能力边界(实测记录)
| 需求 | 工具 | 实测表现 |
|---|---|---|
| 描述/问答 | glance -q | 强:照片场景光线/主体/细节都能说清 |
| 读字 | glance --ocr | 强:正文/代码逐字转录 |
| 元素定位 | ground | 可用;"第几个同类"易错位,改用 detect 枚举再缩小 |
| 元素枚举 | detect | 强:图例/刻度/组件全枚举+坐标