lov-describe-image
Solid给纯文本模型"看图":调用智谱 GLM-4V-Flash(免费)把图片转成文字描述。当用户要求描述/识别/读取图片,或任务里出现图片文件(截图/图表/照片)而当前模型无法直接看图时,优先调用本 skill。需要图片磁盘路径,可附带具体问题。
Install
Quality Score: 84/100
Skill Content
Details
- Author
- lovstudio
- Repository
- lovstudio/skills
- Created
- 5 months ago
- Last Updated
- today
- Language
- Python
- License
- MIT
Bundled in these plugins
Similar Skills
Semantically similar based on skill content — not just same category
llm-image-bridge
纯文本模型(DeepSeek/GLM 等)图像识别桥接。当当前模型不具备多模态视觉能力(如 deepseek-v4-pro、deepseek-v4-flash、glm-5.3、glm-5.2 等)且用户输入图片(路径/截图/粘贴图片/要求"看这张图")时,自动调用 OpenAI 兼容协议的视觉模型(千问 Qwen3-VL、智谱 GLM-4.6V、GPT-5.5、Gemini 3 等,可在配置中切换)识别图片内容,将文字描述作为上下文供当前模型使用。适用于 Claude Code、Codex 等任意支持 Skills 或能执行脚本的 AI Agent。触发词:图片、截图、看这张图、识别图片、分析图片。
vision-skill
国产大模型生态的视觉层 / Visual layer for Chinese LLM ecosystem. 为纯文本 AI 模型提供深度图像理解能力 / Deep visual understanding for text-only models. 通过硅基流动 Qwen/Qwen3.5-4B 视觉多模态模型桥接(可切换智谱 GLM-4.6V-Flash),支持场景图、空间推理、上下文分析、情感解读、因果推理链、追问查询 / Bridges text-only LLMs (GLM-5.2, DeepSeek, Qwen, GPT) with visual understanding via SiliconFlow Qwen/Qwen3.5-4B (or Zhipu GLM-4.6V-Flash): scene graphs, spatial reasoning, contextual analysis, emotional interpretation, causal reasoning chains, follow-up visual queries. 当用户提供图片(路径或 URL)并要求理解、分析、描述、识别、推理、提取文字、回答关于图片的问题时触发 / Activate when the user provides an image (file path or URL) and asks to understand, analyze, describe, recognize, reason about, or extract text from it. 兼容任何遵循 Agent Skills 开放标准的框架 / Works with any Agent framework following the Agent Skills open standard.
agent-vision
当主模型不支持图像输入,而用户要求查看、读取、描述或分析图片/截图时使用。调用 agent-vision see 把图片交给免费视觉模型(默认智谱 glm-4v-flash),并把识别结果作为回答依据。