ai-multimodal
SolidProcess and generate multimedia content using Google Gemini API. Capabilities include analyze audio files (transcription with timestamps, summarization, speech understanding, music/sound analysis up to 9.5 hours), understand images (captioning, object detection, OCR, visual Q&A, segmentation), process videos (scene detection, Q&A, temporal analysis, YouTube URLs, up to 6 hours), extract from documents (PDF tables, forms, charts, diagrams, multi-page), generate images (text-to-image, editing, composition, refinement). Use when working with audio/video files, analyzing images or screenshots, processing PDF documents, extracting structured data from media, creating images from text prompts, or implementing multimodal AI features. Supports multiple models (Gemini 2.5/2.0) with context windows up to 2M tokens.
Install
Quality Score: 82/100
Skill Content
Details
- Author
- Microck
- Repository
- Microck/ordinary-claude-skills
- Created
- 9 months ago
- Last Updated
- 4 days ago
- Language
- Python
- License
- NOASSERTION
Similar Skills
Semantically similar based on skill content — not just same category
omnimedia
Multimodal AI - Gemini for analysis (vision/transcribe/OCR/extract); image generation via Codex (ChatGPT subscription), Gemini/Imagen, OpenRouter, MiniMax; video, speech, music via Gemini + MiniMax. Use when the user asks to analyze, transcribe, OCR, or describe an image/audio/video/document, or to generate an image, video, voiceover, or music.
gemini-vision
轻量 Gemini 多模态桥接,补齐 GLM / DeepSeek 等主模型的多模态能力缺口。分析视频/图片/音频 — 提炼参考风格、核验生成质量、对比版本差异、提取可复用框架。当用户需要"看视频""听音频""分析画面""检查生成质量""提炼参考风格""对比视频版本"时触发。Lightweight Gemini multimodal bridge for Claude Code — analyze video, images, and audio when the underlying model lacks multimodal input. Triggers on "watch/analyze this video", "check generation quality", "compare versions".
ai-provider-google-gemini-sdk
Official TypeScript SDK for Google Gemini — client setup, text generation, multimodal input, function calling, structured output, streaming, embeddings, context caching, and chat sessions