video-recap

Solid

从输入视频端到端生成中文解说成片。用户提供 .mp4 / .mov / .mkv / .webm,并要求添加旁白、 配音、总结、短剧/电视剧/电影/纪录片/科普解说时使用。负责编排 video-* 技能链:视频理解 → Agent 制定故事与视听方案 → 剪辑 → 配音 → 合成。触发词:视频解说、视频旁白、生成解说、 视频 recap、video recap、voiceover、narration、auto-dub、recap。

AI & Automation 416 stars 68 forks Updated today MIT

Install

View on GitHub

Quality Score: 89/100

Stars 20%
87
Recency 20%
100
Frontmatter 20%
70
Documentation 15%
100
Issue Health 10%
80
License 10%
100
Description 5%
100

Skill Content

## 1. 定位与流程 本技能是五个独立技能的轻量编排器。各技能只通过 `work_dir` 中的 JSON / MP4 产物通信,不共享代码: ```text video-understanding ─▶ Agent 按 video-script 制定方案并写稿 ─▶ [video-cut] ─▶ video-voiceover ─▶ video-assemble ``` 流程支持断点续跑:写好 `narration.json` 后重复同一条命令即可继续。第二阶段会校验 `recap_run_manifest.json`,拒绝复用来自其他源视频或其他运行参数的旧工作目录;视频理解产物也只在来源一致时复用。 ## 2. 创作职责 这不是单纯的 JSON / 渲染流水线。Agent 是本次内容的创作负责人,在进入昂贵的下游处理前,必须按顺序完成五次判断: 1. **导演判断**:确定观众承诺、POV、戏剧问题、情绪终点,以及哪些信息要保留到后面揭示。 2. **故事编辑**:比较至少两个可行的剪辑假设,选择一条主线,并把 beat 定义为“发生了什么变化”,而不是场景摘要。 3. **画面剪辑**:选择真正值得保留的具体时刻、人物反应、入点与出点。 4. **声音/旁白**:先分配画面、原声、沉默和旁白的任务,再写解说词。 5. **观众复核**:分别检查无旁白、只听声音和第一次观看时的体验,优先修改回报最高的问题。 执行前阅读本技能的 `references/creative-editing-playbook.md`,并把简洁的创作决定写入: - `recap_story_plan.json`:导演意图、备选假设、选定主线和基于变化的 beat 图。 - `visual_audio_board.json`:每拍的画面任务、表演/反应选择、原声锚点、`audio_owner` 与 `narration_job`。 这两个文件只记录可审计的决定,不记录冗长思维过程;它们不会增加服务或渲染依赖。现有工具可以忽略它们,Agent 与建议型解说评审会用它们保持创作一致。建立这条内容基线不需要平台数据。 ## 3. 环境与脚本路径 ```bash # ffmpeg: brew install ffmpeg | apt install ffmpeg | choco install ffmpeg export MIMO_API_KEY=*** ``` 同一个 MiMo key 驱动: - ASR:`mimo-v2.5-asr` - VLM:`mimo-v2.5` - TTS:`mimo-v2.5-tts` `tp-*` Token Plan 密钥默认使用中国区集群,可用 `MIMO_TOKEN_PLAN_CLUSTER` 覆盖。 可选能力: - `--mimo-video-overview`:按场景块补充 MiMo 视频理解。 - `--mimo-qc pre-assemble|post-render|both`:在合成前、成片后或两个阶段给出建议型复核。 MiMo QC 默认关闭;每个选定阶段最多请求一次,写入 `mimo_qc.json`。任何凭证缺失、限流、超时、格式错误或采样失败都只记录状态,不阻断流程。详细可覆盖配置见 `references/config-playbook.md`。 下面的 `scripts/...` 均相对于本技能目录。若执行器从仓库根目录启动,请给脚本路径加上本技能的绝对目录。脚本启动后会自行定...

Details

Author
worldwonderer
Repository
worldwonderer/video-recap-skills
Created
2 months ago
Last Updated
today
Language
Python
License
MIT

Bundled in these plugins

Similar Skills

Semantically similar based on skill content — not just same category

AI & Automation Solid

video-understanding

把视频分析为结构化理解索引:场景检测、ASR 转写、逐场景 VLM 观察、静音窗口、融合时间线和写作 brief。 用于理解、索引或总结视频,也作为后续创作前的分析阶段。输入视频文件;输出 scenes.json、 asr_result.json、vlm_analysis.json、silence_periods.json、timeline_fusion.json、agent_narration_brief.md。 触发词:视频理解、视频分析、视频索引、video understanding、analyze video、看懂视频。

416 Updated today
worldwonderer
AI & Automation Solid

video-voiceover

把带时间戳的 narration.json 合成为中文解说音频。使用 MiMo TTS(mimo-v2.5-tts)逐段生成语音, 按时间窗动态适配语速并处理响度;输入输出时间线上的旁白,产出 tts_segments 与 tts_meta.json。 旧版直接剪辑路径也可显式传入 narration_mapped.json。触发词:配音、语音合成、TTS、解说配音、 voiceover、text to speech、旁白配音。

416 Updated today
worldwonderer
AI & Automation Featured

video-cut

把长视频按 Agent 选择的原片区间剪成短片。作为两阶段创作流程中的剪辑环节,读取 clip_plan.json 与源视频, 输出 edited_source.mp4;随后 Agent 按输出时间线写 narration.json。单独调用且未传 --no-narration-map 时, 仍支持旧版单阶段路径,把原片时间的 narration.json 映射为 narration_mapped.json。 触发词:视频剪辑、剪辑式解说、video cut、clip plan、拼剪。

416 Updated today
worldwonderer