video-voiceover

Solid

把带时间戳的 narration.json 合成为中文解说音频。使用 MiMo TTS(mimo-v2.5-tts)逐段生成语音, 按时间窗动态适配语速并处理响度;输入输出时间线上的旁白,产出 tts_segments 与 tts_meta.json。 旧版直接剪辑路径也可显式传入 narration_mapped.json。触发词:配音、语音合成、TTS、解说配音、 voiceover、text to speech、旁白配音。

AI & Automation 419 stars 68 forks Updated yesterday MIT

Install

View on GitHub

Quality Score: 90/100

Stars 20%
87
Recency 20%
100
Frontmatter 20%
70
Documentation 15%
90
Issue Health 10%
80
License 10%
100
Description 5%
100

Skill Content

## 1. 定位 本技能读取带时间戳的旁白稿,为每一段生成独立音频,并把语音适配到对应时间窗,随后记录下游合成所需的放置元数据。 当前唯一引擎是 MiMo TTS(`mimo-v2.5-tts`)。 ## 2. 环境要求 ```bash export MIMO_API_KEY=*** # 也可使用仅供 TTS 的 MIMO_TTS_API_KEY ``` 下面的 `scripts/...` 均相对于本技能目录。若执行器从仓库根目录启动,请给脚本路径加上本技能的绝对目录。 脚本不从其他技能目录读取文件;外部输入仅限命令显式传入的稿件、音频、参数与 `work_dir` 产物。 ## 3. 输入契约 默认输入为 `work_dir/narration.json`。每段必须包含 `start`、`end` 与 `narration`,可选字段包括 `pause_after_ms` 和 `overlaps_speech`。时间统一表示音频最终放置的**输出时间线秒数**。 编排式 cut 流程直接使用输出时间的 `narration.json`。只有旧版直接剪辑路径需要显式传入 `narration_mapped.json`。 ## 4. 运行命令 ```bash python3 scripts/voiceover.py --work-dir <work_dir> --narration <narration.json> \ [--mimo-voice 冰糖 | --voice-ref <reference-audio>] ``` 单独运行且省略 `--narration` 时,默认读取 `work_dir/narration.json`。旧版路径如需映射后的稿件,必须显式传入: ```bash python3 scripts/voiceover.py --work-dir <work_dir> \ --narration <work_dir/narration_mapped.json> ``` ## 5. 输出契约 - `tts_segments/*.wav`:每段旁白对应一个音频文件。 - `tts_meta.json`:包含 `segments`、`engine` 与 `narration`。每段记录 `audio_path`、时间、 `pause_after_ms` 和放置字段。 - 干净运行写入 `partial: false` 与 `failures: []`。 - 使用 `--allow-partial-tts` 跳过失败段时,写入 `partial: true` 和 `failures: [{index,start,end,text,error}]`,让缺失语音保持可见。 ## 6. 运行规则 - 重跑只复用内容与 TTS 设置均匹配的分段音频;修改旁白或合成参数后,只重生成受影响的 WAV。 - `--voice-ref` 仅用于 full/cut 解说克隆,切换到 `mimo-v2.5-tts-voiceclone`。仅在确需新合成时惰性规范化一次; - dub voiceclone 原始 WAV 也会用模型、提示、台词和参考音频指纹缓存;匹配重跑不再重复请求或计费,`dub_manifest.json` 逐行记录 `tts_cache=hit|miss`; 参考音频内容或预处理指纹变化会使旧缓存失效。仅在获得授权后使用,参考音频会发送到 MiMo。 - `TTS_WORKERS`、...

Details

Author
worldwonderer
Repository
worldwonderer/video-recap-skills
Created
2 months ago
Last Updated
yesterday
Language
Python
License
MIT

Bundled in these plugins

Similar Skills

Semantically similar based on skill content — not just same category

AI & Automation Solid

video-recap

从输入视频端到端生成中文解说成片。用户提供 .mp4 / .mov / .mkv / .webm,并要求添加旁白、 配音、总结、短剧/电视剧/电影/纪录片/科普解说时使用。负责编排 video-* 技能链:视频理解 → Agent 制定故事与视听方案 → 剪辑 → 配音 → 合成。触发词:视频解说、视频旁白、生成解说、 视频 recap、video recap、voiceover、narration、auto-dub、recap。

419 Updated yesterday
worldwonderer
Code & Development Listed

interflow-ip-video

把中文文稿做成 Interflow Bold-Mono 竖屏口播视频——火山引擎声音复刻配音(你自己的克隆音,1.2x 紧凑口播)、RMS 响度包络驱动口型的常驻 IP 小人(浮动/眨眼/点头/指向/抬手/欢迎)、暗底网格+辉光线稿的数据可视化(d3 平滑图表/迁移弧线/时间轴/象限等 10+ 种形式)、玻璃拟态词级字幕,渲染成 1080x1920 MP4。用户说「IP 小人视频 / 用我的声音出片 / interflow 风格文生视频 / bold-mono 出片」,或给一段中文文稿要做成带小人配音的竖屏视频时使用。

0 Updated 4 days ago
derek-zhuolin
AI & Automation Solid

video-understanding

把视频分析为结构化理解索引:场景检测、ASR 转写、逐场景 VLM 观察、静音窗口、融合时间线和写作 brief。 用于理解、索引或总结视频,也作为后续创作前的分析阶段。输入视频文件;输出 scenes.json、 asr_result.json、vlm_analysis.json、silence_periods.json、timeline_fusion.json、agent_narration_brief.md。 触发词:视频理解、视频分析、视频索引、video understanding、analyze video、看懂视频。

419 Updated yesterday
worldwonderer