video-voiceover

Featured

把带时间戳的 narration.json 合成为中文解说音频。使用 MiMo TTS(mimo-v2.5-tts)或 Fish Audio(s2.1-pro-free)逐段生成语音, 按时间窗动态适配语速并处理响度;输入输出时间线上的旁白,产出 tts_segments 与 tts_meta.json。 旧版直接剪辑路径也可显式传入 narration_mapped.json。触发词:配音、语音合成、TTS、解说配音、 voiceover、text to speech、旁白配音。

AI & Automation 505 stars 96 forks Updated 6 days ago MIT

Install

View on GitHub

Quality Score: 94/100

Stars 20%
90
Recency 20%
100
Frontmatter 20%
70
Documentation 15%
100
Issue Health 10%
50
License 10%
100
Description 5%
100

Skill Content

## 1. 定位 本技能读取带时间戳的旁白稿,为每一段生成独立音频,并把语音适配到对应时间窗,随后记录下游合成所需的放置元数据。 默认引擎是 MiMo TTS(`mimo-v2.5-tts`);也可显式选择 Fish Audio(默认模型 `s2.1-pro-free`)。 ## 2. 环境要求 ```bash export MIMO_API_KEY=*** # 也可使用仅供 TTS 的 MIMO_TTS_API_KEY # 或改用 Fish Audio TTS export TTS_PROVIDER=fish-audio export FISH_API_KEY=*** export FISH_TTS_REFERENCE_ID=<voice-model-id> # 可选;覆盖内置“娱乐扒妹”音色 ``` 下面的 `scripts/...` 均相对于本技能目录。若执行器从仓库根目录启动,请给脚本路径加上本技能的绝对目录。 脚本不从其他技能目录读取文件;外部输入仅限命令显式传入的稿件、音频、参数与 `work_dir` 产物。 ## 3. 输入契约 默认输入为 `work_dir/narration.json`。每段必须包含 `start`、`end` 与 `narration`,可选字段包括 `pause_after_ms` 和 `overlaps_speech`。时间统一表示音频最终放置的**输出时间线秒数**。 编排式 cut 流程直接使用输出时间的 `narration.json`。只有旧版直接剪辑路径需要显式传入 `narration_mapped.json`。 ## 4. 运行命令 ```bash python3 scripts/voiceover.py --work-dir <work_dir> --narration <narration.json> \ [--tts-provider auto|mimo-tts|fish-audio] \ [--mimo-voice 冰糖 | --voice-ref <reference-audio>] ``` 单独运行且省略 `--narration` 时,默认读取 `work_dir/narration.json`。旧版路径如需映射后的稿件,必须显式传入: ```bash python3 scripts/voiceover.py --work-dir <work_dir> \ --narration <work_dir/narration_mapped.json> ``` ## 5. 输出契约 - `tts_segments/*.wav`:每段旁白对应一个音频文件。 - `tts_meta.json`:包含 `segments`、`engine` 与 `narration`。每段记录 `audio_path`、时间、 `pause_after_ms` 和放置字段。 - 干净运行写入 `partial: false` 与 `failures: []`。 - 使用 `--allow-partial-tts` 跳过失败段时,写入 `partial: true` 和 `failures: [{index,start,end,text,error}]`,让缺失语音保持可见。 ## 6. 运行规则 - 重跑只复用内容与 TTS 设置均匹配的分段音频;修改旁白或合成参数后,只重生成受影响的 WAV。 - `auto` 优先使用已配置的 MiMo,MiMo...

Details

Author
zenstory-ai
Repository
zenstory-ai/video-recap-skills
Created
4 months ago
Last Updated
6 days ago
Language
Python
License
MIT

Similar Skills

Semantically similar based on skill content — not just same category

AI & Automation Featured

video-voiceover

把带时间戳的 narration.json 合成为中文解说音频。使用 MiMo TTS(mimo-v2.5-tts)或 Fish Audio(s2.1-pro-free)逐段生成语音, 按时间窗动态适配语速并处理响度;输入输出时间线上的旁白,产出 tts_segments 与 tts_meta.json。 旧版直接剪辑路径也可显式传入 narration_mapped.json。触发词:配音、语音合成、TTS、解说配音、 voiceover、text to speech、旁白配音。

505 Updated 6 days ago
worldwonderer
AI & Automation Listed

fish-tts

使用 Fish Audio API 把文字转成语音(TTS):朗读文本、生成配音/旁白、制作有声内容、把文章/台词/字幕/脚本转成 mp3/wav/pcm/opus 音频文件。当用户要求"文字转语音"、"语音合成"、"朗读这段话"、"把这段文字变成音频/MP3"、"配音"、"AI 语音"、"有声书"或任何需要把文本变成人声文件的需求时,都使用本技能——即使用户没有提到 Fish Audio 或 API。当用户要求带情绪/带感情/用某种语气朗读、想控制语音情绪(开心、生气、悲伤等)、加笑声/叹气/停顿等效果时也使用本技能。本技能自带零依赖 Python 脚本和 config.json,允许用户配置 API key、TTS 模型(s2.1-pro / s2.1-pro-free / s2-pro / s1)、默认音色(reference_id)以及格式、码率、语速、音量、延迟等全部常用参数;支持在文本中插入情绪与语气标记(S2 系列用 `[方括号]` 自由自然语言、s1 用 `(圆括号)` 英文固定标签)控制语音表现力。

0 Updated 5 days ago
Sallyn0225
AI & Automation Solid

wjs-voicedrop-reading-aloud

Use when the user wants text turned into an audiobook / read aloud — they give a passage, a file, a URL, or a VoiceDrop article and want an mp3 narration with expressive voices. Triggers — "做成有声书", "朗读出来", "读给我听", "念出来", "read aloud", "/wjs-voicedrop-reading-aloud".

129 Updated 3 weeks ago
jianshuo