wjs-voicedrop-reading-aloud

Solid

Use when the user wants text turned into an audiobook / read aloud — they give a passage, a file, a URL, or a VoiceDrop article and want an mp3 narration with expressive voices. Triggers — "做成有声书", "朗读出来", "读给我听", "念出来", "read aloud", "/wjs-voicedrop-reading-aloud".

AI & Automation 123 stars 18 forks Updated today MIT

Install

View on GitHub

Quality Score: 86/100

Stars 20%
70
Recency 20%
100
Frontmatter 20%
70
Documentation 15%
100
Issue Health 10%
80
License 10%
100
Description 5%
100

Skill Content

# wjs-voicedrop-reading-aloud 文字 → 有声书 mp3。不是照字面念,而是先**编排**:不同性质的内容换不同声音,关键转折处加语音指令,然后用火山引擎豆包 seed-tts-2.0 合成。 合成工具:`~/code/volcano-tts/tts.py`(先 `source ~/code/.env`)。 ## 铁律 1. **绝不把带【】/[ ] 标注的文本直接喂裸 API** —— 裸 API 会把标注原样念出来(实测实锤)。永远走 `tts.py`,它把标注切段转成 `context_texts` 语音指令。 2. **只能用 2.0 音色(`_uranus_bigtts` 后缀)** —— moon/mars/tob 音色在 seed-tts-2.0 资源下报错 `resource ID is mismatched`。 3. **合成前把编排好的朗读脚本给用户看一眼**(除非用户说直接出)——编排是再创作,声音分配和指令值得确认。headless/自动化场景跳过此步。 ## 工作流 ### 1. 取内容并认真通读 - 纯文本/文件:直接读。 - URL:WebFetch;SPA 页面(如 docs.volcengine.com)用 browse skill 渲染后取正文。 - VoiceDrop 文章:voicedrop MCP 的 `read_article`。 通读时标记出:正文叙述 / 直接引用(引号、blockquote)/ 大白话吐槽与内心 OS / 数据、列表、表格 / 标题与小节。 ### 2. 编排重写成朗读脚本 这是核心步骤,是**重写**不是转录: - 去掉一切视觉残留:markdown 符号、链接、图片说明、脚注编号。 - 表格、列表、数据改写成口语句子(「三个原因:第一…」)。 - 标题不逐字念,化进过渡句,或用停顿+换气带过。 - 太书面的长句改口语,但保留作者的用词风格。 - **按内容性质分配音色**(见音色表):正文一个主声贯穿;引用换引用声;吐槽/大白话换插话声。声音切换是给听众的「格式信号」,等价于视觉上的引用块。 - 不要频繁换声:一般 2~3 个声音封顶,切换只发生在内容性质真正变化处。 ### 3. 加语音指令(克制) 在句前加 `[心理活动、细腻表情、肢体动作等描述]`,如 `[放慢,一字一顿,点出要害]`。 - **只在需要的地方加**:情绪转折、节奏变化、重音、引用的口吻模仿。平铺直叙的段落一个不加,靠全局指令兜底。 - 经验密度:每 3~5 句最多一处;一段平静的叙述可以整段没有。 - 每处标注就是一次切段(一次 API 调用+拼接点),切太碎会让语流变散。 - 标注写成对朗读者说的表演提示(心理活动/表情/动作皆可),不要写成对听众的说明。 - **指令要戏剧化、情绪化才有效**(实测):模型对情绪/音色类指令跟随很强(哭腔、耳语、亢奋大喊、像法官宣判、+50% 时长级别的变化),对含蓄舞台提示(「语气一沉」「带一丝惋惜」)和机械精确指令(「停顿一秒」「放慢一倍」)跟随很弱。写法上宁可夸张:「请把声音压到接近耳语,凑近话筒,像说破一个秘密」远强于「压低声音」。 ### 4. 朗读脚本格式(tts.py --script) ``` # 注释行 @voice narrator zh_male_yuanboxiaoshu_uranus_bigtts @voice quote zh_male_yizhipiannan_uranus_b...

Details

Author
jianshuo
Repository
jianshuo/claude-skills
Created
3 months ago
Last Updated
today
Language
Python
License
MIT

Integrates with

Bundled in these plugins

Similar Skills

Semantically similar based on skill content — not just same category

AI & Automation Listed

fish-tts

使用 Fish Audio API 把文字转成语音(TTS):朗读文本、生成配音/旁白、制作有声内容、把文章/台词/字幕/脚本转成 mp3/wav/pcm/opus 音频文件。当用户要求"文字转语音"、"语音合成"、"朗读这段话"、"把这段文字变成音频/MP3"、"配音"、"AI 语音"、"有声书"或任何需要把文本变成人声文件的需求时,都使用本技能——即使用户没有提到 Fish Audio 或 API。当用户要求带情绪/带感情/用某种语气朗读、想控制语音情绪(开心、生气、悲伤等)、加笑声/叹气/停顿等效果时也使用本技能。本技能自带零依赖 Python 脚本和 config.json,允许用户配置 API key、TTS 模型(s2.1-pro / s2.1-pro-free / s2-pro / s1)、默认音色(reference_id)以及格式、码率、语速、音量、延迟等全部常用参数;支持在文本中插入情绪与语气标记(S2 系列用 `[方括号]` 自由自然语言、s1 用 `(圆括号)` 英文固定标签)控制语音表现力。

0 Updated today
Sallyn0225
AI & Automation Featured

video-voiceover

把带时间戳的 narration.json 合成为中文解说音频。使用 MiMo TTS(mimo-v2.5-tts)逐段生成语音, 按时间窗动态适配语速并处理响度;输入输出时间线上的旁白,产出 tts_segments 与 tts_meta.json。 旧版���接剪辑路径也可显式传入 narration_mapped.json。触发词:配音、语音合成、TTS、解说配音、 voiceover、text to speech、旁白配音。

467 Updated 3 weeks ago
worldwonderer
AI & Automation Solid

wjs-publishing-books-to-x

Use when 王建硕 wants to publish his VoiceDrop books (voicedrop.cn/books) to X/Twitter as threads — 列出他写的书、挑没发过的、整本拆成推文串发出。Triggers — "把书发到 X", "发书的 thread", "publish my book to X", "书架的书发推", "/wjs-publishing-books-to-x".

123 Updated today
jianshuo