any-video-to-textlisted
Install: claude install-skill roy0102152879-blip/any-video-to-text
<!--
本 skill 不需要任何 API Key、Token 或环境变量:模型在本机跑,音频不出本机。
frontmatter 里没有 requires.env / primaryEnv,就是因为确实一个都不需要。
-->
# any-video-to-text
视频链接或本地音视频 → **文字稿(纯文本 + 时间戳两版)**。
不调用任何云端接口,不需要密钥,不花钱,音频不出本机。
## 能转什么
**网上的**:B站(含收藏夹、合集、番剧)、YouTube、抖音、微博、知乎、小红书、西瓜视频、TikTok…… 底层用 yt-dlp,支持 1700 多个站点。
> 快手目前不支持。
**本机的**:会议录音、访谈、播客、课程录屏。`.mp3 .wav .m4a .aac .flac .ogg .opus / .mp4 .mov .mkv .avi .webm .flv` 都行。
这条是很多人真正需要的:**内部会议录音不能传给第三方接口**,本地跑就没这个顾虑。
## 装
```bash
pip install faster-whisper
brew install yt-dlp ffmpeg # Windows 用 winget/scoop,或到官网下载
```
苹果自研芯片(M 系列)的 Mac 再装一个,会快很多:
```bash
pip install mlx-whisper
```
首次运行会自动下载模型(1~3 GB,看你选哪个),之后离线可用。
## 用
```bash
# 视频链接
python3 scripts/transcribe.py "https://www.bilibili.com/video/BVxxxxx"
# 本地录音
python3 scripts/transcribe.py ~/Desktop/周会录音.m4a
# 批量:清单文件里每行一个链接或路径
python3 scripts/transcribe.py --file links.txt
# 换更准的模型 / 换输出目录 / 关掉词表
python3 scripts/transcribe.py URL --model large
python3 scripts/transcribe.py URL --out ~/Documents/文字稿
python3 scripts/transcribe.py URL --prompt-file none
# 外语视频(默认按中文转,转英文/日文内容必须加这个)
python3 scripts/transcribe.py URL --lang auto
python3 scripts/transcribe.py URL --lang en
```
> 默认 `--lang zh`。**转 YouTube 上的英文内容记得改**,否则模型会硬按中文听,出来是乱码。
产物是一份 Markdown,默认落在 `./transcripts/`,含元信息、纯文字稿、时间戳稿。
## 模型怎么选
| `--model` | 实际模型 | 什么时候用 |
|---|---|---|
| `turbo`(默认) | large-v3-turbo | 日常够用,比 large 快好几倍 |
| `large` | large-v3 | 中文口音重、术语密、要引用原话 |
| `medium` / `small` | medium / small | 老机器、没有独