transcript-fixlisted
Install: claude install-skill kau10082/transcript-fix
# transcript-fix — 醫學逐字稿校稿與語意重建 Skill v4
## 用途與定位
處理「語音轉文字後辨識錯誤密集」的醫學演講/會議稿。這類稿件的問題不是錯字,而是**語意層次破損**:藥名、生物標記、試驗名稱、數據被聽錯,甚至整段被誤判成英文。本 skill 把「邊修邊保守、絕不捏造」的校稿流程固定下來。
**核心心法:不要在壞掉的副本上硬加工,先回上游拿更好的輸入。**
---
## 第一步:開場就索取兩個高槓桿輸入
在動手改稿前,**主動詢問**使用者是否能提供以下兩者(不要埋頭改單一壞稿):
1. **一份以上的額外獨立逐字稿**(不同 ASR 引擎,如 NotebookLM 或 Whisper;**越多越好,2–4 份交叉效果最佳**)→ 用於多稿 diff。多稿一致=高信心;分歧=鎖定真正疑點。這是讓品質跳級的最大槓桿。稿數越多,可用「多數決」收斂的疑點越多。
2. **講者的投影片 / 參考文獻頁**(PDF 或圖)→ 試驗名稱、數據、圖表、架構幾乎都在 deck 上,一頁可解掉大半「待確認」。
> 若兩者皆無,仍可進行單稿重建,但須明白告知:準確度上限有限,且「試驗名稱、病例數字」這類幾乎無法靠文字端還原。
---
## 第二步:載入術語詞庫(Notion Glossary 資料庫)
詞庫的**唯一即時來源**是使用者在自己 Notion 建立的 **Glossary 資料庫**(欄位規格與建法見 `docs/notion-setup.md`)。**本步驟為可選,需要 Notion 連接器(MCP)**;若該對話未啟用,先詢問使用者是否開啟。**若使用者不開啟、環境沒有 Notion、或查詢失敗,跳過本步驟,以空詞庫繼續後續流程(不要卡在這裡反覆要求)**,並在產出的「校稿說明」註明:本場未載入詞庫,術語還原僅靠多稿比對與上下文。
> ⚠️ 機敏資訊分離:Glossary 資料庫的 data source ID 與頁面 URL 屬個人 Notion workspace,已抽至**同目錄的 `config.local.json`**(被 `.gitignore` 排除,不上傳 GitHub)。本檔不得再寫死任何 ID。
> 啟動本 skill 時,先讀取 `config.local.json`,取得:
> - `glossaryDataSource` → Glossary 資料庫(`collection://...`)
> - `glossaryPage` → Glossary 頁面 URL
>
> 若 `config.local.json` 不存在,提示使用者:「請複製 `config.example.json` 為 `config.local.json` 並填入你的 Notion Glossary ID」,並停止後續查庫動作。**但流程不中斷**——比照上面「無 Notion」的處理:跳過本步驟、以空詞庫繼續,並在校稿說明中註明。
接著:
1. 判斷本場逐字稿屬於哪個主題(主題 slug 由使用者在詞庫「主題」欄自訂,例如 airway/cardio/icu…)。
2. 用 Notion 查該資料庫、以「主題」欄過濾,取該主題的列當對照基準(欄位:正確術語/誤判片段/類別/備註);**不需載入全部主題**。
3. 若沒有相符主題,先沿用最接近者,並在校稿後依「詞庫維護」於資料庫新增該主題的列(主題欄填新 slug,如 icu、cardio)。
- 詞庫是會複利的**即時資產**,不再放