ml-pitfall-auditlisted
Install: claude install-skill fieldlu/Machine-learning-skills
# ML 前提审计清单 (Pitfall Audit)
## R — 原文 (Reading)
> "此类方法有一个关键:模型假设必须准确,即假设的生成式模型必须与真实数据分布吻合;
> 否则利用未标记数据反倒会降低泛化性能。遗憾的是,在现实任务中往往很难事先做出准确的
> 模型假设,除非拥有充分可靠的领域知识。"
>
> — 周志华《机器学习》第13章13.2节
> "再缩放的思想虽简单,但实际操作却并不平凡,主要因为'训练集是真实样本总体的无偏采样'
> 这个假设往往并不成立,也就是说,我们未必能有效地基于训练集观测几率来推断出真实几率。"
>
> — 周志华《机器学习》第3章3.6节
---
## I — 方法论骨架 (Interpretation)
机器学习教科书教的是"前提成立时怎么办";这个 skill 处理的是**前提本身塌了**的情形。书里每个流行技巧背后都藏着一个几乎从不被检查的前提:再缩放假设训练集无偏采样(x18)、交叉验证 t 检验假设错误率独立采样(x11)、极大似然假设分布族正确(x27)、集成指数下降假设误差独立(x32)、半监督假设未标记样本同分布且"相似样本相似输出"(x45)、一切离线评估假设没有信息泄露(x15/x43)。这些前提单独看都是某章的一个脚注,但它们共享同一个结构:**结论的有效范围由一条未被观测的假设决定,且假设失效时的症状恰好长得像"方法不太行"或"运气不错"**——于是被误诊为调参问题或好消息。本 skill 把六个前提聚成一张上线前检查表:每一问都有明确的诊断信号(可观测)、失效后果(可预期)与修正动作(可执行),把"事后翻车归因"前移为"事前三十秒审查"。
---
## A1 — 书中的应用 (Past Application)
### 案例 1: 半监督的反噬警告 (x45, 配 c32)
- **问题**: 西瓜地里只有少量瓜知道好坏(有标记),大量瓜不知道——直接利用未标记瓜一定能提升模型吗?
- **方法论的使用**: 作者先摆出正面机制(聚类假设/流形假设桥接有标记与未标记),随即给出惊悚反转:生成式方法的模型假设不准时,海量未标记数据会把模型拽偏,泛化性能**下降**而非上升;并介绍 S4VM 式最坏情形保护。
- **结论**: 未标记数据不是免费午餐,使用前必须验证桥接假设,并保留纯监督基线对照。
- **结果**: "假设错了会倒扣分"成为全书前提审查主题最强的跨章证据之一。
### 案例 2: 高维小样本下的完美表现 (x15 并入 x43)
- **问题**: p/n=50 的回归任务 R²=0.95、线性 SVM 训练精度 100%——该高兴吗?
- **方法论的使用**: 作者指出高维小样本下普通最小二乘秩亏、闭式解失效,解凭实现细节随机;而"完美线性可分"可能恰是过拟合假象(升维总能分开=记住噪声)。
- **结论**: 训练集满分是红旗不是捷报;动作是加正则、调小 C、交叉验证复核,而非庆祝上线。
- **结果**: 与验证集设计纪律合并,构成第六问"完美表现是不是泄露/过拟合"的诊断原型。
---
## A2 — 触发场景 (Future Trigger) ★
### 用户会在什么情境下需要这个 skill?
1. 离线 AUC 涨了 5 个点、上线后效果持平甚至下跌,找不到原因。
2. 模型表现"好得不真实"(99%+ 准确率、R²=0.95 on p≫n),想确认是不是哪里出了问题。
3. 论文投稿前自查,或审稿人质疑"10