ml-automl-naslisted
Install: claude install-skill fieldlu/Machine-learning-skills
# AutoML 与 NAS — 自动化的是选择,不是判断
## R — 原文 (Reading)
> **来源说明**: 本 skill 属扩充批D——主题超出西瓜书覆盖范围(西瓜书 f12 仅一句调参折中原则),R 段改引 AutoML/NAS 奠基文献并标注来源性质;凡无法保证逐字精确处一律标(转述)。
> Neural architecture search is defined by three components: a search space (which architectures can be represented), a search strategy (how the space is explored), and a performance estimation scheme (how candidate architectures are measured).(转述)
>
> — 转述自 T. Elsken 等《Neural Architecture Search: A Survey》(JMLR 2019), 第1节(来源性质:综述公认表述)
> Training each candidate to convergence is prohibitively expensive; methods therefore use fewer epochs, smaller proxies, or weight sharing—but these lower-fidelity estimates introduce bias and noise into the search.(转述)
>
> — 转述自 T. Elsken 等 (JMLR 2019) 第4节;另见 B. Zoph & Q. Le《Neural Architecture Search with Reinforcement Learning》(ICLR 2017) 中以并行训练与早停控制成本的实践(来源性质:奠基论文公认表述)
---
## I — 方法论骨架 (Interpretation)
AutoML 的本质是把"人肉试错做选择"换成"机器在定义好的空间里搜"。它自动化的只是**选择环节**,而选择的前提——空间怎么定、数据是否干净、目标是什么——仍然是人的责任。
- **AutoML 解决什么**: 表格任务的 pipeline 组合(特征预处理×��型族×超参的三重选择,如 Auto-sklearn/TPOT 的贝叶斯优化+元学习+集成);超参搜索自动化(Optuna/Hyperband);以及最深的一档——架构本身的搜索(NAS)。共同前提是:**候选空间有限且可枚举/可采样,单次评估可自动化,评价目标单一明确**。
- **NAS 三要素**: ①搜索空间——允许哪些结构存在(层数范围/算子集合/连接方式);空间太窄搜不出超越设计者的东西,太空宽则搜索成本指数爆炸;②搜索策略——在空间里怎么走(强化学习/进化算法/贝叶斯优化/可微松弛 DARTS 类);③性能估计——怎么给每个候选拍板。三要素互相牵制:空间决定策略可行性,估计精度决定策略能否学到真信号。
- **代理指标陷阱**: 完整训练每个候选不可承受,于是用少 epoch/小数据子集/权重共享(one-shot/supernet)来估性能——但这些低保真信号有系统性偏差:早停分数与最终收敛性能的相关性并不保证,权重共享下各候选互相干扰导致排名失真。**用代理指标选出的 top