ml-hpo-strategylisted
Install: claude install-skill fieldlu/Machine-learning-skills
# 超参搜索策略 — 把调参预算花在会还债的地方
## R — 原文 (Reading)
> **来源说明**: 本 skill 属批C"工程实践共识"系列——《机器学习》(西瓜书)对调参仅有 f12 一句
> 折中原则(见下),不含搜索算法选型;R 段改引业界公开文献并标注来源性质;凡无法保证逐字
> 精确处一律标(转述)。
> Random search works better than grid search when only a few dimensions influence performance, because it samples each dimension more finely for the same budget.(转述)
>
> — 转述自 James Bergstra & Yoshua Bengio, "Random Search for Hyper-Parameter Optimization", JMLR 2012(其思想可溯至 Lieberman 1958 对随机搜索优势的早期观察;来源性质:业界公认论文)
> Hyperband allocates budget by aggressively stopping unpromising configurations early and giving survivors more resources.(转述)
>
> — 转述自 Li 等, "Hyperband: A Novel Bandit-Based Approach to Hyperparameter Optimization", JMLR 2017(来源性质:业界公认论文)
### 书内锚点 (唯一相关原文)
> 参数候选值较少时可用密间距小步逼近……训练数据量大时可选取少量候选值……本质上是一种折中:计算开销与性能估计之间的折中。
>
> — 转述自周志华《机器学习》第2章 2.3节关于调参��讨论(工程界编号 f12)
---
## I — 方法论骨架 (Interpretation)
调参 = 在有限 trial 预算下做最优分配。四种主流策略各答一个不同的问题:
1. **网格搜索**: "每种组合都要吗?"——枚举全部笛卡尔积。只在维度 ≤3 且每维候选少时合理;高维下预算被均匀稀释在无关维度上。
2. **随机搜索**: 同样预算撒随机点。关键洞察是**重要维度通常很少**——随机采样让重要维度获得远多于网格的有效分辨率(网格把每个维度锁死在少数几个��值的乘积里)。零基础设施成本,永远是合格基线。
3. **贝叶斯优化 (TPE/SMAC/GP)**: 用历史 trial 结果建代理模型,下一trial采在"可能好"与"不确定"的平衡点。样本贵(每次训练几小时)时省 trial 数;但自身有开销、并行扩展差、且假设相邻配置表现平滑。
4. **Successive Halving / Hyperband**: 不学代理模型,改做**预算分配**——大量配置先给小额资源跑,砍掉一半差的,幸存者加倍资源,多轮淘汰。适合"早停信号可靠"的场景(epoch 数、subset 训练)。
配套纪律三条:**空间按参数性质设计**(学习率/正则强度跨数量级→对数尺度采样;离散结构类如树深→整数格点;且先问该参数是否真值得搜);**验证集是唯一裁判**(对着测试集调参=测试集泄漏进训练过程);**设止损线**(连续 N 个 trial 无提升即停,或预算烧完即报——不许"再试一