← ClaudeAtlas

ml-hpo-strategylisted

超参搜索 (HPO) 算法选型手册。当用户要调超参、纠结网格/随机/贝叶斯优化(TPE)/Hyperband 选哪种、问搜索空间怎么设计(对数尺度?哪些参数值得搜)、预算只够 N 次 trial 怎么分配、 或搜索跑一半没起色想止损时激活。 trigger: hyperparameter search/tuning 超参搜索、grid search 网格搜索、random search 随机搜索、Bayesian optimization 贝叶斯优化、Optuna、Hyperband、调参预算止损。 不适用于: 未做归因就开搜(先 ml-diagnosis,偏差主导时白搜)、实验记账 (ml-experiment-tracking)、六问总审(ml-pitfall-audit)。
fieldlu/Machine-learning-skills · ★ 0 · AI & Automation · score 66
Install: claude install-skill fieldlu/Machine-learning-skills
# 超参搜索策略 — 把调参预算花在会还债的地方 ## R — 原文 (Reading) > **来源说明**: 本 skill 属批C"工程实践共识"系列——《机器学习》(西瓜书)对调参仅有 f12 一句 > 折中原则(见下),不含搜索算法选型;R 段改引业界公开文献并标注来源性质;凡无法保证逐字 > 精确处一律标(转述)。 > Random search works better than grid search when only a few dimensions influence performance, because it samples each dimension more finely for the same budget.(转述) > > — 转述自 James Bergstra & Yoshua Bengio, "Random Search for Hyper-Parameter Optimization", JMLR 2012(其思想可溯至 Lieberman 1958 对随机搜索优势的早期观察;来源性质:业界公认论文) > Hyperband allocates budget by aggressively stopping unpromising configurations early and giving survivors more resources.(转述) > > — 转述自 Li 等, "Hyperband: A Novel Bandit-Based Approach to Hyperparameter Optimization", JMLR 2017(来源性质:业界公认论文) ### 书内锚点 (唯一相关原文) > 参数候选值较少时可用密间距小步逼近……训练数据量大时可选取少量候选值……本质上是一种折中:计算开销与性能估计之间的折中。 > > — 转述自周志华《机器学习》第2章 2.3节关于调参��讨论(工程界编号 f12) --- ## I — 方法论骨架 (Interpretation) 调参 = 在有限 trial 预算下做最优分配。四种主流策略各答一个不同的问题: 1. **网格搜索**: "每种组合都要吗?"——枚举全部笛卡尔积。只在维度 ≤3 且每维候选少时合理;高维下预算被均匀稀释在无关维度上。 2. **随机搜索**: 同样预算撒随机点。关键洞察是**重要维度通常很少**——随机采样让重要维度获得远多于网格的有效分辨率(网格把每个维度锁死在少数几个��值的乘积里)。零基础设施成本,永远是合格基线。 3. **贝叶斯优化 (TPE/SMAC/GP)**: 用历史 trial 结果建代理模型,下一trial采在"可能好"与"不确定"的平衡点。样本贵(每次训练几小时)时省 trial 数;但自身有开销、并行扩展差、且假设相邻配置表现平滑。 4. **Successive Halving / Hyperband**: 不学代理模型,改做**预算分配**——大量配置先给小额资源跑,砍掉一半差的,幸存者加倍资源,多轮淘汰。适合"早停信号可靠"的场景(epoch 数、subset 训练)。 配套纪律三条:**空间按参数性质设计**(学习率/正则强度跨数量级→对数尺度采样;离散结构类如树深→整数格点;且先问该参数是否真值得搜);**验证集是唯一裁判**(对着测试集调参=测试集泄漏进训练过程);**设止损线**(连续 N 个 trial 无提升即停,或预算烧完即报——不许"再试一