← ClaudeAtlas

ml-deep-training-playbooklisted

深度网络训练不动的系统排查纪律。当用户报"loss 不降/NaN/训练发散"、纠结初始化(Xavier/He)、 BatchNorm 还是 LayerNorm、Adam 还是 SGD、warmup、梯度消失爆炸怎么治时激活。核心动作:按 "数据管道→小样本过拟合→初始化归一化→学习率扫描→优化器调度→梯度监控"固定顺序排除, 先廉价检查后昂贵实验,每步带完成标准与判停条件。不适用于:训练正常但泛化差(ml-diagnosis)、 架构未定(ml-transformer-era)。触发词: loss 不降, NaN, diverge, gradient vanishing, warmup, Adam vs SGD
fieldlu/Machine-learning-skills · ★ 0 · AI & Automation · score 66
Install: claude install-skill fieldlu/Machine-learning-skills
# 深度训练排障手册 — 训练不动时按固定顺序逐层排除 ## R — 原文 (Reading) > (转述)Glorot 与 Bengio 主张:初始化应让信号在前向与反向传播中都保持稳定的方差尺度,否则深层网络的激活与梯度会随深度指数衰减或放大;He 等随后针对 ReLU 的单边响应修正方差系数,使极深���络从第一步起就能有效收敛。 > > — Xavier Glorot & Yoshua Bengio (2010);Kaiming He 等《Delving Deep into Rectifiers》(2015) > (转述)Ioffe 与 Szegedy 提出:把每层输入按 mini-batch 统计量重新标准化,可显著缓解训练中层间输入分布的持续漂移,从而允许更大学习率、放宽对初始化的敏感度;训练用批统计量、推理须换滑动平均统计量。 > > — Sergey Ioffe & Christian Szegedy《Batch Normalization》(2015) > (转述)He 等观察到 56 层普通网络的训练误差反而高于 20 层——退化源于优化困难而非过拟合;将堆叠层重构为学习相对输入的残差映射(F(x)+x)后,上百层网络得以稳定训练。 > > — Kaiming He 等《Deep Residual Learning for Image Recognition》(2016) --- ## I — 方法论骨架 (Interpretation) 深度训练失败极少是单一的神秘原因,绝大多数落在一条确定的排查链上。链的骨架由四组奠基工作搭起: - **初始化**(Glorot & Bengio 2010; He 2015)���各层激活与梯度方差若不被刻意稳定,信号会沿深度指数衰减或放大——训练不动先问"第一层出来的东西还活着吗"。 - **归一化**(BatchNorm 2015 / LayerNorm 2016):对层间输入重新标准化,允许更大学习率并放宽初始化敏感度;卷积/大批量场景 BN、序列与 Transformer 场景 LN 是当前共识分工。 - **优化器**(momentum 2013; Adam 2015; AdamW 2019):SGD+动量泛化口碑好但对超参娇气;Adam 系鲁棒省心,但权重衰减必须与自适应更新解耦(AdamW)才真正生效。 - **调度**(warmup + 余弦/线性衰减,Vaswani 2017 起):初期小步试探防热启动发散,后期退火���精修。 操作纪律三条:①先证明数据管道是通的(小样本过拟合测试),再谈优化器;②一次只动一个变量,否则涨跌都无法归因;③把梯度范数当仪表盘看——消失查激活/初始化/缺残差,爆炸上裁剪与降学习率。 --- ## A1 — 文献中的经典应用 (Past Application) *(本批主题超出西瓜书覆盖范围,A1 改引奠基文献的经典案例,均为学界公认的原始实验叙述)* ### 案例 1: ResNet 与"退化问题"的定性 - **问题**: He 等在 CIFAR-10 上发现 56 层普通卷积网的训练误差反而高于 20 层——不是过拟合(训练误差也高),是更深的网络优化不动。 - **方法论的使用**: 先把"加深必然更好"的假设拆开,确认瓶颈在优化端而非容量端;再将堆叠层重构为 F(x)+x 的残差形式,给恒等映射留出默认通路,让梯度拥有跨层高速通道。 - **结论**: 退化是优化问题而非容量问题;残差重构后 152 层网