← ClaudeAtlas

ml-neural-traininglisted

神经网络训练决策纪律:何时用 NN、结构怎么定、训不动怎么救。用户说"神经网络不收敛/loss 不下降""该几个隐藏层""learning rate 怎么调""梯度消失",或训练振荡、不同种子结果差异巨 大、纠结早停时机时激活。动作:判可分性定结构下限(非线性可分必须加隐层)→按 loss 曲线分 诊病因→多组初值/模拟退火/SGD 跳局部极小(无理论保障)→早停+正则化两手。不适用于:横向选 型(ml-task-matching)、训练正常但泛化差的归因(ml-diagnosis)。trigger: neural network not training, backpropagation, hidden layer, local minimum, early stopping, 梯度消失。
fieldlu/Machine-learning-skills · ★ 0 · AI & Automation · score 66
Install: claude install-skill fieldlu/Machine-learning-skills
# NN 训练决策纪律 — 先问结构够不够,再怪训练不给力 ## R — 原文 (Reading) > "BP 算法基于梯度下降(gradient descent)策略,以目标的负梯度方向对参数进行调整。" > > — 周志华,《机器学习》第5章 5.3节 "误差逆传播算法" > "学习率η∈(0,1)控制着算法每一轮迭代中的更新步长,若太大则容易振荡,太小则收敛速度又 > 会过慢。有时为了做精细调节,可令式(5.11)与(5.12)使用 η₁,式(5.13)与(5.14)使用 η₂, > 两者未必相等。" > > — 周志华,《机器学习》第5章 5.3节 > "如果误差函数具有多个局部极小,则不能保证找到的解是全局最小。……需注意的是,上述用于 > 跳出局部极小的技术大多是启发式,理论上尚缺乏保障。"(边注:"但是也会造成'跳出'全局 > 最小") > > — 周志华,《机器学习》第5章 5.4节 "全局最小与局部极小" --- ## I — 方法论骨架 (Interpretation) 把神经网络当成"若干光滑函数相互嵌套代入、内含大量待定参数的数学模型",训练就是一个参数寻优过程。于是"训不动"永远要先分三层排查,而不是上来就怪数据或怪玄学: 1. **结构层(容量够不够)**:单层功能神经元只能解线性可分问题,非线性可分问题(典型如 XOR)必须引入隐层——这不是调参能绕过的数学边界。 2. **优化层(走得动不走得动)**:梯度下降的步伐由学习率控制,太大振荡、太小龟速;误差曲面常有多个局部极小,梯度一旦为零更新即停,收敛点未必是全局最优。 3. **泛化层(该不该停)**:训练误差持续下降可能正在过拟合,需要早停和正则化(对连接权与阈值平方和施罚)来管理风险。 三层各有专属旋钮,混着拧等于掷硬币。正确的顺序永远是:先确认结构配得上问题,再治优化,最后管泛化。 --- ## A1 — 书中的应用 (Past Application) ### 案例 1: 感知机解决与/或/非、却倒在异或门前 (c16) - **问题**: 单层感知机的能力边界到底在哪? - **方法论的使用**: 作者手工给出权重演算——w₁=w₂=1,θ=2 得"与"、θ=0.5 得"或"、w₁=-0.6,θ=-0.5 得"非":三者线性可分,感知机能学;但异或非线性可分,学习过程必然振荡、w 无法稳定。 - **结论**: 线性可分 ⇔ 感知机必收敛;非线性可分 ⇔ 永不收敛。出路是加一层功能神经元(两层感知机即可解异或)。 - **结果**: 由此引出多层前馈网络与 BP 算法的必要性;章末小故事补充历史教训——闵斯基《感知机》(1969) 把这一局限过度推广,让整个神经网络研究进入"冰河期"。 ### 案例 2: BP 在迷你西瓜数据上的训练可视化 (c17) - **问题**: "误差逆传播逐步调整连接权与阈值"究竟是怎样一个动态过程? - **方法论的使用**: 在 2 属性 5 样本的西瓜子集上跑标准 BP,抓拍第 25/50/100 轮的网络参数与分类边界:第 25 轮输出杂乱(0.14/0.63/0.06/0.66),第 50 轮出现大权重,第 100 轮边界清晰分开好瓜坏瓜。 - **结论**: 分类边界是随训练轮数逐渐"成形"的;配套给出累积误差 vs 单样本更新之分,以及过拟合的两手缓解——早停与 λ 折中的正则化项。 - **结果**: 确立了"看曲线形态做训练诊断"的观察方式,而非只盯最终公式。 --- ## A