ml-ensemble-designlisted
Install: claude install-skill fieldlu/Machine-learning-skills
# ML 集成设计:好而不同 · 降对项 · 选对通道与结合法
## R — 原文 (Reading)
> 要获得好的集成,个体学习器应"好而不同",即个体学习器要有一定的"准确性",即学习器不能太坏,并且要有"多样性"(diversity),即学习器间具有差异。
>
> — 周志华,《机器学习》第8章 8.1节
> 上式显示出,随着集成中个体分类器数目T 的增大,集成的错误率将指数级下降,最终趋向于零。然而我们必须注意到,上面的分析有一个关键假设:基学习器的误差相互独立。在现实任务中,个体学习器是为解决同一个问题训练出来的,它们显然不可能相互独立!事实上,个体学习器的"准确性"和"多样性"本身就存在冲突。
>
> — 周志华,《机器学习》第8章 8.1节
> 从偏差-方差分解的角度看,Boosting 主要关注降低偏差……Bagging 主要关注降低方差,因此它在不剪枝决策树、神经网络等易受样本扰动的学习器上效用更为明显。
>
> — 周志华,《机器学习》第8章 8.2/8.3节
> 常见做法主要是对数据样本、输入属性、输出表示、算法参数进行扰动……有一些基学习器对数据样本的扰动不敏感,例如线性学习器、支持向量机、朴素贝叶斯、k近邻学习器等,这样的基学习器称为稳定基学习器(stable base learner),对此类基学习器进行集成往往需使用输入属性扰动等其他机制。
>
> — 周志华,《机器学习》第8章 8.5.3节
> 加权平均法的权重一般是从训练数据中学习而得……较容易导致过拟合。因此,实验和应用均显示出,加权平均法未必一定优于简单平均法。……若直接用初级学习器的训练集来产生次级训练集,则过拟合风险会比较大;因此,一般是通过使用交叉验证或留一法这样的方式,用训练初级学习器未使用的样本来产生次级学习器的训练样本。
>
> — 周志华,《机器学习》第8章 8.4节
---
## I — 方法论骨架 (Interpretation)
集成不是"多训几个模型投票",而是一个有明确前提条件的设计问题,分三步走:
**第一步:判断值不值得集成。** 集成收益完全来自个体间的分歧(diversity):错误互斥的个体集成后大涨,高度雷同的个体集成后零收益白付 T 倍算力,一致地错且差的集成反而更糟。"误差独立→错误率指数下降趋于零"的漂亮结论现实中不成立——个体是为同一问题训出来的,天然相关;且准确性与多样性本身冲突,个体已很强后再强行增多样会掉准确率。所以先测成员相关性/分歧度,别急着堆数量。
**第二步:按主导误差项选路线。** 先用偏差-方差语言诊断:偏差主导(欠拟合、弱学习器)→ 走串行 Boosting,逐轮聚焦错例削减偏差;方差主导(深树、神经网络等不稳定学习器)→ 走并行 Bagging/随机森林,自助采样削方差。对已经又强又稳的模型做任何集成收益趋零。
**第三步:制造多样性靠扰动通道,结合靠策略匹配。** 注入随机性有四个旋钮:数据样本扰动、输入属性扰动、输出表示扰动、算法参数扰动——通道必须与基学习器的敏感性匹配(线性学习器/SVM/朴素贝叶斯是稳定学习器,对样本扰动不敏感,须换属性等其他通道;通道可叠加,RF=样本+属性)。结合策略按个体质量分布定:性能相近宜简单平均(加权未必更优、学得的权重还易过拟合),性能悬殊才宜加权,异质概率输出必须先校准再混投,Stacking 必须用交叉验证产生的 held-out 预测训练次级层否则泄露。
---
## A1 — 书中的应用 (Past Applicat