← ClaudeAtlas

ml-cnn-visionlisted

卷积网络适用判断与设计纪律。用户问"该不该用 CNN/图像怎么设计""卷积核/感受野/池化和 BatchNorm 放哪"、"ResNet 为何有效"、拿 CNN 做表格序列数据时激活。动作: 验卷积归纳偏好 匹配(局部性/平移不变)→组件链(小核堆叠/池化/BN)→演进逻辑(VGG→ResNet 残差动机)→何时 不用 CNN;含 ViT 对先验价值重估。不适用于: 跨族选型(ml-transformer-era)、训练排障 (ml-deep-training-playbook)。trigger: CNN convolution 卷积, receptive field, residual
fieldlu/Machine-learning-skills · ★ 0 · AI & Automation · score 66
Install: claude install-skill fieldlu/Machine-learning-skills
# 卷积网络的适用判断 — 归纳偏好匹配了才值得用 ## R — 原文 (Reading) > **来源说明**: 本 skill 属扩充批D——主题超出西瓜书覆盖范围(西瓜书第 5 章未涉及卷积网络),R 段改引 CNN 奠基文献并标注来源性质;凡无法保证逐字精确处一律标(转述)。 > Convolutional networks combine three architectural ideas to ensure some degree of shift and distortion invariance: local receptive fields, shared weights, and spatial or temporal sub-sampling.(转述) > > — 转述自 Y. LeCun 等《Gradient-Based Learning Applied to Document Recognition》(Proc. IEEE, 1998), 即 LeNet-5 论文(来源性质:奠基论文公认表述) > Degradation is not caused by overfitting: deeper plain networks have higher *training* error. We hypothesize that it is easier to optimize the residual mapping than the original, unreferenced mapping—letting stacked layers fit F(x) = H(x) − x, so H(x) = F(x) + x with identity shortcuts.(转述) > > — 转述自 K. He 等《Deep Residual Learning for Image Recognition》(CVPR 2016)(来源性质:奠基论文公认表述) --- ## I — 方法论骨架 (Interpretation) 用不用 CNN,取决于数据的**信号结构**与卷积的**归纳偏好**是否对得上,而不是"这是不是图像任务"的表面标签: - **归纳偏好三件套**: 局部性(相邻像素相关性强,特征先在小邻域内提取)、参数共享(同一模式在图中任何位置同样有用——平移不变性)、下采样层次化(浅层边缘纹理→深层部件语义)。信号满足这三条(图像、谱图、某些时频表示)→ 卷积是高性价比先验;不满足 → 先验变成枷锁。 - **组件决策链**: ①感受野靠堆叠——两层 3×3 等效 5×5 视野但参数更少、非线性更多,VGG 式小核堆叠是默认;②池化的职责是把空间分辨率降下来换取平移鲁棒性与计算量控制,现代替代品是步长卷积;③BatchNorm 插在卷积后、激活前,让深层堆叠可训(其工程细节归 `ml-deep-training-playbook`);④通道数随深度递增、分辨率随深度递减,是"语义变浓、位置变粗"的标准交换。 - **架构演进逻辑**: LeNet 证明手写数字可端到端;AlexNet 靠 GPU+ReLU+Dropout 把同一思想放大到 ImageNet;VGG 用统一的小核堆叠把"深度换表达力"推到 19 层;再加深撞上**退化问题**——更深的普通网络训练误差反而更高(优化困难而非过拟合)。ResNet 的残差连接 F(x)+x 给恒等映射留出默认通路,梯度获得跨层高速通道,上百层从此可训。 - *