ml-multimodallisted
Install: claude install-skill fieldlu/Machine-learning-skills
# 多模态建模决策 — 单模态够不够,融合怎么融
## R — 原文 (Reading)
> (转述)Radford 等提出 CLIP:放弃固定类别标签,改用自然语言作监督——对 4 亿网络图文对做对比学习,把配对图文的表征拉近、错对的推远;由此学得的联合嵌入空间支持零样本迁移:新分类任务无需训练,把类别名写成句子编码后与图像表征比相似度即可分类。
>
> — Alec Radford 等, "Learning Transferable Visual Models From Natural Language Supervision" (ICML 2021)
> (转述)多模态文献的长期共识:融合时机是核心设计轴——早期融合在输入/特征层拼接(信息全但噪声互扰),晚期融合在各模态独立预测后合并(稳健且天然抗单模态缺失,代价是丢失跨模态交互),注意力中间融合让一个模态的表示动态查询另一模态(表达力强,成为当前主流);没有普适最优,选择取决于模态间互补度与数据规模。
>
> — 多模态融合方法族的综述共识(Baltrušaitis 等综述以来的通行的三分法)
---
## I — 方法论骨架 (Interpretation)
**第一问永远是"单模态够吗"**。加模态的理由必须来自信息增量:任务里存在只有另一模态才携带的信息(视频鉴伪要看音频、商品搜索要图配文)。如果文本已经够用(多数纯文档任务),上多模态只会带来标注成本、对齐工程与过拟合风险——多一个模态不是免费的升级,是翻倍的失败面。
**融合三型按互补结构选**:
- **早期(特征级)**: 各模态编码后在特征层拼接进统一模型——适合两模态细粒度交织的任务(VQA 里问题决定看图的哪里),但对单侧噪声敏感;
- **晚期(决策级)**: 各模态独立建模、输出层投票/加权——适合模态质量参差或常缺一侧的场景(医疗影像+化验单,缺哪路都能出预测),代价是无法学到"图像细节呼应文字描述"这类交互;
- **中间(注意力级)**: 一个模态的 token 对另一模态做 cross-attention——表达力最强、当前主流,但需要更多数据与调参功夫。
**CLIP 的核心直觉值得单独掌握**:它证明了"对齐"本身就是一种强大的预训练——不用人工标注类别,只要海量图文对 + 对比损失,就能学出一个图像与语言共享的语义空间;零样本迁移是这个空间的免费赠品(分类变成"图和哪个类名最像")。这改变了范式:多模态能力可以来自"对齐现成单模态骨干",不必从零联合训练。
**现实的两块硬骨头**:①**模态缺失**是常态而非异常——真实管线里图片会加载失败、某模态历史数据就是稀疏;设计时要问"缺一侧还能不能跑",晚期融合天然抗缺失,早/中融合需要缺失感知的训练策略;②**模态不平衡**——一个模态信号强/数据多时会主导训练,另一个沦为装饰品(模型名义上是双模态实际只用了单模态),诊断手段是单模态消融对照。
**评测的特殊性**:多模态任务的分数提升要拆开审——是真融合收益还是某个模态单独就够(消融检验);跨模态检索类指标与下游任务表现不总是一致;且基准污染同样存在(测试图文对可能进了预训练语料)。
---
## A1 — 文献中的经典应用 (Past Application)
*(本批主题超出西瓜书覆盖范围,A1 改引学界公认的经典案例与公开记录)*
### 案例 1: CLIP 的零样本 ImageNet 实验
- **问题**: 传统视觉模型的迁移路线是"ImageNet 预训→下游