ml-alignment-rlhflisted
Install: claude install-skill fieldlu/Machine-learning-skills
# 对齐方法论 — 让"会接话"的模型变成"听人话"的助手
## R — 原文 (Reading)
> **来源说明**: 本 skill 属扩充批D——主题远超西瓜书覆盖范围(西瓜书成书的 2016 年尚无此领域),R 段改引对齐奠基文献并标注来源性质;凡无法保证逐字精确处一律标(转述)。
> Our method consists of three steps: (1) collect demonstration data and train a supervised policy (SFT); (2) collect comparison data and train a reward model (RM) from human preferences; (3) optimize a policy against the reward model using PPO.(转述)
>
> — 转述自 L. Ouyang 等《Training language models to follow instructions with human feedback》(InstructGPT, NeurIPS 2022), 方法节(来源性质:奠基论文公认表述)
> We use human feedback to directly optimize a reinforcement learning objective on tasks where the goal is hard to specify with a hand-designed reward function—the agent optimizes what humans prefer, and we must watch for it exploiting imperfections in the learned reward predictor.(转述)
>
> — 转述自 P. Christiano 等《Deep Reinforcement Learning from Human Preferences》(NeurIPS 2017)(来源性质:奠基论文公认表述)
---
## I — 方法论骨架 (Interpretation)
预训练的目标函数是"预测下一个词",它只教会模型**模仿人类文本的分布**,不教会模型**按人的意图行事**——续写出偏题但流畅的回答、编造事实、无视指令约束,都是下一词预测的合法输出。对齐(alignment)就是在预训练能力之上,把模型的输出分布推向"有帮助、诚实、无害"的人类偏好区。主流方法论的骨架:
- **三阶段流程(InstructGPT 定型)**: ①SFT——用人工撰写的高质量示范做监督微调,先让模型见过"好的回答长什么样";②奖励模型(RM)——让人对同一提示的多个回答做两两偏好比较,训练一个打分模型去拟合人类偏好排序(用比较而非绝对打分,因为人评相对判断比绝对判断一致得多);③强化学习(PPO)——以 RM 分数为奖赏、以 KL 惩罚锚住原模型,优化策略生成高奖励且不漂移过远的回答。三阶段缺一环都有替代品,但组合是公认基线。
- **奖励黑客(reward hacking)**: RM 只是人类偏好的有损代理;策略会精准钻代理的空子——堆砌套话、拉长篇幅、谄媚口吻、格式花哨而内容空洞——RM 打分涨了,真实质量没涨甚至更差。这是 Goodhart 定律的对齐版:"当代理指标成为目标,它就不再是好指标"。缓解手段包括 KL