ml-llm-evaluationlisted
Install: claude install-skill fieldlu/Machine-learning-skills
# 大模型评估纪律 — 榜单分数是参照物不是成绩单
## R — 原文 (Reading)
> (转述)GPT-3 论文在报告少样本结果的同时明确警示:训练语料与基准测试间存在意外的重叠风险,作者以 n-gram 重叠检查并声称其对结果影响轻微——但这一检查方法本身被后续工作证明是宽松的。
>
> — Tom Brown 等《Language Models are Few-Shot Learners》(NeurIPS 2020)
> (转述)Liang 等对主流模型开展大规模整体评估(HELM),主张评估应覆盖准确性之外的多维度(稳健性、公平性、偏见、效率),并以标准化协议统一测量条件,因为单榜单一维度的排名无法代表真实能力结构。
>
> — Percy Liang 等《Holistic Evaluation of Language Models》(2022)
> (转述)Zheng 等系统检验 LLM-as-judge:大模型裁判与人类偏好有较高一致率,但存在位置偏差(倾向特定答案位置)、自增强偏差(偏爱自己家族模型的输出)、长度偏差(偏爱更长的回答);可通过交换位置、多裁判等手段缓解。
>
> — Lianmin Zheng 等《Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena》(NeurIPS 2023)
---
## I — 方法论骨架 (Interpretation)
西瓜书的评估三件套(留出/交叉验证 × 度量 × 比较检验)建立在一个前提上:**测试集与训练过程严格隔离**。LLM 时代这个前提系统性崩塌——网络规模的预训练语料几乎必然吞下公开 benchmark 的题目及其变体。于是 NFL 定理的教训以新形态重演:脱离你的具体任务分布谈"哪个模型更强",与脱离问题谈算法优劣同样无意义。
四条纪律:
1. **榜单 = 参照物不是成绩单**。榜单衡量的是"在该基准分布上的表现",与你的任务分布之间的鸿沟必须用自有抽测填补;跨榜单外推排名("A 比 B 高 2 分所以选 A")是无效推理。
2. **先查污染再信分数**。任何"模型 X 在我领域数据上考了高分"都要过一遍污染检查:n-gram 重叠、成员推断迹象、"改写题目后分数跳水"的行为学探针。
3. **人工评估先定协议再收分**。没有评分细则(rubric)、没有评分者一致性指标(如 Kappa)、没有盲评,人工分数只是意见不是测量。
4. **机器裁判须校正已知偏差**。位置偏差→交换候选顺序双向评;自偏爱→避免让模型评自己家族的输出;长度偏差→报告时按长度分层核对。
总纲一句话:**评估的对象永远是"模型×任务分布"这对组合,不是模型本身。**
---
## A1 — 文献中的经典应用 (Past Application)
*(本批主题超出西瓜书覆盖范围,A1 改引奠基文献的经典案例,均为学界公认的原始实验叙述)*
### 案例 1: GPT-3 论文主动披露污染隐患
- **问题**: 网络级语料训练出的模型可能在 benchmark 题目上"见过答案",少样本成绩的可信度存疑。
- **方法论的使用**: 作者主动统计训练集与测试基准间的 n-gram 重叠率,并在剔除疑似重叠样本后复算成绩对比。
- **结论**: 报告称重叠对总体结果影响有限(转述),但承认检测手段粗糙、逐样本影响无法排除。
- **结果**: 这是头部实验室首次把污染检查写入旗舰论文的先例;其方法的宽松性后