← ClaudeAtlas

ml-prompting-methodologylisted

提示即编程:把 prompt 当代码做版本管理与回归测试。当用户问 few-shot 示例怎么选、思维链 CoT 何时有用、输出格式总不稳定、"prompt 改来改去时好时坏"时激活。纪律:回归测试集驱动迭代, 禁止无评估的玄学改写;few-shot 按多样性+代表性选择并固定顺序;CoT 只在多步推理任务启用, 简单分类纯属浪费;结构化输出靠 schema 约束而非口头祈求。不适用于:要不要升级到微调的档位 决策(ml-pretraining-paradigm)。触发词: prompt engineering, few-shot, chain-of-thought, 输出不稳定, prompt 回归测试
fieldlu/Machine-learning-skills · ★ 0 · AI & Automation · score 66
Install: claude install-skill fieldlu/Machine-learning-skills
# 提示工程方法论 — 把 prompt 当代码做回归测试 ## R — 原文 (Reading) > (转述)Brown 等发现:大模型的少样本能力对提示构造高度敏感——示例的选择、顺序乃至格式都会显著改变表现;同一模型不同提示间的差距可与不同方法间的差距一样大,因此提示本身是需要谨慎设计的对象。 > > — Tom Brown 等《Language Models are Few-Shot Learners》(NeurIPS 2020) > (转述)Wei 等提出思维链提示:在少样本示例中附带中间推理步骤,可显著提升算术、常识与符号推理类任务的性能——其收益是推理规模带来的涌现性质,小模型上并不出现。 > > — Jason Wei 等《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》(NeurIPS 2022) --- ## I — 方法论骨架 (Interpretation) 提示工程最大的误区是把它当"文字润色玄学":凭感觉改措辞、碰运气换示例、好坏全看当天模型心情。本 skill 的立场是:**prompt 是代码**——有输入分布、有行为逻辑、有 bug,因此也应该像软件一样被测试和管理。 四个子系统: - **示例选择系统**: few-shot 示例不是装饰而是"上下文中的程序"。按覆盖多样性 + 与查询的相似度选择,控制顺序偏差(同一组示例换个顺序结果会变),示例格式必须与期望输出严格一致。 - **推理链系统**: 思维链是给多步推理任务的专用工具——让模型把中间步骤显式写出以减少跳步错误;在简单分类/抽取任务上它只增加 token 成本与延迟而不增加正确率。先判断任务是否有"中间步骤",再决定是否上 CoT。 - **结构化约束系统**: 输出格式的稳定性靠 schema(JSON Schema/类型声明/字段枚举)约束 + 失败重试解析,不靠在 prompt 里反复礼貌恳求。 - **版本管理与评估系统**: 每个 prompt 改动 = 一次代码提交;固定一个回归测试集(几十条覆盖典型与边界的样本),每次改动跑分对比,涨了才合入。没有评估的 prompt 迭代等于闭眼开车。 这条骨架直接回应 GPT-3 论文披露的核心事实——提示敏感性是真实存在的系统性现象,对抗它的唯一武器就是评估驱动的受控迭代。 --- ## A1 — 文献中的经典应用 (Past Application) *(本批主题超出西瓜书覆盖范围,A1 改引奠基文献的经典案例,均为学界公认的原始实验叙述)* ### 案例 1: GPT-3 论文对提示敏感性的系统实测 - **问题**: 少样本性能到底受哪些提示因素影响?影响多大? - **方法论的使用**: 作者固定模型、逐一变换单一因素做消融:示例数量(0→1→…)、示例顺序、示例格式、是否自然语言任务描述。 - **���论**: 全部因素都有实质影响——示例数带来平滑增益但边际递减;顺序波动可使方差大到"相当于换一个方法";元描述与格式一致性各有独立贡献。 - **结果**: 这组消融成为"提示是被设计的对象而非附属品"的直接证据,也定义了本 skill "单变量改动+���定评估集"纪律的出处。 ### 案例 2: 思维链的适用边界实验 - **问题**: 让模型"一步一步想"是不是对所有任务都有效? - **方法论的使用**: Wei 等在三类任务(算术应用题、常识问答、符号推理