← ClaudeAtlas

blind-ab-verifylisted

防污染盲测 A/B 闭环 —— 改动落地后,两个变体谁更好且需要人工盲读时,用隔离分臂子代理生成、 盲包组装(含阳性/阴性对照 + do-no-harm 硬门)、四栏盲评、回灌解析、三段式 verdict, 并强���声明保真度天花板(prompt-level ≠ live pipeline)。 当用户说「A/B 验证这个改动」「盲测一下」「打出来我盲读」「防止上下文污染」「两版哪个好」 「/blind-ab-verify」,或一个 skill/prompt 改动已落地、需要在不被变体标签污染的前提下判两版优劣时使用。 不适用于:动工前的对抗式方案设计 / 审查(用 debate 或 codex-review-gate,属左移); 单轮无对照的主观比稿;需要真实线上流量的效果实验(那要 eng-gated 的 live-RPC)。 单版复现:「帮我盲跑一遍这个 skill 看说明书全不全」「干净目录独立复现」「skill 打包验收」 "blind-repro this skill package" → 走模式 B(单版说明书完备性、非两版对比)。
aaronartistzhang-afk/DailyWork · ★ 1 · AI & Automation · score 75
Install: claude install-skill aaronartistzhang-afk/DailyWork
# blind-ab-verify(防污染盲�� A/B 闭环) 改动已经落地了(新版 prompt / 新版 skill / 两版文案),现在要回答一个问题:**新版真的更好吗,还是只是我以为更好?** 人一旦知道「哪个是我改的新版」,盲读就废了——会不自觉地帮新版找优点。本 skill 把这道判断固化成一条闭环:**每个变体交给一个完全隔离、不知道自己是哪一臂的子代理生成 → 打成去标签的盲包(含对照组)→ 你本人离线盲读打分 → 回灌解析 → 三段式 verdict + blind-packet 留痕。** 从生成到打分,谁是新版这件事对判者永远保密,直到回灌那一刻。 **它不产 PRD、不设计方案、不做线上实验**——**模式 A** 只在「改动已落地、要判两版优劣、且这个判断必须人工盲读」这个窄口上工作(单版 skill 包能否独立跑通见下方**模式 B**)。 ## 何时用 / 不用 - **用**:一个 prompt / skill 改动已经落地,要在不被变体标签污染的前提下判新旧两版谁更好;两版一句话文案要盲读选一个;怀疑之前的「新版更好」结论是自己脑补出来的,想要一次干净的复验。 - **不用**: - **动工前**要对抗式地设计 / 审查方案(找漏洞、定结构、GO/NO-GO)→ 用 `debate`(生成 PRD)或 `codex-review-gate`(跨模型审查门禁)。这两个是**左移**——在改动**之前**。本 skill 是**右移**——在改动**之后**判效果。 - 需要真实线上流量、真实用户行为的效果验证 → 那是 eng-gated 的 live-RPC / `custom_rpc_server` 实验,**不是本 skill 能做的**(见下方「保真度天花板」——本 skill 只能到 prompt-level,越过这条线的主张一律标 UNPROVEN)。 - 单轮、无对照、纯主观的比稿 → 直接比即可,不必上盲测机器(**若目的是验单个 skill 包能否照说明书独立跑通,见下方模式 B**)。 **一句话分工判据**:动工前的对抗设计 / 审查 = 左移(`debate` / `codex-review-gate`);改动落地后两个变体谁更好且需人工盲读 = 右移**模式 A**、单个 skill 包独立复现验收 = 右移**模式 B**(均**本 skill**)。底座是 `dispatching-parallel-agents` 的并行原语,本 skill 在其上加一层**盲测语义**(去标签、对照、盲序、回灌)。 --- ## 铁律一:分臂隔离(防污染的地基) **每一臂 = 一个独立子代理,彼此不共享上下文。** 这是整套方法的地基,塌了后面全废。分臂子代理一律 `model=opus`(执行层模型分工惯例)。 给每个分臂子代理的 prompt 必须满足**分臂三铁律**: 1. **无变体标签**:prompt 里不出现「这是新版 / 旧版 / OLD / NEW / 变体 A / 你是被改进的那个」。子代理不知道自己是哪一臂。 2. **无假设**:不写「我们认为新版会更自然」「预期这版能修好掉奖问题」。任何方向性暗示都会让子代理往那个方向使劲,制造伪信号。 3. **无预期结果**:不写「应该输出带奖励的文案」「理想情况下 CTR 更高」。让它按 prompt 本身产出,不迎合。 配套两条硬约束: 4. **版本 pin 死**:每臂用到的 ski