harness-evolvelisted
Install: claude install-skill AgentGameLab/skills
# Harness Evolve — Agent 系统自进化引擎
> 一次运行 = 一条完整闭环:**搜前沿 → 读懂它 → 照镜子 → 分级动手**。
> 不是"读论文写笔记",也不是"盲目自动重构",而是把研究发现和系统自检结果,
> 用同一套风险分级规则,转成**安全、可验证、可回滚**的动作。
---
## v3.0 定位说明
v1.x/v2.x 把"只研究"和"消费研究 + 执行"拆成两个 skill(harness-research / harness-evolve),
理由是怕研究阶段的直觉污染执行判断。实践下来,多数使用场景是单 Agent 单会话跑一次就想要结果,
拆两个 skill 只是增加了"先跑哪个、日志同不同步"的心智负担。
v3.0 合并成一条流程,但**把原来靠"物理隔离两个 skill"守住的安全边界,改成靠"流程内部的强制关卡"守住**:
研究结论不能跳过风险分级直接变成执行动作——第 4 步系统自检和第 5 步分级执行之间必须有明确判断,
高风险项(L3)依然禁止在本次运行内直接改文件。**边界没有消失,只是从"两个文件"收进了"一个流程里的强制关卡"。**
---
## 一句话定位
当你想让一个**正在运行的 Agent workspace** 持续变好时,用这个 skill 跑一次:
1. 向外看世界(outward):最近 ≤3 天 Agent harness / 记忆编排 / 多智能体领域有什么新发表
2. 向内照镜子(inward):当前系统配置有没有冗余、冲突、积压、退化
3. 向后落地(action):能安全直接改的直接改,中风险的写提案等审核,高风险的只记录不动手
**终点不是"我看了什么",而是"系统今天有没有变得更清楚、更少冲突、更少债务"。**
---
## 职责边界
### 本 skill 负责
- 读取当前项目 / workspace 的真实配置结构,找到真正决定行为的文件
- 在时间窗口内搜索前沿材料并精读分析
- 对当前系统做结构自检(冗余/冲突/积压/退化/债务)
- 把研究发现 + 自检结果,按 L1/L2/L3 风险分级转成动作
- 写入统一进化日志,输出可用于日报的摘要
### 本 skill 不负责
- 不允许"觉得有启发"直接等于"应该立刻上线"——必须过风险分级
- 不在没有安全边界定义(safe_files / review_file 未知)时改任何文件
- 不对高风险项(DB migration、auth/RLS、CI/CD、删 ADR)动手,只能观察上报
- 不重复分析日志里已出现过的标题 / URL
- 不用平庸内容凑数——没发现就写没发现
一句话:**这条流程可以又搜又改,但改多深由风险分级说了算,不由"看起来值得"说了算。**
---
## 执行约束(贯穿全程)
- **证据优先**:结论必须有论文/文章/工程案例依据,直觉只能指导搜索方向
- **场景优先**:从当前 workspace 的真实问题倒推,不从"这个论文看起来很酷"正推
- **单变量**:每条落地建议只描述一个主要变量,避免捆绑多个改动
- **诚实高于数量**:没有高质量发现 / 没有系统问题,就如实记录,不用平庸内容污染日志
- **去重铁律**:已记录过的标题 / URL 不重复分析,哪怕换了搜索词命中
- **风险分级不可跳过**:任何"可落地方向"落地前,必须先过第 5 步的 L1/L2/L3 判断
---
## 第 0 步:读取项目 /