← ClaudeAtlas

harness-benchlisted

Use when 룰/스킬/agents 파일 변경 후 효과 측정. Before/After 동일 작업 재실행하여 토큰·정확도·횟수 비교. 변경 효과 가시화.
DaeSeokSong/oh-my-ouroboros · ★ 1 · AI & Automation · score 72
Install: claude install-skill DaeSeokSong/oh-my-ouroboros
# Harness Bench (Before/After 측정) > **목적**: 시스템 변경(룰/스킬/agents)의 효과를 객관적으로 측정한다. "감으로 좋아진 듯"이 아닌 "수치로 N% 개선" 보고. ## 트리거 | 트리거 | 시점 | |--------|------| | 명시적 호출 (`/harness-bench init "..."`) | 측정 시작 | | learner 자동 룰 추가 직후 | 신규 룰의 효과 검증 | | 사용자 "효과 측정해" / "비교해" 명시 | 즉시 | ## 사용 흐름 ### 1. 초기화 ``` bash ~/.claude/scripts/harness-bench.sh init "loss function 수정 작업" "bench-loss-202605" ``` → `~/.claude/_bench/bench-loss-202605.md` 생성 ### 2. Before 측정 (변경 전 상태에서 작업 실행) 1. 동일 작업을 변경 **전** 룰로 실행 2. 결과 수집 (예: QA 통과 여부, 시도 횟수, 사용 토큰, 사용자 개입 횟수) 3. 기록: ``` bash ~/.claude/scripts/harness-bench.sh before "bench-loss-202605" "시도 3회, 사용자 개입 2회, QA FAIL 1회 후 통과" ``` ### 3. 룰/스킬 변경 적용 ### 4. After 측정 (변경 후 상태에서 동일 작업 실행) 1. 동일 작업을 변경 **후** 룰로 실행 2. 결과 수집 3. 기록: ``` bash ~/.claude/scripts/harness-bench.sh after "bench-loss-202605" "시도 1회, 사용자 개입 0회, QA 1회 통과" ``` ### 5. 비교 보고 스크립트가 자동으로 Before/After 차이 stdout 출력. ## 측정 지표 권장 (Anthropic 하네스 강화 루프) | 지표 | 의미 | 좋은 변화 | Gate 역할 | |------|------|---------|----------| | 시도 횟수 (`attempts`) | 작업 완료까지 반복 | 감소 | **게이트 대상** | | 사용자 개입 (`interventions`) | main 에스컬레이션 횟수 | 감소 | **게이트 대상** | | QA FAIL (`qa_fail`) | 검증 실패 횟수 | 감소 | **게이트 대상** | | 사용 토큰 (`tokens`) | 누적 토큰 (대략) | 감소 | **모니터 전용 — 게이트 제외** (Goodhart 차단) | | 작업 시간 | 시작~완료 시간 | 감소 | 참고 | | preference-gate 통과율 | gate exit 0 비율 (3사이클 기준) | 증가 | 메타 지표 | | tier별 후보 수 | Tier-1 통과 / reject 후보 건수 | Tier-1 통과↑ | 메타 지표 | ## Mem0 통합 After 측정 완료 시 `code_pattern` 카테고리에 효과 저장: ``` add_memory( text=