incidentlisted
Install: claude install-skill kimsanguine/hplan
# Agent Incident Response
> 에이전트 장애 대응 프로토콜 — 발견, 분류, 대응, 복구, 학습
## Core Goal
- **에이전트 장애를 신속하게 감지하고 대응** — 침묵의 실패(Silent Failure)를 조기에 찾아내고 격리
- **블래스트 반경을 제한하고 영향 최소화** — 영향받은 사용자/비용 범위를 정확히 파악 후 신속 복구
- **장애 경험을 암묵지로 추출** — TK로 기록해서 비슷한 실패의 재발 방지
---
## Trigger Gate
### Use This Skill When
- 에이전트 정확도가 급락(> 10% 한 번에)했을 때
- 비용이 갑자기 폭증(2배 이상)했을 때
- PII 또는 민감 정보 유출 신호가 있을 때
- 사용자 신고 또는 SNS 부정적 언급이 들어왔을 때
- 내부 QA/모니터링에서 에러율 급증을 탐지했을 때
### Route to Other Skills When
- **reliability** (Pre-mortem 섹션) → 장애 원인 분석 후 유사 실패 예방 메커니즘 설계
- **ops-review --mode cost** → 비용 폭증이 토큰 사용량 이상이라면 (비용 최적화 필요)
- **reliability** → 장애 복구 후 신뢰성 개선 계획 수립
- **metrics-design** (코호트 분석 섹션) → 특정 버전/세그먼트만 장애를 겪었다면 (코호트 분석)
### Boundary Checks
- **실제 장애 vs 정상 변동** — Accuracy 1-2% 변화는 정상 범위, > 5% 이상이면 조사
- **원인 판단 과정** — 5 Whys를 최소 3단계 이상 실행해야 근본 원인 파악 가능
- **영향도 산정 정확성** — 추정이 아닌 실제 영향받은 사용자/트래잭션 로그 기반 확인
---
## 개념
에이전트 장애는 일반 소프트웨어 장애와 다르다. "서버가 죽었다"는 명확하지만, "에이전트가 환각으로 잘못된 답을 줬다"는 발견 자체가 어렵다. 침묵의 실패(Silent Failure)가 에이전트 장애의 가장 위험한 유형이다.
## Instructions
You are running **incident response** for: **$ARGUMENTS**
### Step 1 — Incident Detection & Classification
```
발견 시각: [timestamp]
발견 방법:
□ 자동 모니터링 알림
□ 사용자 신고
□ 내부 QA 발견
□ 비용 이상 감지
□ 외부 보고 (SNS, 언론)
```
**Severity Classification:**
| SEV | 정의 | 예시 | 대응 시간 |
|-----|------|------|----------|
| **SEV-1** | 전체 서비스 중단 또는 데이터 유출 | 에이전트가 PII를 외부에 노출 | 15분 이내 |
| **SEV-2** | 핵심 기능 장애, 다수 유저 영향 | 정확도 50% 이하로 급락, 비용 10배 폭등 | 1시간 이내 |
| *