测验:告警疲劳
한국어 원문으로 표시합니다.
경보 피로가 생기는 근본 원인은 무엇인가?
- 개별 경보의 임계값이 자료의 분포와 맞지 않아서
- Alertmanager 의 그룹 간격이 너무 짧게 설정돼서
- 사람이 감당할 수 있는 호출 총량을 넘어서 — 규칙 하나하나는 정확해도 합이 문제다
- 경보 규칙에 runbook 링크가 없어서 대응이 느려지기 때문에
증상 기준 경보와 원인 기준 경보를 가르는 기준은?
- 사용자가 실제로 겪는 것인가, 그 결과를 만든 내부 상태인가
- 지표가 카운터인가 게이지인가
- 규칙에 for 가 붙어 있는가 없는가
- 임계값이 고정 숫자인가 예측식인가
실습에서 p99 지연 경보에 for: 5m 을 붙이자 호출이 예순다섯 번에서 여덟 번으로 줄었다. 무엇을 잃었나?
- 조건식의 정확도 — 같은 사건을 다른 임계값으로 보게 된다
- 탐지 시간 — 조건이 5분 유지된 뒤에야 울리므로 그만큼 늦게 안다
- 경보의 라벨 — for 가 붙으면 severity 라벨이 전달되지 않는다
- 과거 자료 — for 가 붙으면 구간 쿼리로 셀 수 없게 된다
'요청 수가 평소보다 적다' 는 경보가 12시간 중 609분 동안 참이었다. 이 경보를 어떻게 처리하는 것이 옳은가?
- 임계값을 더 낮춰 참인 시간을 줄이고 호출로 유지한다
- 그대로 두되 Alertmanager 에서 야간에만 억제한다
- 규칙을 지우고 그 지표는 수집도 중단한다
- 호출에서 내려 대시보드로 옮기고, 트래픽 이상은 증상 경보로 잡는다
이 실습에서 '증상 밖 분(outside_minutes)' 이 뜻하는 것은?
- 증상 경보가 울렸는데 원인 경보가 울리지 않은 시간
- 원인 경보가 울렸는데 사용자는 아무 일도 겪지 않은 시간
- 두 경보가 동시에 울려 Alertmanager 가 묶은 시간
- 자료가 없어 두 경보 모두 평가되지 못한 시간
새 경보를 추가하자는 제안을 받았을 때 가장 먼저 물어야 할 것은?
- 이 알림을 받은 사람이 지금 할 수 있는 일이 있는가
- 이 지표를 수집하는 exporter 가 이미 있는가
- 임계값을 어느 백분위로 잡을 것인가
- 어느 팀의 Alertmanager 라우트로 보낼 것인가