로그로 원인 찾기 · 집계와 상관관계 · 퀴즈
퀴즈: 집계와 상관관계
문항 6개. 정답과 해설은 풀어 본 뒤에 보여 드립니다.
장애 조사에서 '언제 에러가 시작됐나' 보다 나은 질문은?
- 누가 배포했나
- 몇 명이 영향을 받았나
- 언제 정상이 아니게 됐나
- 언제 복구되나
두 서비스의 로그를 한 타임라인으로 정렬할 수 없습니다. 가장 먼저 확인할 것은?
- 로그 레벨이 통일됐는지
- 타임스탬프에 UTC 오프셋이 포함됐는지
- request_id 가 있는지
- 두 서버의 NTP 동기화
배포가 03:19, 첫 에러가 03:27 입니다. 이것으로 배포가 원인이라고 확정할 수 있습니까?
- 확정할 수 있다. 시간 순서가 명확하기 때문이다
- 순서는 필요조건일 뿐이고, 롤백 후 증상이 사라지는지로 확인해야 한다
- 8분 간격은 너무 길어 무관하다
- 다른 배포가 없었다면 확정이다
로그 한 줄에 `service.version` 필드가 있으면 무엇이 가능해집니까?
- '배포 때문인가' 라는 질문에 별도 배포 이력 없이 로그만으로 답할 수 있다
- 로그 용량이 줄어든다
- 검색 속도가 빨라진다
- 버전별로 나눠 로그 보존 기간을 더 늘릴 수 있다
지표를 하나만 뽑아야 한다면 평균 지연보다 나은 것은?
- 측정 구간의 최대 지연
- 임계값(예: 1초)을 초과한 요청의 건수
- 측정 구간의 최소 지연
- 들어온 요청의 총 건수
`db query timeout: table=payments` 라는 에러 메시지 한 줄에서 즉시 알 수 있는 것은?
- 원인이 된 코드의 파일명과 줄 번호까지
- 영향을 받은 사용자의 수
- 복구까지 걸릴 예상 시간
- 계층(데이터), 증상(타임아웃), 대상(payments 테이블)