로그로 원인 찾기 · 로그 읽는 법 · 퀴즈
퀴즈: 로그 읽는 법
문항 6개. 정답과 해설은 풀어 본 뒤에 보여 드립니다.
로그에서 오류 103건을 셌습니다. 다음으로 반드시 구해야 하는 값은?
- 오류의 평균 응답 시간
- 오류를 낸 고유 IP 수
- 전체 요청 대비 비율
- 사고 구간을 제외한 평시 오류 수
배포 직후 4xx 만 늘고 5xx 는 그대로입니다. 가장 유력한 해석은?
- 서버 내부 처리가 깨졌다
- API 계약이 바뀌어 클라이언트 요청이 더 이상 맞지 않는다
- 클라이언트 네트워크가 불안정하다
- 배포로 데이터베이스가 느려졌다
5xx 가 6시간에 걸쳐 고르게 퍼져 있는 것과 1분에 몰려 있는 것의 차이는?
- 전자는 만성적 결함, 후자는 그 시각의 사건이라 조사 방향이 완전히 다르다
- 오류 총량이 같으면 같은 문제다
- 한 시각에 몰려 있는 후자가 항상 더 심각하다
- 퍼져 있는 전자는 무시해도 된다
오류가 특정 엔드포인트 하나에 몰려 있지 않고 모든 경로에 퍼져 있습니다. 무엇을 의심합니까?
- 데이터베이스·인증·네트워크 같은 공통 의존성
- 그 기능 코드 자체의 결함
- 특정 클라이언트 버전의 문제
- 로그 수집 쪽의 오류
평균 응답 시간이 1380ms 입니다. 이 값에서 알 수 있는 것은?
- 거의 아무것도 알 수 없다 — 대다수가 빠르고 소수가 매우 느려도 같은 값이 나온다
- 대부분의 사용자가 약 1.4초를 기다렸다
- 시스템이 전반적으로 느리다
- p99 가 1380ms 근처다
고객은 '가끔 몇 초씩 멈춘다' 는데 대시보드의 평균 응답 시간은 정상입니다. 이 상황은?
- 모순이 아니다 — 둘 다 참이고 서로 다른 것을 보고 있다
- 고객의 착각이거나 고객 측 네트워크 문제
- 측정 도구가 고장 났다
- 캐시 때문에 서버 지표가 왜곡됐다