태그: #incident
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 4 편
실수한 다음의 순서 — 수습, 보고, 기록, 재발 방지
실수의 비용은 실수 자체가 아니라 그다음 네 단계에서 정해지고, 사람들은 이 순서를 거의 언제나 같은 방식으로 뒤집습니다. 수습 단계에서 지혈 대신 원인부터 찾는 것, 보고를 수습이 끝난 뒤로 미루는 것, 기록을 통째로 건너뛰는 것, 재발 방지를 개인의 다짐으로 대체하는 것. 각 단계가 왜 그 자리에 있는지와 흔히 뒤집히는 지점을 짚고, 사과와 변명이 갈리는 지점이 원인 설명의 유무가 아니라
2026-08-16 · 23 분 읽기 #career#workplace#mistakes#incident#accountability국내 개발 블로그 명글 큐레이션 2 — 장애 회고와 트러블슈팅, 직접 열어 확인한 12편
한국 개발자가 가장 잘 쓰는 장르는 장애 회고입니다. p6spy가 DB 라우팅을 무력화한 사건, HTTP 타임아웃이 DNS 조회를 덮지 못한 이유, TCP 하프 클로즈가 중복 예외로 위장된 사례, MetalLB 설정 하나가 만든 클러스터 지연 스파이크, 힙 덤프로 OOM을 추적한 기록, JIT 워밍업으로 배포 직후 CPU 스파이크를 잡은 과정, 외래키가 부른 데드락, HikariCP 커넥션
2026-08-12 · 22 분 읽기 #curation#큐레이션#troubleshooting#postmortem#incident인시던트 커뮤니케이션: 장애 상황의 대화법
장애가 터졌을 때 기술적 복구는 절반의 일일 뿐입니다. 인시던트 커맨더 역할과 역할 분리, 아무 소식이 없어도 지키는 상태 업데이트 리듬, 모든 업데이트가 답해야 할 세 가지 질문, 비난 없는 포스트모템과 5 Whys, 고객 커뮤니케이션과 내부 커뮤니케이션의 차이, 그리고 방을 안정시키는 침착함까지 — 장애 상황의 대화법을 정리합니다.
2026-06-24 · 26 분 읽기 #incident#oncall#communication#sre마이그레이션 사고 사례와 체크리스트 — 남의 실패에서 배우기
마이그레이션은 가장 흔하면서도 가장 아픈 장애의 원천입니다. 락 폭주, 복제 지연, 데이터 손실, 롤백 불가 같은 전형적 사고 유형을 짚고, 세 건의 가상 포스트모템으로 증상에서 원인과 교훈을 끌어내며, 예방 패턴과 종합 체크리스트로 정리합니다.
2026-06-16 · 27 분 읽기 #database#migration#postmortem#incident#reliability