태그: #postmortem
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 11 편
엔지니어의 쓰는 능력 — 설계 문서, 사고 보고서, 리뷰 코멘트가 하는 일
엔지니어에게 글쓰기가 중요하다는 말은 흔하지만, 왜 중요한지가 대개 승진 이야기로 끝납니다. 이 글은 다른 순서로 봅니다. 글은 먼저 사고의 검증 장치이고, 조직 안에서 반박 가능한 표면을 만드는 도구이며, 그 결과로 평가에 영향을 줍니다. 설계 문서에서 가장 중요한 것이 왜 버린 대안인지, 사고 보고서에서 사실과 해석을 나누는 것이 왜 정치가 아니라 기술인지, 리뷰 코멘트에 등급을 붙이는
2026-08-15 · 13 분 읽기 #career#skills#technical-writing#design-doc#postmortem국내 개발 블로그 명글 큐레이션 2 — 장애 회고와 트러블슈팅, 직접 열어 확인한 12편
한국 개발자가 가장 잘 쓰는 장르는 장애 회고입니다. p6spy가 DB 라우팅을 무력화한 사건, HTTP 타임아웃이 DNS 조회를 덮지 못한 이유, TCP 하프 클로즈가 중복 예외로 위장된 사례, MetalLB 설정 하나가 만든 클러스터 지연 스파이크, 힙 덤프로 OOM을 추적한 기록, JIT 워밍업으로 배포 직후 CPU 스파이크를 잡은 과정, 외래키가 부른 데드락, HikariCP 커넥션
2026-08-12 · 22 분 읽기 #curation#큐레이션#troubleshooting#postmortem#incident5노드 Raft에서 3노드가 한꺼번에 죽은 이유 — Coinbase 2026년 5월 7일 장애 읽기
2026년 5월 7일 저녁 AWS us-east-1의 가용 영역 use1-az4에서 데이터 홀 한 곳의 냉각 장치가 동시에 고장 났고, Coinbase는 거래와 입출금을 포함한 대부분의 서비스가 약 8시간 중단되는 장애를 겪었습니다. 6월 1일 공개된 Coinbase의 포스트모템은 5노드 Raft 체결 엔진 중 3노드가 동시에 죽어 쿼럼을 잃은 과정과, AWS 관리형 Kafka인 MSK의 컨
2026-07-16 · 35 분 읽기 #distributed-systems#postmortem#consensus#aws#resilience마이그레이션 사고 사례와 체크리스트 — 남의 실패에서 배우기
마이그레이션은 가장 흔하면서도 가장 아픈 장애의 원천입니다. 락 폭주, 복제 지연, 데이터 손실, 롤백 불가 같은 전형적 사고 유형을 짚고, 세 건의 가상 포스트모템으로 증상에서 원인과 교훈을 끌어내며, 예방 패턴과 종합 체크리스트로 정리합니다.
2026-06-16 · 27 분 읽기 #database#migration#postmortem#incident#reliability글로벌 개발자 영어 표현 사전 2026 - 코드 리뷰, 스탠드업, 1:1, RFC, 포스트모템, PR, 인터뷰까지 실전 가이드
2026년 글로벌 분산 엔지니어링 팀에서 일하는 한국 개발자를 위한 실전 영어 표현 가이드. 코드 리뷰의 LGTM/nit/non-blocking, Slack의 heads up/bump/gentle ping, 스탠드업의 parking lot, 1:1의 top of mind, RFC의 out of scope/non-goals, 포스트모템의 root cause/blameless, PR의 close
2026-05-16 · 38 분 읽기 #technical-english#code-review#standup#rfc#postmortem유명 포스트모템 해부 — Cloudflare·Fastly·AWS·Knight Capital·GitLab의 실패에서 배우기
Cloudflare 2022 BGP, Fastly 2021 인터넷 절반 다운, AWS S3 2017 오타, Knight Capital 8분 $440M, GitLab DB wipe 등 — 유명한 실패에서 추출한 패턴과 교훈.
2026-04-15 · 16 분 읽기 #postmortem#sre#outage#reliability#cultureSRE 실전 가이드 2025: 인시던트 관리, 포스트모템, Error Budget, On-Call, Toil 제거
SRE 실전의 모든 것! 인시던트 관리(탐지→대응→복구→포스트모템), Error Budget 정책, On-Call 운영(로테이션/에스컬레이션/피로도 관리), Toil 제거 자동화, SLO/SLI/SLA 설정, Blameless 포스트모템 작성법, Google SRE 문화.
2026-04-14 · 47 분 읽기 #sre#site-reliability#incident-management#postmortem#error-budget블레임리스 포스트모템 문화 만들기: 장애에서 배우는 조직의 학습 시스템
Google SRE, PagerDuty, Etsy의 사례를 바탕으로 블레임리스 포스트모템의 설계, 퍼실리테이션, 액션 아이템 추적, 조직 문화 정착까지 장애에서 체계적으로 학습하는 시스템을 구축하는 방법을 다룹니다.
2026-03-15 · 48 분 읽기 #culture#postmortem#incident-review#blameless#learning-organization영어 인시던트 관리 커뮤니케이션 완벽 가이드: 장애 대응부터 포스트모템까지
엔지니어를 위한 영어 인시던트 관리 커뮤니케이션 가이드. 장애 선언, 실시간 상황 공유, 에스컬레이션, 고객 공지, 포스트모템 작성까지 실전 표현과 템플릿을 체계적으로 정리합니다.
2026-03-13 · 21 분 읽기 #english#incident-management#communication#postmortem#sreIT 장애 대응·포스트모템 일본어 표현 완전 가이드: 障害対応부터 振り返り까지
IT 현장에서 장애 발생부터 원인 분석, 포스트모템 회의까지 사용하는 일본어 표현을 체계적으로 다룹니다. 障害対応, 原因究明, 影響範囲, 再発防止 등 핵심 용어와 에스컬레이션 보고, 상황 공유, 포스트모템 진행에 필요한 실전 대화 예문을 제공합니다.
2026-03-11 · 35 분 읽기 #japanese#incident-response#postmortem#it-expressions#business-japanese영어 인시던트 커뮤니케이션 완전 가이드: 장애 보고부터 포스트모템 작성까지 실전 표현
IT 엔지니어를 위한 영어 인시던트 커뮤니케이션 가이드. 장애 발생 초기 보고, 에스컬레이션, 상태 페이지 업데이트, 포스트모템 작성까지 실전에서 바로 쓸 수 있는 영어 표현과 템플릿을 제공합니다.
2026-03-08 · 40 분 읽기 #english#incident-communication#postmortem#sre#technical-writing