태그: #sre
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 25 편
프로덕션 감각 — 장애를 겪어 본 사람이 다르게 보는 것들
같은 설계 문서를 읽어도 장애를 겪어 본 사람은 다른 것을 읽습니다. 이게 새벽에 깨지면 무슨 로그가 남는지, 되돌리는 데 몇 분이 걸리는지, 되돌린 뒤 이미 들어간 데이터는 어떻게 되는지입니다. 이 글은 프로덕션이 왜 코드가 아니라 상태인지, 100퍼센트가 왜 옳은 신뢰성 목표가 아닌지, 관측과 롤백과 점진 배포가 왜 도구 도입이 아니라 기본값의 문제인지, 그리고 장애를 직접 겪지 않고도
2026-08-15 · 13 분 읽기 #career#skills#sre#production#reliability에러 처리 완전 가이드: 실패를 계약으로 설계하기
에러 처리를 예외 문법이 아니라 인터페이스 계약의 일부로 다룹니다. 오류를 분류하는 두 축, 예외와 반환값 논쟁의 실제 축, 경계마다 오류를 번역하는 규칙, RFC 9457 기반 HTTP 오류 계약, 멱등성 없는 재시도의 위험, 타임아웃 예산, 관측, 그리고 사용자에게 무엇을 말할 것인지까지 정리합니다.
2026-08-15 · 43 분 읽기 #에러처리#재시도#rfc9457#타임아웃#관측가능성Kubernetes 프로브 3종 제대로 쓰기 — liveness, readiness, startup의 정확한 경계
아무 문제 없는 파드가 주기적으로 재시작하거나, 배포 직후에만 502가 쏟아지거나, 느리게 뜨는 애플리케이션이 영원히 Ready에 도달하지 못하는 세 가지 사고는 모두 프로브 설계에서 나옵니다. 세 프로브가 각각 어떤 질문에 답하고 실패 시 무엇을 하는지 구분한 뒤, initialDelaySeconds부터 failureThreshold까지 파라미터가 실제로 몇 초 뒤에 컨테이너를 죽이는지 계
2026-07-26 · 27 분 읽기 #kubernetes#liveness-probe#readiness-probe#graceful-shutdown#sreKubernetes CrashLoopBackOff 원인별 진단과 해결 — 로그가 비어 있을 때 무엇을 봐야 하나
파드가 CrashLoopBackOff에 빠졌는데 kubectl logs는 아무것도 뱉지 않는 상황을 처음부터 끝까지 다룹니다. BackOff가 원인이 아니라 10초에서 5분까지 늘어나는 재시작 대기 시간이라는 정확한 의미부터, describe의 Last State와 Exit Code를 읽는 순서, 종료 코드 0/1/127/137/139/143이 각각 무엇을 뜻하는지 정리했습니다. 애플리케이션
2026-07-26 · 21 분 읽기 #kubernetes#crashloopbackoff#troubleshooting#kubectl#sre인시던트 커뮤니케이션: 장애 상황의 대화법
장애가 터졌을 때 기술적 복구는 절반의 일일 뿐입니다. 인시던트 커맨더 역할과 역할 분리, 아무 소식이 없어도 지키는 상태 업데이트 리듬, 모든 업데이트가 답해야 할 세 가지 질문, 비난 없는 포스트모템과 5 Whys, 고객 커뮤니케이션과 내부 커뮤니케이션의 차이, 그리고 방을 안정시키는 침착함까지 — 장애 상황의 대화법을 정리합니다.
2026-06-24 · 26 분 읽기 #incident#oncall#communication#sreOperator 베스트 프랙티스와 안티패턴
좋은 Operator의 특징과 흔한 안티패턴을 코드 수준에서 정리합니다. 작은 API와 멱등 reconcile, 관측 가능성, 안전한 업그레이드 같은 원칙부터 부수효과 남발·status 오용·무한 requeue·광범위 RBAC 같은 함정, 멀티테넌시와 보안, 리소스 효율, 테스트 문화, SRE 관점 운영, 성숙도 로드맵과 체크리스트까지 다룹니다.
2026-06-15 · 25 분 읽기 #kubernetes#operator#best-practices#reconcile#rbacBackstage 운영 실전 — TechDocs, 플러그인 개발, 프로덕션 체크리스트
Backstage IDP 시리즈 3편입니다. TechDocs 기반 docs-as-code 파이프라인과 S3 퍼블리싱, 프론트엔드/백엔드 플러그인 아키텍처와 커스텀 플러그인 개발, permission framework, 업그레이드 전략과 성능/관측/보안까지 프로덕션 운영의 전 영역을 다룹니다.
2026-06-13 · 25 분 읽기 #backstage#techdocs#plugins#platform-engineering#devops로드/성능 테스트 도구 2026 — k6·Locust·Vegeta·Gatling·Artillery·JMeter 심층 비교 (JMeter 너머의 풍경)
성능 테스트는 2026년에도 어렵다. 그러나 도구는 확실히 좋아졌다. JS로 짜는 k6, Python으로 짜는 Locust, 한 줄로 끝내는 Vegeta, 엔터프라이즈의 Gatling, YAML로 빨리 붙이는 Artillery, 마이크로 벤치마크의 wrk/wrk2와 autocannon, 그리고 여전히 살아 있는 JMeter. gRPC·WebSocket·브라우저 모드까지 손이 닿는 k6의 확장
2026-05-14 · 31 분 읽기 #load-testing#performance-testing#k6#locust#vegetaObservability 완벽 가이드 — Metrics, Logs, Traces, Profiling: Prometheus, OpenTelemetry, Jaeger, Loki, Grafana 모든 것 (2025)
Observability의 모든 것 — Monitoring과 Observability의 차이, 네 가지 기둥(Metrics, Logs, Traces, Profiling), Prometheus의 시계열 DB와 PromQL, OpenTelemetry의 통합 데이터 모델, Jaeger의 span/trace 모델, Loki의 label 인덱싱, Grafana 대시보드, SRE의 SLI/SLO/SLA
2026-04-15 · 43 분 읽기 #observability#monitoring#prometheus#opentelemetry#jaegerDNS 완벽 가이드 — 리졸버, DNSSEC, DoH/DoT, Anycast, CoreDNS 모든 것 (2025)
DNS의 모든 것 — hosts.txt에서 시작된 이름 시스템의 역사, 쿼리 흐름(stub → recursive → root → TLD → authoritative), 레코드 타입(A/AAAA/CNAME/MX/TXT/NS/SOA/SRV/CAA/HTTPS/SVCB), EDNS0와 패킷 한계, DNSSEC의 chain of trust와 RRSIG/DNSKEY/DS/NSEC3, DoH/DoT/Do
2026-04-15 · 37 분 읽기 #dns#dnssec#doh#networking#security관측가능성의 현대 — OpenTelemetry·eBPF Continuous Profiling·LGTM·Pyroscope·Sentry·Datadog·Honeycomb·SLO·SRE·온콜 심층 가이드 (2025)
메트릭·로그·트레이스·프로파일 Four Pillars, OpenTelemetry 표준화, eBPF continuous profiling(Parca/Pyroscope/Polar Signals), LGTM 스택, Sentry·Datadog·Honeycomb 비교, SLO/Error Budget, AI 이상 탐지, 온콜 운영과 블레임리스 포스트모템까지 — 2025년 관측가능성 전부.
2026-04-15 · 21 분 읽기 #observability#opentelemetry#ebpf#profiling#slo유명 포스트모템 해부 — Cloudflare·Fastly·AWS·Knight Capital·GitLab의 실패에서 배우기
Cloudflare 2022 BGP, Fastly 2021 인터넷 절반 다운, AWS S3 2017 오타, Knight Capital 8분 $440M, GitLab DB wipe 등 — 유명한 실패에서 추출한 패턴과 교훈.
2026-04-15 · 16 분 읽기 #postmortem#sre#outage#reliability#cultureChaos Engineering 완전 해부 — Netflix Simian Army, LitmusChaos/Chaos Mesh, AWS FIS, Game Day
2010년 Netflix가 왜 프로덕션 서버를 무작위로 죽이기 시작했나. Chaos Monkey 철학부터 4가지 원칙, Simian Army 전체 구성, LitmusChaos/Chaos Mesh/AWS FIS 도구 비교, Game Day 훈련 설계, 비난 없는 포스트모템까지.
2026-04-15 · 20 분 읽기 #chaos-engineering#sre#reliability#netflix#kubernetesZero-Downtime 데이터베이스 마이그레이션 완전 해부 — Expand-Contract, gh-ost, pt-osc, CONCURRENTLY, Logical Replication
"스키마 바꾸면 테이블 락 걸려요" 공포의 해체. Expand-Contract 6단계부터 gh-ost/pt-online-schema-change의 원리, PostgreSQL CONCURRENTLY, Logical Replication으로 메이저 업그레이드, 수십억 행 테이블 실전 사례까지.
2026-04-15 · 19 분 읽기 #database#migration#postgresql#mysql#mongodbSRE 실전 가이드 2025: 인시던트 관리, 포스트모템, Error Budget, On-Call, Toil 제거
SRE 실전의 모든 것! 인시던트 관리(탐지→대응→복구→포스트모템), Error Budget 정책, On-Call 운영(로테이션/에스컬레이션/피로도 관리), Toil 제거 자동화, SLO/SLI/SLA 설정, Blameless 포스트모템 작성법, Google SRE 문화.
2026-04-14 · 47 분 읽기 #sre#site-reliability#incident-management#postmortem#error-budgetChaos Engineering 완전 가이드 2025: 복원력 테스트, Chaos Monkey, Litmus, 게임 데이
Chaos Engineering의 모든 것! 카오스 원칙(가설→실험→관찰→개선), Chaos Monkey/Litmus Chaos/Chaos Mesh, 장애 주입(네트워크/CPU/메모리/Pod/AZ), Game Day 운영, 점진적 도입 전략, Netflix/Amazon 사례, SRE와의 관계.
2026-04-14 · 35 분 읽기 #chaos-engineering#resilience#chaos-monkey#litmus#fault-injectionIT 장애 방지 & 실습 구성법 + 글로벌 탁구 뉴스 분석
IT 시스템 장애를 방지하는 핵심 요소, 효과적인 실습 환경 구성법, 그리고 글로벌 탁구 대회와 주목할 선수들을 분석합니다.
2026-04-11 · 32 분 읽기 #culture#devops#reliability#sre#table-tennis관측성(Observability) 완전 가이드 2025: Prometheus, Grafana, OpenTelemetry로 시스템을 투명하게
관측성의 3가지 축(메트릭/로그/트레이스)을 완전 정복! Prometheus 쿼리(PromQL), Grafana 대시보드, OpenTelemetry 계측, Jaeger 분산 추적, ELK/Loki 로깅, 알림 전략, SLI/SLO/SLA, 온콜 문화까지.
2026-03-23 · 25 분 읽기 #observability#monitoring#prometheus#grafana#opentelemetryDevOps/SRE 완전 정복: CI/CD부터 Kubernetes, MLOps까지
DevOps와 SRE의 핵심 개념부터 Kubernetes 운영, AI/ML 워크플로우 자동화까지 실전 코드와 함께 완전 정복합니다.
2026-03-17 · 19 분 읽기 #devops#sre#kubernetes#ci-cd#mlops블레임리스 포스트모템 문화 만들기: 장애에서 배우는 조직의 학습 시스템
Google SRE, PagerDuty, Etsy의 사례를 바탕으로 블레임리스 포스트모템의 설계, 퍼실리테이션, 액션 아이템 추적, 조직 문화 정착까지 장애에서 체계적으로 학습하는 시스템을 구축하는 방법을 다룹니다.
2026-03-15 · 48 분 읽기 #culture#postmortem#incident-review#blameless#learning-organization