태그: #error-budget
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 5 편
새벽 3시에 깨우지 않는 알림 설계 — 증상 기반 알림과 번 레이트 실전
온콜이 무너지는 이유는 알림이 부족해서가 아니라 너무 많아서입니다. 알림 피로가 실제 사고를 놓치게 만드는 메커니즘부터, 증상에만 페이지를 걸고 원인은 대시보드에 두는 원칙, SLO와 에러 버짓에서 임계값을 역산하는 방법을 다룹니다. 짧은 창과 긴 창을 AND로 묶는 다중 윈도우 번 레이트 알림이 어떻게 민감도와 오탐을 동시에 잡는지, for 절이 플래핑을 막는 원리는 무엇인지 프로메테우스
2026-07-26 · 21 분 읽기 #observability#alerting#slo#error-budget#prometheusObservability 완전 가이드 — Metric·Log·Trace·OpenTelemetry·eBPF·SLO (Season 2 Ep 9, 2025)
"관측할 수 없으면 운영할 수 없다." Observability는 로그 수집·모니터링의 상위 개념으로, 알려지지 않은 문제(unknown unknowns)를 시스템 상태만으로 추론할 수 있게 하는 능력이다. 이 글은 Metric·Log·Trace 3축, Profile을 더한 4축, OpenTelemetry 표준의 진짜 가치, eBPF 커널 수준 관측, SLO·SLI·Error Budget 실
2026-04-15 · 16 분 읽기 #observability#opentelemetry#prometheus#grafana#lokiObservability 2025 완전 가이드: OpenTelemetry, Grafana·Datadog·Honeycomb·SigNoz, SLO·Error Budget, LLM 관측성 (2025)
Season 5 Ep 8. 관측성 없이는 운영 없고, 운영 없이는 제품 없다. OpenTelemetry의 3대 시그널(Metric·Log·Trace) 통합, Grafana 스택(Prometheus·Loki·Tempo·Mimir) vs Datadog·New Relic·Splunk, SigNoz·Honeycomb·Axiom의 새 세대, SLO·SLI·Error Budget 운영, LLM 관측성(
2026-04-15 · 15 분 읽기 #observability#opentelemetry#grafana#datadog#honeycombSRE 실전 가이드 2025: 인시던트 관리, 포스트모템, Error Budget, On-Call, Toil 제거
SRE 실전의 모든 것! 인시던트 관리(탐지→대응→복구→포스트모템), Error Budget 정책, On-Call 운영(로테이션/에스컬레이션/피로도 관리), Toil 제거 자동화, SLO/SLI/SLA 설정, Blameless 포스트모템 작성법, Google SRE 문화.
2026-04-14 · 47 분 읽기 #sre#site-reliability#incident-management#postmortem#error-budgetSLI/SLO/Error Budget 기반 신뢰성 엔지니어링 실전 가이드
SLI/SLO/Error Budget을 활용한 신뢰성 엔지니어링의 이론과 실전을 다룹니다. SLI 지표 선정, SLO 수치 설정, Error Budget 정책, Burn Rate 알럿, Prometheus 기반 구현까지 프로덕션 서비스의 신뢰성 관리 전체 파이프라인을 코드와 함께 구축합니다.
2026-03-13 · 21 분 읽기 #observability#sli#slo#error-budget#sre