태그: #slo
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 14 편
GPU 서빙 SLO와 알람 설계 — 무엇을 약속하고 무엇을 깨울 것인가
GPU 추론 서비스에 SLO를 걸려면 먼저 어떤 지표가 사용자 경험을 대변하는지 정해야 합니다. 첫 토큰 지연과 처리량은 서로를 잡아먹는 관계라 하나만 보고 목표를 세우면 반드시 다른 쪽이 무너집니다. 이 글은 vLLM과 DCGM Exporter가 실제로 노출하는 시계열만 써서 SLI를 정의하는 방법, 히스토그램 버킷 경계를 임계값으로 삼아야 하는 이유, 포화 신호를 읽는 순서, 증상 기반
2026-08-12 · 13 분 읽기 #gpu#kubernetes#slo#alerting#prometheus읽히는 대시보드와 울릴 만한 경보 — 질문 정의, 변수 구성, SLO, 그리고 경보 피로
대시보드는 예뻐 보이는 것이 아니라 정해진 질문에 순서대로 답해야 쓸모가 있습니다. 패널을 만들기 전에 답할 질문을 적는 방법부터, 데이터소스와 변수를 어떻게 구성해야 하나의 대시보드가 여러 환경에서 재사용되는지를 다룹니다. 경보는 원인이 아니라 증상에 걸어야 하는 이유를 사례로 보이고, SLO 와 에러 버짓, 멀티 번레이트 경보를 실제 규칙으로 작성합니다. 마지막으로 경보 피로를 줄이는 규
2026-08-02 · 24 분 읽기 #observability#grafana#alerting#slo#dashboards새벽 3시에 깨우지 않는 알림 설계 — 증상 기반 알림과 번 레이트 실전
온콜이 무너지는 이유는 알림이 부족해서가 아니라 너무 많아서입니다. 알림 피로가 실제 사고를 놓치게 만드는 메커니즘부터, 증상에만 페이지를 걸고 원인은 대시보드에 두는 원칙, SLO와 에러 버짓에서 임계값을 역산하는 방법을 다룹니다. 짧은 창과 긴 창을 AND로 묶는 다중 윈도우 번 레이트 알림이 어떻게 민감도와 오탐을 동시에 잡는지, for 절이 플래핑을 막는 원리는 무엇인지 프로메테우스
2026-07-26 · 21 분 읽기 #observability#alerting#slo#error-budget#prometheus평균 응답 시간이 거짓말하는 이유 — p50, p95, p99를 제대로 읽는 법
평균 응답 시간이 80ms인 서비스에서 사용자가 3초를 기다리는 일은 흔합니다. 롱테일 분포에서 평균이 무엇을 감추는지, p50과 p95, p99, p99.9가 각각 어떤 질문에 답하는지, 그리고 p99가 왜 "100명 중 1명"이 아닌지를 숫자로 설명합니다. 백분위는 평균낼 수 없다는 결정적 사실과 그래서 히스토그램이 필요한 이유, 프로메테우스 histogramquantile의 선형 보간
2026-07-26 · 18 분 읽기 #observability#percentile#prometheus#histogram#sloOperator 관측성 — 메트릭, 이벤트, 로깅, 그리고 SLO
Kubebuilder 기반 Operator의 관측성을 메트릭, 이벤트, 로깅, 트레이싱, status/conditions, 그리고 SLO 관점에서 깊이 있게 다룹니다. controller-runtime 기본 메트릭의 의미부터 커스텀 메트릭 추가, Prometheus/Grafana 연동, 알림 규칙, 그리고 reconcile가 동작하지 않을 때의 디버깅 런북까지 실무 코드와 함께 정리합니다.
2026-06-15 · 32 분 읽기 #kubernetes#operator#observability#prometheus#controller-runtime관측성(Observability) 2026 완벽 가이드 - OpenTelemetry · Datadog · Grafana Stack(LGTM+Beyla) · Honeycomb · Prometheus · Jaeger · eBPF · SLO 심층 분석
2026년 5월 기준 프로덕션 관측성(observability) 스택을 OpenTelemetry 표준 위에서 끝까지 본다. SaaS(Datadog, New Relic, Dynatrace, Splunk, Honeycomb, Coralogix, Logz.io, Chronosphere), 오픈소스(Grafana LGTM+Beyla, Prometheus+Mimir/Cortex/Thanos, Jaeg
2026-05-16 · 29 분 읽기 #observability#opentelemetry#datadog#grafana#honeycombObservability 완전 가이드 — Metric·Log·Trace·OpenTelemetry·eBPF·SLO (Season 2 Ep 9, 2025)
"관측할 수 없으면 운영할 수 없다." Observability는 로그 수집·모니터링의 상위 개념으로, 알려지지 않은 문제(unknown unknowns)를 시스템 상태만으로 추론할 수 있게 하는 능력이다. 이 글은 Metric·Log·Trace 3축, Profile을 더한 4축, OpenTelemetry 표준의 진짜 가치, eBPF 커널 수준 관측, SLO·SLI·Error Budget 실
2026-04-15 · 16 분 읽기 #observability#opentelemetry#prometheus#grafana#loki관측가능성의 현대 — OpenTelemetry·eBPF Continuous Profiling·LGTM·Pyroscope·Sentry·Datadog·Honeycomb·SLO·SRE·온콜 심층 가이드 (2025)
메트릭·로그·트레이스·프로파일 Four Pillars, OpenTelemetry 표준화, eBPF continuous profiling(Parca/Pyroscope/Polar Signals), LGTM 스택, Sentry·Datadog·Honeycomb 비교, SLO/Error Budget, AI 이상 탐지, 온콜 운영과 블레임리스 포스트모템까지 — 2025년 관측가능성 전부.
2026-04-15 · 21 분 읽기 #observability#opentelemetry#ebpf#profiling#slo관측 가능성의 현재 심화 가이드 — OpenTelemetry, Prometheus, eBPF, SLO/SLI, Continuous Profiling, Chaos Engineering까지 (2025)
분산 시스템에서 가장 중요한 역량은 "모르는 것을 알게 되는 능력"이다. 2024-2025년 관측 가능성은 혁명의 한복판에 있다. OpenTelemetry 1.0 GA, eBPF 기반 agentless 프로파일링, Continuous Profiling 주류화, Datadog vs Grafana vs Honeycomb 경쟁 재편. Metrics/Logs/Traces/Profiles 4-pill
2026-04-15 · 21 분 읽기 #observability#opentelemetry#prometheus#grafana#ebpfObservability 2025 완전 가이드: OpenTelemetry, Grafana·Datadog·Honeycomb·SigNoz, SLO·Error Budget, LLM 관측성 (2025)
Season 5 Ep 8. 관측성 없이는 운영 없고, 운영 없이는 제품 없다. OpenTelemetry의 3대 시그널(Metric·Log·Trace) 통합, Grafana 스택(Prometheus·Loki·Tempo·Mimir) vs Datadog·New Relic·Splunk, SigNoz·Honeycomb·Axiom의 새 세대, SLO·SLI·Error Budget 운영, LLM 관측성(
2026-04-15 · 15 분 읽기 #observability#opentelemetry#grafana#datadog#honeycombSRE 실전 가이드 2025: 인시던트 관리, 포스트모템, Error Budget, On-Call, Toil 제거
SRE 실전의 모든 것! 인시던트 관리(탐지→대응→복구→포스트모템), Error Budget 정책, On-Call 운영(로테이션/에스컬레이션/피로도 관리), Toil 제거 자동화, SLO/SLI/SLA 설정, Blameless 포스트모템 작성법, Google SRE 문화.
2026-04-14 · 47 분 읽기 #sre#site-reliability#incident-management#postmortem#error-budgetSLI/SLO/Error Budget 기반 신뢰성 엔지니어링 실전 가이드
SLI/SLO/Error Budget을 활용한 신뢰성 엔지니어링의 이론과 실전을 다룹니다. SLI 지표 선정, SLO 수치 설정, Error Budget 정책, Burn Rate 알럿, Prometheus 기반 구현까지 프로덕션 서비스의 신뢰성 관리 전체 파이프라인을 코드와 함께 구축합니다.
2026-03-13 · 21 분 읽기 #observability#sli#slo#error-budget#srePrometheus PromQL 고급 쿼리와 Recording Rules 최적화: SLI/SLO 기반 알림 체계 구축 가이드
Prometheus PromQL 고급 쿼리 패턴부터 Recording Rules로 성능 최적화, SLI/SLO 기반 알림 규칙 설계, Alertmanager 라우팅 전략, 그리고 대규모 환경 운영 트러블슈팅까지 다루는 종합 가이드.
2026-03-07 · 39 분 읽기 #observability#prometheus#promql#recording-rules#sliSLO와 Error Budget 실행 매뉴얼
SLO와 Error Budget 실행 매뉴얼 - 2026년 기준 실무 적용 가이드
2026-03-04 · 21 분 읽기 #observability#slo#2026-03