태그: #alerting
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 7 편
GPU 서빙 SLO와 알람 설계 — 무엇을 약속하고 무엇을 깨울 것인가
GPU 추론 서비스에 SLO를 걸려면 먼저 어떤 지표가 사용자 경험을 대변하는지 정해야 합니다. 첫 토큰 지연과 처리량은 서로를 잡아먹는 관계라 하나만 보고 목표를 세우면 반드시 다른 쪽이 무너집니다. 이 글은 vLLM과 DCGM Exporter가 실제로 노출하는 시계열만 써서 SLI를 정의하는 방법, 히스토그램 버킷 경계를 임계값으로 삼아야 하는 이유, 포화 신호를 읽는 순서, 증상 기반
2026-08-12 · 13 분 읽기 #gpu#kubernetes#slo#alerting#prometheus읽히는 대시보드와 울릴 만한 경보 — 질문 정의, 변수 구성, SLO, 그리고 경보 피로
대시보드는 예뻐 보이는 것이 아니라 정해진 질문에 순서대로 답해야 쓸모가 있습니다. 패널을 만들기 전에 답할 질문을 적는 방법부터, 데이터소스와 변수를 어떻게 구성해야 하나의 대시보드가 여러 환경에서 재사용되는지를 다룹니다. 경보는 원인이 아니라 증상에 걸어야 하는 이유를 사례로 보이고, SLO 와 에러 버짓, 멀티 번레이트 경보를 실제 규칙으로 작성합니다. 마지막으로 경보 피로를 줄이는 규
2026-08-02 · 24 분 읽기 #observability#grafana#alerting#slo#dashboards새벽 3시에 깨우지 않는 알림 설계 — 증상 기반 알림과 번 레이트 실전
온콜이 무너지는 이유는 알림이 부족해서가 아니라 너무 많아서입니다. 알림 피로가 실제 사고를 놓치게 만드는 메커니즘부터, 증상에만 페이지를 걸고 원인은 대시보드에 두는 원칙, SLO와 에러 버짓에서 임계값을 역산하는 방법을 다룹니다. 짧은 창과 긴 창을 AND로 묶는 다중 윈도우 번 레이트 알림이 어떻게 민감도와 오탐을 동시에 잡는지, for 절이 플래핑을 막는 원리는 무엇인지 프로메테우스
2026-07-26 · 21 분 읽기 #observability#alerting#slo#error-budget#prometheus관측성(Observability) 완전 가이드 2025: Prometheus, Grafana, OpenTelemetry로 시스템을 투명하게
관측성의 3가지 축(메트릭/로그/트레이스)을 완전 정복! Prometheus 쿼리(PromQL), Grafana 대시보드, OpenTelemetry 계측, Jaeger 분산 추적, ELK/Loki 로깅, 알림 전략, SLI/SLO/SLA, 온콜 문화까지.
2026-03-23 · 25 분 읽기 #observability#monitoring#prometheus#grafana#opentelemetryPrometheus·Alertmanager 알림 파이프라인 구축: 규칙 작성부터 PagerDuty·Slack 라우팅까지
Prometheus와 Alertmanager를 활용한 프로덕션 알림 파이프라인을 구축합니다. PromQL 기반 알림 규칙 작성, Alertmanager 라우팅 트리 설계, PagerDuty·Slack 통합, Alert Fatigue 방지 전략까지 운영 중심으로 다룹니다.
2026-03-12 · 27 분 읽기 #observability#prometheus#alertmanager#grafana#pagerdutyAIOps 기반 이상 탐지 자동화: ML 알림과 Kubernetes 이벤트 상관 분석 가이드
AIOps를 활용한 이상 탐지 자동화 종합 가이드. 전통적 임계값 알림의 한계, ML 기반 이상 탐지 알고리즘(Isolation Forest, Prophet, DBSCAN), Prometheus 메트릭 기반 자동 분석, Kubernetes 이벤트 상관 분석, 알림 노이즈 감소 전략, 그리고 Robusta/Datadog AIOps 실전 적용까지 다룹니다.
2026-03-09 · 34 분 읽기 #observability#aiops#anomaly-detection#machine-learning#kubernetesPrometheus PromQL 고급 쿼리와 Recording Rules 최적화: SLI/SLO 기반 알림 체계 구축 가이드
Prometheus PromQL 고급 쿼리 패턴부터 Recording Rules로 성능 최적화, SLI/SLO 기반 알림 규칙 설계, Alertmanager 라우팅 전략, 그리고 대규모 환경 운영 트러블슈팅까지 다루는 종합 가이드.
2026-03-07 · 39 분 읽기 #observability#prometheus#promql#recording-rules#sli