태그: #prometheus
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 35 편
vLLM 메트릭 — 무엇을 대시보드에 올리고 무엇으로 알람을 걸까
vLLM이 노출하는 시계열은 GPU 메트릭이 답하지 못하는 질문에 답합니다. 지금 몇 개가 실행 중이고 몇 개가 대기 중인지, KV 캐시가 얼마나 찼는지, 첫 토큰까지 얼마나 걸리는지 같은 것들입니다. 이 글은 vLLM 공식 문서와 저장소의 메트릭 로거 소스를 직접 읽고 스케줄러 상태 게이지, 캐시 계열 카운터, 지연 히스토그램의 정확한 이름과 의미를 정리하고, 카운터 이름의 접미사 차이처럼
2026-08-12 · 13 분 읽기 #gpu#kubernetes#vllm#prometheus#observabilityDCGM Exporter — GPU 이용률은 당신이 생각하는 그것이 아니다
DCGM Exporter는 GPU 텔레메트리를 프로메테우스 형식으로 노출하는 표준 경로지만, 가장 많이 대시보드에 올라가는 GPU 이용률 계열 메트릭은 사람들이 기대하는 것을 재지 않습니다. 이 글은 dcgm-exporter 저장소의 기본 카운터 CSV와 DCGM 공식 문서, NVML API 문서를 직접 읽고 기본으로 켜져 있는 메트릭 목록, 이용률 메트릭이 실제로 무엇을 뜻하는지, 함께 봐
2026-08-12 · 17 분 읽기 #gpu#kubernetes#dcgm#prometheus#observabilityGPU 서빙 SLO와 알람 설계 — 무엇을 약속하고 무엇을 깨울 것인가
GPU 추론 서비스에 SLO를 걸려면 먼저 어떤 지표가 사용자 경험을 대변하는지 정해야 합니다. 첫 토큰 지연과 처리량은 서로를 잡아먹는 관계라 하나만 보고 목표를 세우면 반드시 다른 쪽이 무너집니다. 이 글은 vLLM과 DCGM Exporter가 실제로 노출하는 시계열만 써서 SLI를 정의하는 방법, 히스토그램 버킷 경계를 임계값으로 삼아야 하는 이유, 포화 신호를 읽는 순서, 증상 기반
2026-08-12 · 13 분 읽기 #gpu#kubernetes#slo#alerting#prometheus질문에 답하는 Prometheus 메트릭 설계 — 타입 선택, 카디널리티 예산, rate 와 분위수의 함정
메트릭은 많을수록 좋은 것이 아니라 질문에 답할 수 있어야 쓸모가 있습니다. 카운터와 게이지와 히스토그램이 각각 어떤 질문에 답하는지, 잘못 고르면 어떤 계산이 원리적으로 불가능해지는지부터 정리합니다. 레이블 카디널리티를 감으로 다루지 않도록 숫자로 예산을 잡는 방법, rate 와 histogramquantile 이 조용히 틀린 답을 주는 조건, 그리고 레코딩 룰을 언제 어떤 이름으로 만드는
2026-08-02 · 28 분 읽기 #observability#prometheus#promql#metrics#cardinality새벽 3시에 깨우지 않는 알림 설계 — 증상 기반 알림과 번 레이트 실전
온콜이 무너지는 이유는 알림이 부족해서가 아니라 너무 많아서입니다. 알림 피로가 실제 사고를 놓치게 만드는 메커니즘부터, 증상에만 페이지를 걸고 원인은 대시보드에 두는 원칙, SLO와 에러 버짓에서 임계값을 역산하는 방법을 다룹니다. 짧은 창과 긴 창을 AND로 묶는 다중 윈도우 번 레이트 알림이 어떻게 민감도와 오탐을 동시에 잡는지, for 절이 플래핑을 막는 원리는 무엇인지 프로메테우스
2026-07-26 · 21 분 읽기 #observability#alerting#slo#error-budget#prometheus평균 응답 시간이 거짓말하는 이유 — p50, p95, p99를 제대로 읽는 법
평균 응답 시간이 80ms인 서비스에서 사용자가 3초를 기다리는 일은 흔합니다. 롱테일 분포에서 평균이 무엇을 감추는지, p50과 p95, p99, p99.9가 각각 어떤 질문에 답하는지, 그리고 p99가 왜 "100명 중 1명"이 아닌지를 숫자로 설명합니다. 백분위는 평균낼 수 없다는 결정적 사실과 그래서 히스토그램이 필요한 이유, 프로메테우스 histogramquantile의 선형 보간
2026-07-26 · 18 분 읽기 #observability#percentile#prometheus#histogram#slo네이티브 히스토그램은 stable이 됐는데, 왜 아직 못 켜고 있나
2022년 11월 v2.40에서 실험 기능으로 등장한 Prometheus 네이티브 히스토그램은 2025년 12월 3.8.0에서 stable이 됐고, 2026년 7월 1일 릴리스된 3.13이 이 기능을 stable 상태로 담은 첫 LTS입니다. 기존 3.5 LTS는 2026년 7월 31일에 지원이 끝나므로, LTS 트랙을 타는 조직에게는 지금이 실제 결정 시점입니다. 다만 stable이라는 단
2026-07-16 · 32 분 읽기 #prometheus#observability#native-histograms#metrics#monitoringOperator 관측성 — 메트릭, 이벤트, 로깅, 그리고 SLO
Kubebuilder 기반 Operator의 관측성을 메트릭, 이벤트, 로깅, 트레이싱, status/conditions, 그리고 SLO 관점에서 깊이 있게 다룹니다. controller-runtime 기본 메트릭의 의미부터 커스텀 메트릭 추가, Prometheus/Grafana 연동, 알림 규칙, 그리고 reconcile가 동작하지 않을 때의 디버깅 런북까지 실무 코드와 함께 정리합니다.
2026-06-15 · 32 분 읽기 #kubernetes#operator#observability#prometheus#controller-runtimeHubble과 ClusterMesh — Cilium 관측성과 멀티클러스터 운영
Cilium의 관측성 계층 Hubble의 아키텍처와 CLI 실전 쿼리, Prometheus 메트릭과 플로우 로그 장기 보관을 다루고, ClusterMesh로 멀티클러스터 서비스 디스커버리와 글로벌 서비스, 정책, 암호화를 구성하는 방법을 운영 관점에서 정리합니다.
2026-06-13 · 22 분 읽기 #cilium#hubble#clustermesh#observability#multi-clusterKeycloak 관측성 — 메트릭, 감사 로그, 이벤트 기반 모니터링
Keycloak의 이벤트 시스템과 메트릭 엔드포인트, EventListener SPI를 활용한 외부 전송, Prometheus와 Grafana 대시보드 구성, OpenTelemetry tracing, 이상 징후 탐지와 알림 룰, 그리고 ISMS/SOC2 감사 컴플라이언스 관점까지 Keycloak 관측성을 종합적으로 다룹니다.
2026-06-12 · 21 분 읽기 #keycloak#observability#monitoring#prometheus#security관측성(Observability) 2026 완벽 가이드 - OpenTelemetry · Datadog · Grafana Stack(LGTM+Beyla) · Honeycomb · Prometheus · Jaeger · eBPF · SLO 심층 분석
2026년 5월 기준 프로덕션 관측성(observability) 스택을 OpenTelemetry 표준 위에서 끝까지 본다. SaaS(Datadog, New Relic, Dynatrace, Splunk, Honeycomb, Coralogix, Logz.io, Chronosphere), 오픈소스(Grafana LGTM+Beyla, Prometheus+Mimir/Cortex/Thanos, Jaeg
2026-05-16 · 29 분 읽기 #observability#opentelemetry#datadog#grafana#honeycomb시계열 데이터베이스 2026 완벽 가이드 - InfluxDB 3 · TimescaleDB · QuestDB · ClickHouse · Prometheus · VictoriaMetrics · Grafana Mimir 심층 분석
2026년 시계열 데이터베이스(TSDB) 풀스택 해부. InfluxDB 3.0의 Rust + Apache Arrow + DataFusion + Parquet 리라이트, TimescaleDB 2.18 hypertables, QuestDB 8.x SIMD 인제스트, ClickHouse 25.x MergeTree, Prometheus 3.0과 VictoriaMetrics 1.110+ Metrics
2026-05-16 · 44 분 읽기 #time-series-database#influxdb#timescaledb#questdb#clickhouseKubestronaut 로드맵 2026 완벽 가이드 - CKA · CKAD · CKS · KCNA · KCSA와 CNCF 자격증 사다리(Prometheus · Istio · Cilium · OpenTelemetry · Argo) 심층 분석
2026년 5월 기준 Kubestronaut 프로그램과 CNCF 자격증 사다리를 끝까지 본다. 5종 핵심 시험(CKA, CKAD, CKS, KCNA, KCSA)의 출제 범위, 시험 형식, 합격선, 합격률, Killer Shell 모의시험, KodeKloud/A Cloud Guru/Linux Foundation 트레이닝, Golden Kubestronaut 코스, 어소시에이트 사다리(PCA,
2026-05-16 · 30 분 읽기 #kubestronaut#cncf#kubernetes#cka#ckad시계열 데이터베이스 2026 — TimescaleDB / InfluxDB 3 / QuestDB / ClickHouse / VictoriaMetrics 심층 비교
2026년 시계열 DB 지도를 그린다 — TimescaleDB(Postgres 확장 1위), InfluxDB 3(Apache DataFusion + Arrow로 다시 태어남), QuestDB(SQL + 빠른 ingest), ClickHouse(컬럼 스토어의 압도적 분석 성능), VictoriaMetrics(Prometheus 호환 + 가벼움), Prometheus + Grafana Mimir
2026-05-15 · 29 분 읽기 #time-series#database#tsdb#timescaledb#influxdbObservability 완벽 가이드 — Metrics, Logs, Traces, Profiling: Prometheus, OpenTelemetry, Jaeger, Loki, Grafana 모든 것 (2025)
Observability의 모든 것 — Monitoring과 Observability의 차이, 네 가지 기둥(Metrics, Logs, Traces, Profiling), Prometheus의 시계열 DB와 PromQL, OpenTelemetry의 통합 데이터 모델, Jaeger의 span/trace 모델, Loki의 label 인덱싱, Grafana 대시보드, SRE의 SLI/SLO/SLA
2026-04-15 · 43 분 읽기 #observability#monitoring#prometheus#opentelemetry#jaegerObservability 완전 가이드 — Metric·Log·Trace·OpenTelemetry·eBPF·SLO (Season 2 Ep 9, 2025)
"관측할 수 없으면 운영할 수 없다." Observability는 로그 수집·모니터링의 상위 개념으로, 알려지지 않은 문제(unknown unknowns)를 시스템 상태만으로 추론할 수 있게 하는 능력이다. 이 글은 Metric·Log·Trace 3축, Profile을 더한 4축, OpenTelemetry 표준의 진짜 가치, eBPF 커널 수준 관측, SLO·SLI·Error Budget 실
2026-04-15 · 16 분 읽기 #observability#opentelemetry#prometheus#grafana#loki시계열 데이터베이스 완전 가이드 2025: TimescaleDB, InfluxDB, Prometheus, ClickHouse 비교
시계열 DB의 모든 것! TimescaleDB(PostgreSQL 확장), InfluxDB, Prometheus, ClickHouse, VictoriaMetrics 비교, 압축(Gorilla), 다운샘플링, 보존 정책, 카디널리티 폭증, IoT/모니터링/금융 사용 사례.
2026-04-15 · 19 분 읽기 #time-series#database#timescaledb#influxdb#prometheus관측 가능성의 현재 심화 가이드 — OpenTelemetry, Prometheus, eBPF, SLO/SLI, Continuous Profiling, Chaos Engineering까지 (2025)
분산 시스템에서 가장 중요한 역량은 "모르는 것을 알게 되는 능력"이다. 2024-2025년 관측 가능성은 혁명의 한복판에 있다. OpenTelemetry 1.0 GA, eBPF 기반 agentless 프로파일링, Continuous Profiling 주류화, Datadog vs Grafana vs Honeycomb 경쟁 재편. Metrics/Logs/Traces/Profiles 4-pill
2026-04-15 · 21 분 읽기 #observability#opentelemetry#prometheus#grafana#ebpfWebSocket 실시간 통신 & 옵저버빌리티(모니터링) 완전 가이드
WebSocket/SSE/gRPC 실시간 통신 원리부터 OpenTelemetry, Prometheus, Grafana를 활용한 옵저버빌리티 구축까지.
2026-04-12 · 18 분 읽기 #devops#websocket#realtime#observability#monitoringObservability & 모니터링 완전 가이드 2025: 로깅, 메트릭, 트레이싱, 알림 전략
Observability의 모든 것! Three Pillars(로그/메트릭/트레이스), OpenTelemetry, Prometheus+Grafana, ELK Stack, 분산 트레이싱(Jaeger/Tempo), 알림 전략(PagerDuty/OpsGenie), SLO/SLI/SLA, 비용 최적화.
2026-03-25 · 25 분 읽기 #observability#monitoring#logging#distributed-tracing#metrics