태그: #observability
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 118 편
구조화 로깅 설계 — 장애가 났을 때 실제로 도움이 되는 로그 만들기
장애 한복판에서 로그를 grep하다 포기해 본 적이 있다면 로그 설계가 잘못된 것입니다. 사람이 읽는 로그와 기계가 읽는 로그를 분리하고, 모든 라인에 반드시 들어가야 할 필드를 정하고, 로그 레벨을 판단하는 단 하나의 기준을 세우는 방법을 다룹니다. W3C traceparent로 서비스 경계 너머까지 요청을 따라가는 법, 개인정보와 시크릿을 걸러내는 마스킹 설정, 이야기가 끊기지 않는 요청
2026-07-26 · 20 분 읽기 #observability#logging#structured-logging#opentelemetry#incident-response새벽 3시에 깨우지 않는 알림 설계 — 증상 기반 알림과 번 레이트 실전
온콜이 무너지는 이유는 알림이 부족해서가 아니라 너무 많아서입니다. 알림 피로가 실제 사고를 놓치게 만드는 메커니즘부터, 증상에만 페이지를 걸고 원인은 대시보드에 두는 원칙, SLO와 에러 버짓에서 임계값을 역산하는 방법을 다룹니다. 짧은 창과 긴 창을 AND로 묶는 다중 윈도우 번 레이트 알림이 어떻게 민감도와 오탐을 동시에 잡는지, for 절이 플래핑을 막는 원리는 무엇인지 프로메테우스
2026-07-26 · 21 분 읽기 #observability#alerting#slo#error-budget#prometheus분산 트레이싱이 실제로 답하는 질문 — 스팬, 샘플링, 그리고 어디서 시간이 갔는가
"느리다"는 신고는 들어오는데 열 개 서비스 중 어디가 범인인지 모를 때 필요한 것이 트레이싱입니다. 트레이스와 스팬, 컨텍스트 전파의 구조부터 시작해 로그와 메트릭으로는 원리적으로 답할 수 없는 질문이 무엇인지 정리합니다. 자동 계측이 커버하는 범위와 수동 스팬을 반드시 넣어야 하는 지점, 헤드 샘플링이 왜 필요한 트레이스를 우선적으로 버리는지, 테일 샘플링이 그것을 어떻게 풀고 대신 무엇
2026-07-26 · 25 분 읽기 #observability#distributed-tracing#opentelemetry#tail-sampling#performance평균 응답 시간이 거짓말하는 이유 — p50, p95, p99를 제대로 읽는 법
평균 응답 시간이 80ms인 서비스에서 사용자가 3초를 기다리는 일은 흔합니다. 롱테일 분포에서 평균이 무엇을 감추는지, p50과 p95, p99, p99.9가 각각 어떤 질문에 답하는지, 그리고 p99가 왜 "100명 중 1명"이 아닌지를 숫자로 설명합니다. 백분위는 평균낼 수 없다는 결정적 사실과 그래서 히스토그램이 필요한 이유, 프로메테우스 histogramquantile의 선형 보간
2026-07-26 · 18 분 읽기 #observability#percentile#prometheus#histogram#sloAI 에이전트는 프로덕션에서 어떻게 실패하는가 — 14가지 실패 모드, 그리고 재시도가 안전하지 않은 이유
에이전트를 프로덕션에 올리면 세 가지가 아픕니다. 첫째, 실패는 모델이 아니라 시스템 설계에서 납니다 — UC 버클리의 MAST 연구는 실행 트레이스 1642건을 분류해 14가지 실패 모드를 뽑았고, 그중 44.2%가 시스템 설계 이슈였습니다. 둘째, 가장 흔한 실패 모드 두 개(단계 반복 15.7%, 종료 조건 미인지 12.4%)가 곧바로 토큰 청구서입니다. 셋째, 바로 그 두 개가 재시도
2026-07-17 · 40 분 읽기 #ai#agents#observability#reliability#mcp네이티브 히스토그램은 stable이 됐는데, 왜 아직 못 켜고 있나
2022년 11월 v2.40에서 실험 기능으로 등장한 Prometheus 네이티브 히스토그램은 2025년 12월 3.8.0에서 stable이 됐고, 2026년 7월 1일 릴리스된 3.13이 이 기능을 stable 상태로 담은 첫 LTS입니다. 기존 3.5 LTS는 2026년 7월 31일에 지원이 끝나므로, LTS 트랙을 타는 조직에게는 지금이 실제 결정 시점입니다. 다만 stable이라는 단
2026-07-16 · 32 분 읽기 #prometheus#observability#native-histograms#metrics#monitoringOTel의 Kubernetes 속성이 stable이 됐다 — k8sattributes 기본값이 뒤집히기 전에 할 일
OpenTelemetry의 Kubernetes 시맨틱 컨벤션이 2026년 6월 12일 semconv v1.42.0에서 stable로 승급했습니다. 그런데 Collector의 k8sattributes 프로세서는 아직 기본값이 옛 스키마(v0)라, 대부분의 사람은 아무 일도 겪지 않았습니다. 문제는 이게 영구적이지 않다는 것입니다 — Collector RFC가 정한 롤아웃대로라면 피처 게이트가
2026-07-16 · 22 분 읽기 #opentelemetry#observability#kubernetes#semantic-conventions#telemetry-pipeline관측 가능성 완전 정복: 로그·트레이싱·LLM 모니터링
로그·메트릭·트레이스라는 세 기둥부터 이들이 traceid로 어떻게 엮이는지, Loki와 OpenSearch의 로그 전략 차이, OpenTelemetry를 중심으로 한 분산 트레이싱(Jaeger·Tempo), 그리고 Langfuse로 대표되는 LLM 관측 가능성까지. 실무에서 스택을 어떻게 짜고 무엇을 골라야 하는지 하나씩 대조하며 정리합니다.
2026-07-03 · 27 분 읽기 #observability#opentelemetry#tracing#logging#llm로그와 스택트레이스를 탐정처럼 읽기
스택트레이스는 사건 현장이고, 로그는 목격자 진술입니다. 스택트레이스를 위에서 아래로 읽는 법(맨 위는 터진 곳, 맨 아래는 발단), "caused by" 사슬 추적, 구조화·JSON 로깅, 상관관계 ID와 traceid, grep·jq·ripgrep으로 로그 파헤치기, 로그 레벨과 샘플링까지. 로그와 트레이스를 증거처럼 다루는 탐정의 기술.
2026-06-28 · 22 분 읽기 #logging#debugging#stack-trace#observabilityOperator 관측성 — 메트릭, 이벤트, 로깅, 그리고 SLO
Kubebuilder 기반 Operator의 관측성을 메트릭, 이벤트, 로깅, 트레이싱, status/conditions, 그리고 SLO 관점에서 깊이 있게 다룹니다. controller-runtime 기본 메트릭의 의미부터 커스텀 메트릭 추가, Prometheus/Grafana 연동, 알림 규칙, 그리고 reconcile가 동작하지 않을 때의 디버깅 런북까지 실무 코드와 함께 정리합니다.
2026-06-15 · 32 분 읽기 #kubernetes#operator#observability#prometheus#controller-runtimeIngress 관측성 — 메트릭, 액세스 로그, 트레이싱
Ingress 컨트롤러의 골든 시그널을 정의하고 ingress-nginx의 Prometheus 메트릭, Grafana 대시보드, 구조화된 액세스 로그(Loki), OpenTelemetry 분산 트레이싱, 알림 룰까지 실무 관측성 스택을 구축하는 방법을 다룹니다. per-ingress 분석과 용량 계획, 트러블슈팅 워크플로도 함께 정리했습니다.
2026-06-14 · 19 분 읽기 #ingress#kubernetes#nginx#observability#networkingeBPF 기초 완전 정복 — 프로그램, 맵, 그리고 Verifier의 세계
eBPF가 리눅스 커널 프로그래밍을 어떻게 바꿨는지 처음부터 끝까지 정리합니다. 프로그램 타입과 맵, Verifier의 동작 원리를 이해하고, libbpf와 CO-RE 기반의 첫 eBPF 프로그램을 직접 만들어 봅니다.
2026-06-13 · 33 분 읽기 #ebpf#linux#kernel#libbpf#observabilityeBPF 관측성 실전 — bpftrace로 시스템의 블랙박스를 열다
bpftrace 원라이너 10선과 BCC 도구상자로 운영 중인 시스템을 코드 수정 없이 들여다보는 방법을 다룹니다. 지연 히스토그램 해석, 플레임그래프, 컨테이너 환경 적용, 그리고 실전 트러블슈팅 시나리오 3가지를 단계별로 정리했습니다.
2026-06-13 · 26 분 읽기 #ebpf#bpftrace#observability#linux#profilingHubble과 ClusterMesh — Cilium 관측성과 멀티클러스터 운영
Cilium의 관측성 계층 Hubble의 아키텍처와 CLI 실전 쿼리, Prometheus 메트릭과 플로우 로그 장기 보관을 다루고, ClusterMesh로 멀티클러스터 서비스 디스커버리와 글로벌 서비스, 정책, 암호화를 구성하는 방법을 운영 관점에서 정리합니다.
2026-06-13 · 22 분 읽기 #cilium#hubble#clustermesh#observability#multi-clusterKeycloak 관측성 — 메트릭, 감사 로그, 이벤트 기반 모니터링
Keycloak의 이벤트 시스템과 메트릭 엔드포인트, EventListener SPI를 활용한 외부 전송, Prometheus와 Grafana 대시보드 구성, OpenTelemetry tracing, 이상 징후 탐지와 알림 룰, 그리고 ISMS/SOC2 감사 컴플라이언스 관점까지 Keycloak 관측성을 종합적으로 다룹니다.
2026-06-12 · 21 분 읽기 #keycloak#observability#monitoring#prometheus#securityeBPF가 관측성을 삼키고 있다
커널 안에서 샌드박스된 프로그램을 안전하게 돌린다는 아이디어가 관측성 판을 뒤집고 있습니다. kprobe·uprobe·tracepoint·XDP로 어디에나 후크를 걸고, 검증기가 안전을 보장하며, 애플리케이션 코드를 한 줄도 고치지 않고 추적합니다. Cilium·Falco·Pixie·bpftrace가 왜 사이드카를 대체하는지, 그리고 eBPF가 못 하는 것은 무엇인지 실무 관점에서 정리합니다
2026-06-11 · 26 분 읽기 #ebpf#observability#linux#kernel관측성(Observability) 2026 완벽 가이드 - OpenTelemetry · Datadog · Grafana Stack(LGTM+Beyla) · Honeycomb · Prometheus · Jaeger · eBPF · SLO 심층 분석
2026년 5월 기준 프로덕션 관측성(observability) 스택을 OpenTelemetry 표준 위에서 끝까지 본다. SaaS(Datadog, New Relic, Dynatrace, Splunk, Honeycomb, Coralogix, Logz.io, Chronosphere), 오픈소스(Grafana LGTM+Beyla, Prometheus+Mimir/Cortex/Thanos, Jaeg
2026-05-16 · 29 분 읽기 #observability#opentelemetry#datadog#grafana#honeycomb소프트웨어 디버깅 도구 2026 완벽 가이드 - gdb · lldb · rr · Pernosco · Replay.io · ASan · Valgrind · eBPF · perf · 타임트래블 디버깅 심층 분석
2026년 디버깅 도구의 전 지형을 한 번에 본다. printf 무패 신화부터 gdb·lldb의 인터랙티브 디버깅, rr·Pernosco·Replay.io가 만든 타임트래블·옴니션트 디버깅, AddressSanitizer·Valgrind의 트레이드오프, perf·FlameGraph·eBPF·bpftrace·BCC의 동적 트레이싱, JFR·async-profiler·py-spy·Delve 같은
2026-05-16 · 42 분 읽기 #debugging#gdb#lldb#rr#pernosco에러 트래킹 & 모니터링 2026 — Sentry / Bugsnag / Honeybadger / GlitchTip / Highlight / LogRocket / Hyperdx 심층 비교
2026년 에러 트래킹 / 모니터링 전체 지도를 한 번에 — 2024년 Codecov 인수 후 AI 그룹화와 Replay 를 기본으로 끌어올린 사실상의 리더 Sentry, SmartBear 산하에서 엔터프라이즈 컴플라이언스를 챙긴 Bugsnag, 한 사람의 인디 개발자도 부담없이 쓸 수 있는 Honeybadger, Sentry SDK 호환의 셀프호스팅 오픈소스 GlitchTip, 세션 리플레
2026-05-16 · 30 분 읽기 #error-tracking#monitoring#sentry#bugsnag#honeybadger시계열 데이터베이스 2026 완벽 가이드 - InfluxDB 3 · TimescaleDB · QuestDB · ClickHouse · Prometheus · VictoriaMetrics · Grafana Mimir 심층 분석
2026년 시계열 데이터베이스(TSDB) 풀스택 해부. InfluxDB 3.0의 Rust + Apache Arrow + DataFusion + Parquet 리라이트, TimescaleDB 2.18 hypertables, QuestDB 8.x SIMD 인제스트, ClickHouse 25.x MergeTree, Prometheus 3.0과 VictoriaMetrics 1.110+ Metrics
2026-05-16 · 44 분 읽기 #time-series-database#influxdb#timescaledb#questdb#clickhouse