태그: #observability
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 118 편
Prometheus 서비스 디스커버리 메커니즘 완전 분석
Prometheus 서비스 디스커버리의 내부 구조를 분석합니다. Discovery Manager 아키텍처, Provider 인터페이스, kubernetessd의 watch 메커니즘, relabeling 동작 원리, filesd와 HTTP SD, 타겟 생명주기를 소스코드 레벨에서 살펴봅니다.
2026-03-20 · 16 분 읽기 #prometheus#observability#open-source-internalsPrometheus 알림 파이프라인: Rule 평가부터 Alertmanager 전달까지
Prometheus 알림 파이프라인의 내부를 분석합니다. Rule Manager의 평가 메커니즘, Alert 상태 머신(inactive/pending/firing/resolved), for duration, Alertmanager의 라우팅 트리, 억제, 사일런싱, 그루핑, 중복 제거, 알림 전달 파이프라인, HA 클러스터 gossip까지 다룹니다.
2026-03-20 · 16 분 읽기 #prometheus#observability#open-source-internalsVMI status, metrics, guest agent, debugging: KubeVirt는 내부 상태를 어떻게 드러내는가
KubeVirt가 VMI status, guest agent, domain stats, Prometheus metrics, virt-handler API를 통해 VM 내부 상태를 어떻게 수집하고 노출하는지 코드 기준으로 정리한다.
2026-03-20 · 10 분 읽기 #architecture#kubevirt#observability#metrics#guest-agentPrometheus 운영 실전 가이드: TSDB, 카디널리티, Recording Rules, Federation, Remote Write
Prometheus를 안정적으로 운영하기 위해 꼭 알아야 할 TSDB 보존 전략, 고카디널리티 대응, recording rules와 alerting rules 설계, federation과 remote write 선택 기준을 정리합니다.
2026-03-17 · 10 분 읽기 #prometheus#observability#tsdb#cardinality#recording-ruleseBPF와 OpenTelemetry로 진화하는 관찰가능성(Observability) 2026
eBPF 기술과 OpenTelemetry 표준화의 결합으로, 2026년 관찰가능성은 근본적으로 변화하고 있습니다. 제로 계측(zero-instrumentation) 트레이싱, AI 기반 근본원인 분석, 비용 최적화된 관찰가능성 스택이 표준이 되어, 엔지니어들은 이제 "왜"의 질문에 즉시 답할 수 있습니다.
2026-03-16 · 15 분 읽기 #ebpf#observability#opentelemetry#cilium#distributed-systems분산 트레이싱 실전 가이드: OpenTelemetry, Jaeger, Grafana Tempo
마이크로서비스 환경에서 분산 트레이싱을 구현하는 방법을 OpenTelemetry SDK 계측부터 Jaeger, Grafana Tempo 백엔드 구축까지 실전 코드로 다룹니다.
2026-03-14 · 27 분 읽기 #observability#distributed-tracing#opentelemetry#jaeger#tempoSLI/SLO/Error Budget 기반 신뢰성 엔지니어링 실전 가이드
SLI/SLO/Error Budget을 활용한 신뢰성 엔지니어링의 이론과 실전을 다룹니다. SLI 지표 선정, SLO 수치 설정, Error Budget 정책, Burn Rate 알럿, Prometheus 기반 구현까지 프로덕션 서비스의 신뢰성 관리 전체 파이프라인을 코드와 함께 구축합니다.
2026-03-13 · 21 분 읽기 #observability#sli#slo#error-budget#sreELK 스택 기반 로그 수집·분석 파이프라인: Elasticsearch·Fluentd·Kibana 프로덕션 구축과 최적화
ELK/EFK 스택의 아키텍처와 Elasticsearch 클러스터 설계, 샤드·레플리카 전략, ILM(Index Lifecycle Management) 설정, Fluentd/Fluent Bit 로그 수집 파이프라인 구성, Kibana 대시보드 시각화, 성능 튜닝과 장애 대응까지 프로덕션 환경의 로그 파이프라인 구축 전 과정을 다룹니다.
2026-03-12 · 18 분 읽기 #observability#elk-stack#elasticsearch#fluentd#kibanaPrometheus·Alertmanager 알림 파이프라인 구축: 규칙 작성부터 PagerDuty·Slack 라우팅까지
Prometheus와 Alertmanager를 활용한 프로덕션 알림 파이프라인을 구축합니다. PromQL 기반 알림 규칙 작성, Alertmanager 라우팅 트리 설계, PagerDuty·Slack 통합, Alert Fatigue 방지 전략까지 운영 중심으로 다룹니다.
2026-03-12 · 27 분 읽기 #observability#prometheus#alertmanager#grafana#pagerdutyOpenTelemetry 분산 트레이싱 실전 가이드: 계측·수집·분석 파이프라인 구축과 운영
OpenTelemetry 아키텍처(SDK, API, Collector, Exporters), 트레이스 모델(Span, SpanContext, TraceID, SpanID, Baggage), Python·Node.js·Go 수동 계측, 자동 계측, Collector 파이프라인(receivers/processors/exporters), 샘플링 전략(head-based, tail-based), 백
2026-03-11 · 18 분 읽기 #observability#opentelemetry#distributed-tracing#instrumentation#monitoringGrafana Loki 로그 관리 완전 가이드: LogQL 쿼리·수집 파이프라인·알림 설정
Grafana Loki 기반 로그 관리 시스템을 심층적으로 다룹니다. Loki 아키텍처와 저장 구조, LogQL 쿼리 문법, Promtail/Alloy 수집 파이프라인, 알림 규칙 설정, Elasticsearch 대비 비용 효율성 분석까지 실전 운영 가이드를 제공합니다.
2026-03-10 · 20 분 읽기 #observability#loki#logql#log-management#promtailPrometheus 운영 총정리 — 메트릭 수집, PromQL, 알림, 대시보드, 모범사례
Prometheus의 아키텍처부터 메트릭 수집, PromQL 쿼리, Alertmanager 알림 설정, Grafana 대시보드 연동, 그리고 대규모 운영 모범사례까지 한 글에 정리했습니다.
2026-03-09 · 23 분 읽기 #observability#prometheus#monitoring#promql#alertmanagerOpenTelemetry Collector 운영 완벽 가이드 — 파이프라인 구성부터 백엔드 연동까지
OpenTelemetry Collector의 Receiver-Processor-Exporter 파이프라인 구성, 쿠버네티스 배포, 샘플링 전략, 성능 튜닝을 실전 설정 예제와 함께 총정리합니다.
2026-03-09 · 30 분 읽기 #observability#opentelemetry#collector#distributed-tracing#monitoringAIOps 기반 이상 탐지 자동화: ML 알림과 Kubernetes 이벤트 상관 분석 가이드
AIOps를 활용한 이상 탐지 자동화 종합 가이드. 전통적 임계값 알림의 한계, ML 기반 이상 탐지 알고리즘(Isolation Forest, Prophet, DBSCAN), Prometheus 메트릭 기반 자동 분석, Kubernetes 이벤트 상관 분석, 알림 노이즈 감소 전략, 그리고 Robusta/Datadog AIOps 실전 적용까지 다룹니다.
2026-03-09 · 34 분 읽기 #observability#aiops#anomaly-detection#machine-learning#kubernetesLLM 프로덕션 모니터링 플랫폼 비교: LangSmith·LangFuse·Arize Phoenix 실전 운영 가이드
LLM 프로덕션 모니터링 플랫폼 3종(LangSmith, LangFuse, Arize Phoenix) 종합 비교 가이드. 트레이스 수집, 프롬프트 버전 관리, 평가 파이프라인, 비용 모니터링, 품질 대시보드 구성, 그리고 실전 선택 기준까지 코드 예제와 함께 다룹니다.
2026-03-09 · 34 분 읽기 #ai-platform#llm-monitoring#langsmith#langfuse#arizeObservability 데이터 파이프라인 비용 최적화: 샘플링·필터링·티어링 전략
Observability 데이터 폭증에 따른 비용 문제를 해결하는 전략 가이드. OpenTelemetry Collector 기반 샘플링 정책, 로그 필터링 파이프라인, 메트릭 카디널리티 관리, 스토리지 티어링 아키텍처와 비용 절감 사례를 다룹니다.
2026-03-08 · 42 분 읽기 #observability#cost-optimization#sampling#opentelemetry#telemetry-pipelineGrafana OnCall과 인시던트 관리 자동화: PagerDuty 통합부터 Runbook 자동화까지
Grafana OnCall을 중심으로 인시던트 관리 자동화를 구축하는 실전 가이드. 온콜 스케줄링, 에스컬레이션 정책, PagerDuty·Slack 통합, Runbook 자동화, 알림 피로 해소 전략을 코드와 함께 다룹니다.
2026-03-08 · 44 분 읽기 #observability#grafana-oncall#incident-management#pagerduty#runbookObservability Telemetry Pipeline Cost Optimization: Sampling, Filtering, and Tiering Strategies
A practical guide to tackling observability cost explosion. Covers OpenTelemetry Collector-based sampling policies, log filtering pipelines, metric cardinality management, storage tiering architecture, and a phased optim
2026-03-08 · 7 분 읽기 #english#observability#cost-optimization#opentelemetry#telemetry-pipelineObservabilityデータパイプラインのコスト最適化:サンプリング・フィルタリング・ティアリング戦略
Observabilityデータ急増に伴うコスト課題を解決する実践ガイド。OpenTelemetry Collectorベースのサンプリング戦略、ログフィルタリング、メトリクスカーディナリティ管理、ストレージティアリングを実例とチェックリスト付きで解説します。
2026-03-08 · 8 분 읽기 #japanese#observability#cost-optimization#opentelemetry#telemetry-pipelinePrometheus PromQL 고급 쿼리와 Recording Rules 최적화: SLI/SLO 기반 알림 체계 구축 가이드
Prometheus PromQL 고급 쿼리 패턴부터 Recording Rules로 성능 최적화, SLI/SLO 기반 알림 규칙 설계, Alertmanager 라우팅 전략, 그리고 대규모 환경 운영 트러블슈팅까지 다루는 종합 가이드.
2026-03-07 · 39 분 읽기 #observability#prometheus#promql#recording-rules#sli