태그: #metrics
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 12 편
코드 리뷰 완전 가이드: 리뷰를 프로세스로 설계하기
코드 리뷰를 대화가 아니라 처리량·지연 시간·소유권을 가진 시스템으로 봅니다. 승인 기준의 문서화, 변경 크기, 1영업일 응답 규칙, 사람과 자동화의 분담, 소유권과 승인 규칙, 코멘트 등급, 교착 시 에스컬레이션, 그리고 리뷰 지표가 오용되는 방식까지 운영 관점에서 정리합니다.
2026-08-15 · 40 분 읽기 #코드리뷰#개발문화#code-review#process#automation질문에 답하는 Prometheus 메트릭 설계 — 타입 선택, 카디널리티 예산, rate 와 분위수의 함정
메트릭은 많을수록 좋은 것이 아니라 질문에 답할 수 있어야 쓸모가 있습니다. 카운터와 게이지와 히스토그램이 각각 어떤 질문에 답하는지, 잘못 고르면 어떤 계산이 원리적으로 불가능해지는지부터 정리합니다. 레이블 카디널리티를 감으로 다루지 않도록 숫자로 예산을 잡는 방법, rate 와 histogramquantile 이 조용히 틀린 답을 주는 조건, 그리고 레코딩 룰을 언제 어떤 이름으로 만드는
2026-08-02 · 28 분 읽기 #observability#prometheus#promql#metrics#cardinality텍스트·이미지·에이전트를 각각 어떻게 재는가 — 세 영역의 측정이 근본적으로 다른 이유
텍스트·이미지·에이전트는 같은 "성능"이라는 단어를 쓰지만 측정 구조가 전혀 다릅니다. 텍스트는 정답이 있는 척하는 객관식과 정답이 없는 생성형으로 갈라지고, 이미지는 분포 거리와 사람 판단이 어긋나며, 에이전트는 부분 성공·환경 상태·비결정성 때문에 애초에 하나의 숫자로 압축되지 않습니다. 이 글은 각 영역의 대표 지표가 실제로 계산하는 값을 정의 수준에서 뜯어보고, 영역마다 "지표는 높은
2026-08-02 · 37 분 읽기 #llm-evaluation#multimodal#llm-as-judge#agent-benchmark#metrics리팩터링의 경제학, 언제 비용이 회수되나 — 변경 빈도로 계산하는 법
2026년 7월 30일 martinfowler.com에 올라온 The Economic Benefit of Refactoring은 1만 7천 줄짜리 모듈을 15단계에 걸쳐 리팩터링하면서, 같은 변경 요청을 매번 다시 돌려 입력 토큰이 159,564개에서 27,360개로 83퍼센트 줄어드는 것을 측정했습니다. 흥미로운 실험이지만 저자 스스로 단일 실험이자 그린필드 앱 하나라고 못 박습니다. 이
2026-07-31 · 27 분 읽기 #refactoring#engineering#technical-debt#ai#metrics네이티브 히스토그램은 stable이 됐는데, 왜 아직 못 켜고 있나
2022년 11월 v2.40에서 실험 기능으로 등장한 Prometheus 네이티브 히스토그램은 2025년 12월 3.8.0에서 stable이 됐고, 2026년 7월 1일 릴리스된 3.13이 이 기능을 stable 상태로 담은 첫 LTS입니다. 기존 3.5 LTS는 2026년 7월 31일에 지원이 끝나므로, LTS 트랙을 타는 조직에게는 지금이 실제 결정 시점입니다. 다만 stable이라는 단
2026-07-16 · 32 분 읽기 #prometheus#observability#native-histograms#metrics#monitoring성공한 회사는 어떻게 눈이 머는가 — 엔지니어링 조직의 역량 실명
Ian Reppel의 에세이는 성공한 회사가 그가 "역량 실명(competence blindness)"이라 부르는 상태에 빠진다고 말합니다. 멕시코 동굴 물고기가 스스로 눈을 억제하듯, 환경이 더 이상 보상하지 않기 때문에 꼼꼼한 엔지니어링을 발현하지 않게 되는 것입니다. 이것은 단순한 방치가 아니라 능동적 억제이며, 고전적 파괴적 혁신과도 다릅니다. 이 글은 그 주장을 충실히 옮긴 뒤, 그
2026-07-11 · 18 분 읽기 #engineering-culture#organizations#legacy#metrics#leadership시계열 데이터베이스 2026 완벽 가이드 - InfluxDB 3 · TimescaleDB · QuestDB · ClickHouse · Prometheus · VictoriaMetrics · Grafana Mimir 심층 분석
2026년 시계열 데이터베이스(TSDB) 풀스택 해부. InfluxDB 3.0의 Rust + Apache Arrow + DataFusion + Parquet 리라이트, TimescaleDB 2.18 hypertables, QuestDB 8.x SIMD 인제스트, ClickHouse 25.x MergeTree, Prometheus 3.0과 VictoriaMetrics 1.110+ Metrics
2026-05-16 · 44 분 읽기 #time-series-database#influxdb#timescaledb#questdb#clickhouseOpenTelemetry 2026 심층 — OTLP·시맨틱 컨벤션·Collector 파이프라인·자동 계측의 표준화 전쟁이 끝난 자리
OpenTelemetry는 더 이상 '경쟁하는 옵션 중 하나'가 아니다. 2026년 5월 기준, OTLP는 모든 주요 옵저버빌리티 벤더가 받는 단일 프로토콜이 됐고, HTTP·관계형 DB·메시징 시맨틱 컨벤션 v1은 stable로 잠겼다. 로그가 GA로 들어왔고, Profiles는 네 번째 시그널로 자리잡아 가는 중이다. Beyla·Coroot가 끌고 온 eBPF 자동 계측은 'SDK 없이
2026-05-14 · 39 분 읽기 #opentelemetry#observability#traces#metrics#logsOpenTelemetry 완전 해부 — Trace/Metric/Log/Profile 4기둥, Collector, 샘플링, OTLP까지
Jaeger 대시보드의 예쁜 스팬 뒤에 있는 진실. OpenTelemetry의 탄생 배경부터 Span/TraceContext 전파 메커니즘, Collector 파이프라인, Head vs Tail 샘플링, eBPF auto-instrumentation, 그리고 Profile이 네 번째 기둥이 된 이야기까지.
2026-04-15 · 21 분 읽기 #opentelemetry#observability#distributed-tracing#metrics#logsObservability & 모니터링 완전 가이드 2025: 로깅, 메트릭, 트레이싱, 알림 전략
Observability의 모든 것! Three Pillars(로그/메트릭/트레이스), OpenTelemetry, Prometheus+Grafana, ELK Stack, 분산 트레이싱(Jaeger/Tempo), 알림 전략(PagerDuty/OpsGenie), SLO/SLI/SLA, 비용 최적화.
2026-03-25 · 25 분 읽기 #observability#monitoring#logging#distributed-tracing#metrics관측성(Observability) 완전 가이드 2025: Prometheus, Grafana, OpenTelemetry로 시스템을 투명하게
관측성의 3가지 축(메트릭/로그/트레이스)을 완전 정복! Prometheus 쿼리(PromQL), Grafana 대시보드, OpenTelemetry 계측, Jaeger 분산 추적, ELK/Loki 로깅, 알림 전략, SLI/SLO/SLA, 온콜 문화까지.
2026-03-23 · 25 분 읽기 #observability#monitoring#prometheus#grafana#opentelemetryVMI status, metrics, guest agent, debugging: KubeVirt는 내부 상태를 어떻게 드러내는가
KubeVirt가 VMI status, guest agent, domain stats, Prometheus metrics, virt-handler API를 통해 VM 내부 상태를 어떻게 수집하고 노출하는지 코드 기준으로 정리한다.
2026-03-20 · 10 분 읽기 #architecture#kubevirt#observability#metrics#guest-agent