LabHub

ブログ

Observability 2025 完全ガイド: OpenTelemetry、Grafana・Datadog・Honeycomb・SigNoz、SLO・Error Budget、LLM可観測性 (2025)

한국어English日本語中文

Season 5 Ep 8 — ガバナンスが「管理」なら、可観測性は 「現実の把握」 だ。2025年のObservabilityはLog・Metric・Traceで止まらず、LLM・データパイプライン・ユーザー体験 まで含む。

Prologue — 「可観測性は保険ではなくプロダクトだ」

2015–2020年、多くのチームは可観測性を「事故対応のための保険」として扱っていた。2025年は違う:

「可観測性はコストだ」と言われた時代は終わった。「可観測性はプロダクト品質の一部だ」が2025年の標準である。


第1章 · 3大シグナル + α

1.1 基本の3種

1.2 拡張シグナル

1.3 相関(Correlation)


第2章 · OpenTelemetry — 標準の成熟

2.1 何なのか

2.2 構造

2.3 なぜ重要か

2.4 導入の難易度


第3章 · Grafanaスタック(オープン)

3.1 構成

3.2 Grafana Cloud

3.3 強み

3.4 限界


第4章 · Datadog・New Relic・Splunk・Dynatrace — SaaSの巨人たち

4.1 Datadog

4.2 New Relic

4.3 Splunk

4.4 Dynatrace

4.5 比較

ツール強み弱み
Datadog統合性コスト
New Relic透明な価格機能の分散
Splunkログ・セキュリティコスト・複雑さ
Dynatrace自動化学習曲線
Grafana Cloudコスパ統合体験

第5章 · 新世代 — Honeycomb・SigNoz・Axiom・Tinybird

5.1 Honeycomb

5.2 SigNoz

5.3 Axiom

5.4 Tinybird

5.5 OpenObserve

5.6 共通点


第6章 · Logs・Metrics・Tracesの実装実践

6.1 Metric設計

6.2 Log設計

6.3 Trace設計

6.4 RUM

6.5 Synthetic


第7章 · SLO・SLI・Error Budget

7.1 概念

7.2 なぜ重要か

7.3 実践的な指標

7.4 Error Budgetのポリシー

7.5 ツール


第8章 · LLM Observability(Ep 6の延長)

8.1 追加のシグナル

8.2 主要ツール

8.3 OpenLLMetry

8.4 運用パターン


第9章 · カオスエンジニアリング・回復力

9.1 哲学

9.2 ツール

9.3 実践

9.4 データパイプラインへの適用

9.5 2025年のトレンド


第10章 · アラート・オンコール・事故対応

10.1 アラート設計

10.2 オンコール文化

10.3 事故対応

10.4 Postmortem

10.5 ツール


第11章 · コスト最適化

11.1 ログのコスト

11.2 Metricのコスト

11.3 Traceのコスト

11.4 SaaSのコスト

11.5 現実的な目標


第12章 · 韓国企業の可観測性

12.1 現況

12.2 LLM可観測性の導入

12.3 韓国特有の事情

12.4 参考事例


第13章 · アンチパターン10選

13.1 「デプロイ後に可観測性を追加」

最初から計装してこそ価値がある。

13.2 すべてのログをDEBUGに

コストが暴騰し、重要なシグナルが埋もれる。

13.3 アラートのスパム

すべてのエラーにアラート → アラート無視症候群。

13.4 SLOのない運用

「開発 vs 安定性」の政治的な争いになる。

13.5 Traceなしの障害分析

数時間かかり、原因も分からない。

13.6 高カーディナリティなMetricラベル

Prometheusが暴走する。

13.7 ログに機密情報

監査・流出事故。

13.8 Postmortemなしで同じ事故を繰り返す

学習ループの欠如。

13.9 SaaSコストの放置

月末の請求書ショック。

13.10 LLM可観測性がゼロ

ハルシネーション・拒否・コスト暴走を検知できない。


第14章 · チェックリスト — 可観測性のローンチ前12項目


第15章 · 次回予告 — Season 5 Ep 9:「データチームの組織とキャリア」

技術・ガバナンス・可観測性を積み上げたので、次は それを作る人たち だ。Ep 9はデータ・AIチームの組織とキャリアを扱う。

「ツールより大事なのはチーム」 — 2025年のデータ組織の現在地。

次回の記事で会おう。


要約: 2025年の可観測性は 「3大シグナル + α」(Metric・Log・Trace + Profile・RUM・Synthetic・LLMイベント)へ広がり、OpenTelemetryが収集の標準になったことでベンダーロックインは急速に解消しつつある。Grafanaスタックはオープンでコスパが良く、Datadog・New Relic・Splunk・Dynatraceは統合とエンタープライズ、Honeycomb・SigNoz・Axiomは新世代の低コスト・高探索性。SLO・Error Budget が開発と安定性のバランスを取る言語になり、LLM可観測性(LangFuse・Phoenix・Helicone・Datadog LLM)はEp 6の延長線上で主流になった。「可観測性は保険ではなくプロダクト品質だ」という宣言が2025年のデフォルト。韓国企業は網分離・韓国語・SLO文化を融合させつつあり、次回はその可観測性を作る データチームと人々 の話だ。

コメント

まだコメントはありません。

ログインするとコメントできます