タグ: #error-budget
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 5 件
深夜3時に起こさないアラート設計 — 症状ベースのアラートとバーンレート実践
オンコールが崩壊する理由は、アラートが足りないからではなく多すぎるからです。アラート疲れが実際の事故を見逃させるメカニズムから、症状にだけページを掛けて原因はダッシュボードに置くという原則、SLOとエラーバジェットからしきい値を逆算する方法までを扱います。短い窓と長い窓をANDで結ぶ多重ウィンドウのバーンレートアラートが、どうやって感度と誤検知を同時に押さえるのか、for句がフラッピングを防ぐ原理は何なのかを、Prometheusのルー
2026-07-26 · 21 分で読めます #observability#alerting#slo#error-budget#prometheusObservability 完全ガイド — Metric・Log・Trace・OpenTelemetry・eBPF・SLO (Season 2 Ep 9, 2025)
「観測できなければ運用できない」。Observability はログ収集やモニタリングの上位概念で、unknown unknowns をシステム状態だけから推論する能力である。本稿では Metric・Log・Trace の3軸、Profile を加えた4軸、OpenTelemetry 標準の真価、eBPF によるカーネルレベル観測、SLO・SLI・Error Budget の実戦設計、そして Grafana Stack vs Elast
2026-04-15 · 14 分で読めます #observability#opentelemetry#prometheus#grafana#lokiObservability 2025 完全ガイド: OpenTelemetry、Grafana・Datadog・Honeycomb・SigNoz、SLO・Error Budget、LLM可観測性 (2025)
Season 5 Ep 8。可観測性なくして運用なし、運用なくしてプロダクトなし。OpenTelemetryの3大シグナル(Metric・Log・Trace)の統合、Grafanaスタック(Prometheus・Loki・Tempo・Mimir)とDatadog・New Relic・Splunkの比較、SigNoz・Honeycomb・Axiomという新世代、SLO・SLI・Error Budgetの運用、LLM可観測性(LangFus
2026-04-15 · 14 分で読めます #observability#opentelemetry#grafana#datadog#honeycombSRE 実践ガイド 2025:インシデント管理、ポストモーテム、Error Budget、On-Call、Toil削減
SRE実践のすべて!インシデント管理(検出→対応→復旧→ポストモーテム)、Error Budget政策、On-Call運営(ローテーション/エスカレーション/疲労管理)、Toil削減自動化、SLO/SLI/SLA設定、Blamelessポストモーテム作成法、Google SRE文化。
2026-04-14 · 30 分で読めます #sre#site-reliability#incident-management#postmortem#error-budgetSLI/SLO/Error Budget基盤の信頼性エンジニアリング実践ガイド
SLI/SLO/Error Budgetを活用した信頼性エンジニアリングの理論と実践を解説します。SLI指標の選定、SLO数値の設定、Error Budgetポリシー、Burn Rateアラート、Prometheusベースの実装まで、プロダクションサービスの信頼性管理パイプライン全体をコードと共に構築します。
2026-03-13 · 19 分で読めます #observability#sli#slo#error-budget#sre