タグ: #slo
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 12 件
GPUサービングのSLOとアラート設計 — 何を約束し何で人を起こすか
GPU推論サービスにSLOを掛けるには、まずどの指標が利用者体験を代弁するかを決める必要があります。最初のトークンまでの遅延とスループットは互いを食い合う関係にあり、片方だけを見て目標を立てると必ずもう一方が崩れます。本記事ではvLLMとDCGM Exporterが実際に公開する時系列だけを使ってSLIを定義する方法、ヒストグラムのバケット境界を閾値にすべき理由、飽和シグナルを読む順序、症状ベースのアラート設計、そしてGPUサービングで
2026-08-12 · 13 分で読めます #gpu#kubernetes#slo#alerting#prometheus読まれるダッシュボードと鳴らす価値のあるアラート — 問いの定義、変数構成、SLO、そしてアラート疲れ
ダッシュボードは見た目が美しいことではなく、決まった問いに順番どおり答えられることに価値があります。パネルを作る前に答えるべき問いを書き出す方法から、ひとつのダッシュボードが複数の環境で再利用されるようにデータソースと変数をどう構成するかまでを扱います。アラートは原因ではなく症状に掛けるべき理由を事例で示し、SLOとエラーバジェット、マルチウィンドウのバーンレートアラートを実際のルールとして書きます。最後にアラート疲れを減らすルールと、
2026-08-02 · 24 分で読めます #observability#grafana#alerting#slo#dashboards平均応答時間が嘘をつく理由 — p50・p95・p99を正しく読む方法
平均応答時間が80msのサービスで、ユーザーが3秒待たされることはよくあります。ロングテール分布において平均が何を隠すのか、p50とp95、p99、p99.9がそれぞれどんな問いに答えるのか、そしてp99がなぜ「100人に1人」ではないのかを数字で説明します。パーセンタイルは平均できないという決定的な事実と、だからこそヒストグラムが必要になる理由、Prometheusのhistogramquantileにおける線形補間の誤差とバケット境
2026-07-26 · 18 分で読めます #observability#percentile#prometheus#histogram#slo深夜3時に起こさないアラート設計 — 症状ベースのアラートとバーンレート実践
オンコールが崩壊する理由は、アラートが足りないからではなく多すぎるからです。アラート疲れが実際の事故を見逃させるメカニズムから、症状にだけページを掛けて原因はダッシュボードに置くという原則、SLOとエラーバジェットからしきい値を逆算する方法までを扱います。短い窓と長い窓をANDで結ぶ多重ウィンドウのバーンレートアラートが、どうやって感度と誤検知を同時に押さえるのか、for句がフラッピングを防ぐ原理は何なのかを、Prometheusのルー
2026-07-26 · 21 分で読めます #observability#alerting#slo#error-budget#prometheusOperator の可観測性 — メトリクス、イベント、ロギング、そして SLO
Kubebuilder ベースの Operator の可観測性を、メトリクス、イベント、ロギング、トレーシング、status/conditions、そして SLO の観点から深く掘り下げます。controller-runtime のデフォルトメトリクスの意味から、カスタムメトリクスの追加、Prometheus/Grafana 連携、アラートルール、reconcile が動かないときのデバッグランブックまで、実践的なコードとともに整理しま
2026-06-15 · 30 分で読めます #kubernetes#operator#observability#prometheus#controller-runtimeオブザーバビリティ 2026 完全ガイド - OpenTelemetry・Datadog・Grafana スタック(LGTM+Beyla)・Honeycomb・Prometheus・Jaeger・eBPF・SLO 徹底解説
2026年5月時点のプロダクション・オブザーバビリティ・スタックを OpenTelemetry 標準の上で徹底的に俯瞰する。SaaS(Datadog・New Relic・Dynatrace・Splunk・Honeycomb・Coralogix・Logz.io・Chronosphere)、OSS(Grafana LGTM+Beyla・Prometheus+Mimir/Cortex/Thanos・Jaeger・Tempo・Zipkin・Py
2026-05-16 · 26 分で読めます #observability#opentelemetry#datadog#grafana#honeycombObservability 完全ガイド — Metric・Log・Trace・OpenTelemetry・eBPF・SLO (Season 2 Ep 9, 2025)
「観測できなければ運用できない」。Observability はログ収集やモニタリングの上位概念で、unknown unknowns をシステム状態だけから推論する能力である。本稿では Metric・Log・Trace の3軸、Profile を加えた4軸、OpenTelemetry 標準の真価、eBPF によるカーネルレベル観測、SLO・SLI・Error Budget の実戦設計、そして Grafana Stack vs Elast
2026-04-15 · 14 分で読めます #observability#opentelemetry#prometheus#grafana#lokiObservability 2025 完全ガイド: OpenTelemetry、Grafana・Datadog・Honeycomb・SigNoz、SLO・Error Budget、LLM可観測性 (2025)
Season 5 Ep 8。可観測性なくして運用なし、運用なくしてプロダクトなし。OpenTelemetryの3大シグナル(Metric・Log・Trace)の統合、Grafanaスタック(Prometheus・Loki・Tempo・Mimir)とDatadog・New Relic・Splunkの比較、SigNoz・Honeycomb・Axiomという新世代、SLO・SLI・Error Budgetの運用、LLM可観測性(LangFus
2026-04-15 · 14 分で読めます #observability#opentelemetry#grafana#datadog#honeycombSRE 実践ガイド 2025:インシデント管理、ポストモーテム、Error Budget、On-Call、Toil削減
SRE実践のすべて!インシデント管理(検出→対応→復旧→ポストモーテム)、Error Budget政策、On-Call運営(ローテーション/エスカレーション/疲労管理)、Toil削減自動化、SLO/SLI/SLA設定、Blamelessポストモーテム作成法、Google SRE文化。
2026-04-14 · 30 分で読めます #sre#site-reliability#incident-management#postmortem#error-budgetSLI/SLO/Error Budget基盤の信頼性エンジニアリング実践ガイド
SLI/SLO/Error Budgetを活用した信頼性エンジニアリングの理論と実践を解説します。SLI指標の選定、SLO数値の設定、Error Budgetポリシー、Burn Rateアラート、Prometheusベースの実装まで、プロダクションサービスの信頼性管理パイプライン全体をコードと共に構築します。
2026-03-13 · 19 分で読めます #observability#sli#slo#error-budget#srePrometheus PromQL高度なクエリとRecording Rulesの最適化:SLI / SLOベースの通知スキーム構築ガイド
Prometheus PromQLの高度なクエリパターンからRecording Rulesによるパフォーマンスの最適化、SLI / SLOベースの通知ルールの設計、Alertmanagerルーティング戦略、および大規模な環境運用のトラブルシューティングまでをカバーする包括的なガイド。
2026-03-07 · 41 分で読めます #observability#prometheus#promql#recording-rules#sliSLOとError Budget実行マニュアル
SLOとError Budget実行マニュアル - 2026年基準の実務適用ガイド
2026-03-04 · 20 分で読めます #observability#slo#2026-03