タグ: #sre
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 22 件
本番の感覚 — 障害を経験した人が違って見ているもの
同じ設計文書を読んでも、障害を経験した人は別のものを読みます。これが未明に壊れたらどんなログが残るか、戻すのに何分かかるか、戻したあとすでに入ったデータはどうなるか。この記事は、本番がなぜコードではなく状態なのか、100パーセントがなぜ正しい信頼性目標ではないのか、可観測性とロールバックと段階的リリースがなぜ道具の導入ではなく既定値の問題なのか、そして大きな障害を自分で経験せずにその感覚を得る三つの方法を扱います。デプロイ前に埋めておく
2026-08-15 · 13 分で読めます #career#skills#sre#production#reliabilityエラー処理完全ガイド: 失敗を契約として設計する
エラー処理を例外の文法ではなくインターフェース契約の一部として扱います。エラーを分類する二つの軸、例外と戻り値の論争の実際の軸、境界ごとにエラーを翻訳する規則、RFC 9457 に基づく HTTP エラー契約、冪等性なしの再試行の危険、タイムアウト予算、観測、そして利用者に何を伝えるかまでを整理します。
2026-08-15 · 41 分で読めます #에러처리#재시도#rfc9457#타임아웃#관측가능성Kubernetes CrashLoopBackOff の原因別診断と解決 — ログが空のとき何を見ればよいか
Pod が CrashLoopBackOff に陥っているのに kubectl logs が何も返さない状況を、最初から最後まで扱います。BackOff は原因ではなく 10 秒から 5 分まで伸びる再起動待ち時間だという正確な意味から、describe の Last State と Exit Code を読む順序、終了コード 0/1/127/137/139/143 がそれぞれ何を意味するかまで整理しました。アプリケーションの即時終了、
2026-07-26 · 20 分で読めます #kubernetes#crashloopbackoff#troubleshooting#kubectl#sreKubernetes プローブ3種を正しく使う — liveness, readiness, startup の正確な境界
何の問題もない Pod が定期的に再起動したり、デプロイ直後だけ 502 が大量に出たり、起動の遅いアプリケーションが永遠に Ready に到達できなかったりする3つの事故は、すべてプローブの設計から生まれます。3つのプローブがそれぞれどの質問に答え、失敗したときに何をするのかを区別したうえで、initialDelaySeconds から failureThreshold までのパラメータが実際に何秒後にコンテナを殺すのかを計算します。
2026-07-26 · 26 分で読めます #kubernetes#liveness-probe#readiness-probe#graceful-shutdown#sreインシデントコミュニケーション:障害時の対話術
障害が起きたとき、技術的な復旧は仕事の半分にすぎません。インシデントコマンダーの役割と役割分担、新しい情報がなくても守る状態更新のリズム、すべての更新が答えるべき三つの問い、非難なきポストモーテムと5 Whys、顧客向けと社内向けコミュニケーションの違い、そして部屋の空気を落ち着かせる冷静さまで、障害時の対話術を整理します。
2026-06-24 · 25 分で読めます #incident#oncall#communication#sreOperatorのベストプラクティスとアンチパターン
良いOperatorの特徴とよくあるアンチパターンをコードレベルで整理します。小さなAPIと冪等なreconcile、観測可能性、安全なアップグレードといった原則から、副作用の乱発・statusの誤用・無限requeue・広範なRBACといった落とし穴、マルチテナンシーとセキュリティ、リソース効率、テスト文化、SRE観点の運用、成熟度ロードマップとチェックリストまで扱います。
2026-06-15 · 23 分で読めます #kubernetes#operator#best-practices#reconcile#rbacBackstage運用実践 — TechDocs、プラグイン開発、本番チェックリスト
Backstage IDPシリーズ第3回です。TechDocsによるdocs-as-codeパイプラインとS3パブリッシング、フロントエンド/バックエンドのプラグインアーキテクチャとカスタムプラグイン開発、permission framework、アップグレード戦略、性能・観測・セキュリティまで、本番運用の全領域を扱います。
2026-06-13 · 20 分で読めます #backstage#techdocs#plugins#platform-engineering#devopsロード/パフォーマンステストツール 2026 — k6・Locust・Vegeta・Gatling・Artillery・JMeter 徹底比較(JMeter の先の風景)
パフォーマンステストは2026年もなお難しい。しかしツールは確実に良くなった。JS で書く k6、Python で書く Locust、ワンライナーで終わる Vegeta、エンタープライズの Gatling、YAML で速い Artillery、マイクロベンチの wrk/wrk2 と autocannon、そして今も生きている JMeter。gRPC・WebSocket・ブラウザモードまで届く k6 の拡張、ghz や fortio とい
2026-05-14 · 27 分で読めます #load-testing#performance-testing#k6#locust#vegeta有名ポストモーテム解剖 — Cloudflare・Fastly・AWS・Knight Capital・GitLab の失敗から学ぶ
Cloudflare 2022 BGP、Fastly 2021 のインターネット半分ダウン、AWS S3 2017 のタイプミス、Knight Capital 8 分で $440M、GitLab の DB wipe など — 有名な失敗から抽出したパターンと教訓。
2026-04-15 · 16 分で読めます #postmortem#sre#outage#reliability#cultureChaos Engineering 完全解剖 — Netflix Simian Army、LitmusChaos/Chaos Mesh、AWS FIS、Game Day
2010年、なぜ Netflix は本番サーバーをランダムに殺し始めたのか。Chaos Monkey の哲学と 4 原則、Simian Army 全体構成、LitmusChaos/Chaos Mesh/AWS FIS の比較、Game Day の設計、Blameless Postmortem までを解説。
2026-04-15 · 13 分で読めます #chaos-engineering#sre#reliability#netflix#kubernetesSRE 実践ガイド 2025:インシデント管理、ポストモーテム、Error Budget、On-Call、Toil削減
SRE実践のすべて!インシデント管理(検出→対応→復旧→ポストモーテム)、Error Budget政策、On-Call運営(ローテーション/エスカレーション/疲労管理)、Toil削減自動化、SLO/SLI/SLA設定、Blamelessポストモーテム作成法、Google SRE文化。
2026-04-14 · 30 分で読めます #sre#site-reliability#incident-management#postmortem#error-budgetChaos Engineering 完全ガイド 2025:レジリエンステスト、Chaos Monkey、Litmus、ゲームデイ
Chaos Engineeringのすべて!カオス原則(仮説→実験→観察→改善)、Chaos Monkey/Litmus Chaos/Chaos Mesh、障害注入(ネットワーク/CPU/メモリ/Pod/AZ)、ゲームデイ運営、段階的導入戦略、Netflix/Amazon事例、SREとの関係。
2026-04-14 · 25 分で読めます #chaos-engineering#resilience#chaos-monkey#litmus#fault-injectionIT障害防止 & ラボ環境構築法 + グローバル卓球ニュース分析
ITシステム障害を防止する核心要素、効果的な実習環境の構築法、そしてグローバル卓球大会と注目選手を分析します。
2026-04-11 · 22 分で読めます #culture#devops#reliability#sre#table-tennisオブザーバビリティ(Observability)完全ガイド2025:Prometheus、Grafana、OpenTelemetryでシステムを透明に
オブザーバビリティの3つの柱(メトリクス/ログ/トレース)を完全制覇!Prometheusクエリ(PromQL)、Grafanaダッシュボード、OpenTelemetry計装、Jaeger分散トレーシング、ELK/Lokiロギング、アラート戦略、SLI/SLO/SLA、オンコール文化まで。
2026-03-23 · 30 分で読めます #observability#monitoring#prometheus#grafana#opentelemetryDevOps/SRE 完全攻略:CI/CDからKubernetes、MLOpsまで
DevOpsとSREの基礎概念からKubernetes運用、AI/MLワークフロー自動化まで、実践的なコードとともに完全解説します。
2026-03-17 · 17 分で読めます #devops#sre#kubernetes#ci-cd#mlopsブレームレスポストモーテムとインシデントレビュー文化
ブレームレスポストモーテムとインシデントレビュー文化を構築するガイド。ファシリテーション技術、アクションアイテム追跡、組織学習を解説します。
2026-03-15 · 48 分で読めます #culture#postmortem#incident-review#blameless#learning-organizationSLI/SLO/Error Budget基盤の信頼性エンジニアリング実践ガイド
SLI/SLO/Error Budgetを活用した信頼性エンジニアリングの理論と実践を解説します。SLI指標の選定、SLO数値の設定、Error Budgetポリシー、Burn Rateアラート、Prometheusベースの実装まで、プロダクションサービスの信頼性管理パイプライン全体をコードと共に構築します。
2026-03-13 · 19 分で読めます #observability#sli#slo#error-budget#sre英語インシデント管理コミュニケーション完全ガイド:障害対応からポストモーテムまで
エンジニアのための英語インシデント管理コミュニケーションガイド。障害宣言、リアルタイム状況共有、エスカレーション、顧客通知、ポストモーテム作成まで、実践的な表現とテンプレートを体系的に整理します。
2026-03-13 · 19 分で読めます #english#incident-management#communication#postmortem#sreネットワークトラブルシューティング完全ガイド — 全6回シリーズ概要
実務で遭遇するネットワーク障害を体系的に診断・解決する全6回シリーズのインデックスポストです。DNS解決からクラウドネットワークアーキテクチャまで全レイヤーをカバーします。
2026-03-08 · 13 分で読めます #networking#troubleshooting#devops#sre英語インシデントコミュニケーション完全ガイド:障害報告からポストモーテム作成まで
ITエンジニアのための英語インシデントコミュニケーションガイド。障害発生時の初期報告、エスカレーション、ステータスページ更新、ポストモーテム作成まで実践で使える英語表現とテンプレート。
2026-03-08 · 40 分で読めます #english#incident-communication#postmortem#sre#technical-writing