タグ: #incident
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 4 件
ミスをしたあとの順序 — 収拾、報告、記録、再発防止
ミスのコストはミス自体ではなくそのあとの四つの段階で決まり、人はこの順序をほとんどいつも同じやり方でひっくり返します。収拾の段階で止血ではなく原因から探すこと、報告を収拾が終わったあとに先延ばしにすること、記録をまるごと飛ばすこと、再発防止を個人の決意で代替すること。各段階がなぜその位置にあるのかと、よくひっくり返る地点を押さえ、謝罪と弁明が分かれる地点が原因説明の有無ではなく二つの段落を分けたかどうかにあることを説明します。二度としま
2026-08-16 · 25 分で読めます #career#workplace#mistakes#incident#accountability韓国の開発ブログ名文キュレーション 2 — 障害振り返りとトラブルシューティング、直接開いて確認した12本
韓国の開発者がもっとも得意とするジャンルは障害の振り返りです。p6spyがDBルーティングを無力化した事件、HTTPタイムアウトがDNS解決を覆えなかった理由、TCPハーフクローズが重複例外に偽装された事例、MetalLBの設定ひとつが生んだクラスタの遅延スパイク、ヒープダンプでOOMを追跡した記録、JITウォームアップでデプロイ直後のCPUスパイクを抑えた過程、外部キーが招いたデッドロック、HikariCPのコネクション枯渇、MySQ
2026-08-12 · 22 分で読めます #curation#큐레이션#troubleshooting#postmortem#incidentインシデントコミュニケーション:障害時の対話術
障害が起きたとき、技術的な復旧は仕事の半分にすぎません。インシデントコマンダーの役割と役割分担、新しい情報がなくても守る状態更新のリズム、すべての更新が答えるべき三つの問い、非難なきポストモーテムと5 Whys、顧客向けと社内向けコミュニケーションの違い、そして部屋の空気を落ち着かせる冷静さまで、障害時の対話術を整理します。
2026-06-24 · 25 分で読めます #incident#oncall#communication#sreマイグレーション事故事例とチェックリスト — 他人の失敗から学ぶ
マイグレーションは最も多く、最も痛い障害の源です。ロック嵐、レプリケーション遅延、データ損失、ロールバック不能といった典型的な事故タイプを押さえ、3件の仮想ポストモーテムで症状から原因と教訓を導き、予防パターンと総合チェックリストで整理します。
2026-06-16 · 23 分で読めます #database#migration#postmortem#incident#reliability