标签: #sre
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 5 篇
Kubernetes CrashLoopBackOff 分原因诊断与解决 — 日志为空时该看什么
完整梳理 Pod 陷入 CrashLoopBackOff 而 kubectl logs 什么都不输出的场景。先讲清 BackOff 的准确含义 — 它不是原因,而是从 10 秒一路涨到 5 分钟的重启等待时间,再讲阅读 describe 中 Last State 与 Exit Code 的顺序,以及退出码 0、1、127、137、139、143 各自代表什么。文章按原因给出诊断命令与解决方案:应用启动即退出、配置与 Secret 缺失、
2026-07-26 · 17 分钟阅读 #kubernetes#crashloopbackoff#troubleshooting#kubectl#sre正确使用 Kubernetes 三种探针 — liveness、readiness、startup 的准确边界
毫无问题的 Pod 周期性重启、刚发布完就冒出大量 502、启动缓慢的应用永远到不了 Ready,这三类故障全都出自探针设计。文章先区分三种探针各自回答什么问题、失败时又会做什么,然后计算从 initialDelaySeconds 到 failureThreshold 这些参数实际会在几秒之后杀掉容器。接着讨论把数据库检查放进 liveness 为什么会让单点故障扩散成全面故障、readiness 里到底可以放到什么程度、exec 探针
2026-07-26 · 21 分钟阅读 #kubernetes#liveness-probe#readiness-probe#graceful-shutdown#sre事故沟通:故障当下的对话方法
故障爆发时,技术性的恢复只完成了一半的工作。本文梳理事故指挥官(Incident Commander)角色与职责分离、即便没有新消息也要坚持的状态更新节奏、每次更新都必须回答的三个问题、不追责的事后分析(postmortem)与 5 Whys、面向客户与面向内部的沟通差异,以及能让整个房间稳定下来的镇定 — 一份关于故障当下对话方法的整理。
2026-06-24 · 20 分钟阅读 #incident#oncall#communication#sre著名事后复盘解剖 — 从 Cloudflare·Fastly·AWS·Knight Capital·GitLab 的失败中学习
Cloudflare 2022 BGP、Fastly 2021 让半个互联网下线、AWS S3 2017 的一个笔误、Knight Capital 8 分钟 $440M、GitLab 的 DB wipe 等 — 从著名失败中提炼出的模式与教训。
2026-04-15 · 16 分钟阅读 #postmortem#sre#outage#reliability#cultureDevOps/SRE 完全精通:从 CI/CD 到 Kubernetes、MLOps
从 DevOps 与 SRE 的核心概念,到 Kubernetes 实战运维、AI/ML 工作流自动化,结合实战代码为你完全精通。
2026-03-17 · 17 分钟阅读 #devops#sre#kubernetes#ci-cd#mlops