标签: #operator
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 4 篇
CloudNativePG 在 Kubernetes 上跑起 Postgres 再杀掉它 — 实测故障转移 23 秒
在真实的 8 节点 Kubernetes 集群上安装 CloudNativePG(CNPG) v1.30.0,启动一个 3 实例的 Postgres 集群,然后真的把主库杀掉。从引导启动、复制确认,到强制删除主库后的故障转移(23.1 秒内副本晋升、数据零丢失),再到死掉的节点作为副本自愈、恢复到 3/3 — 全过程连同实测日志一并记录。运行在 NFS 存储之上的家庭实验室环境里那些诚实的数字与陷阱,也原样收录。
2026-07-11 · 7 分钟阅读 #cloudnativepg#postgresql#kubernetes#operator#database用 Rust 编写 Kubernetes GPU Operator — 用 kube-rs 诊断真实集群
面对一个 8 节点的实际运行家庭实验室集群(k8s v1.32.5),我用 kube-rs 亲手用 Rust 写了一个 GPU Operator 并跑了起来。我定义了 GpuInventory 自定义资源,并把两个控制器(节点扫描→记录 CR 状态、节点监视→更新 ConfigMap)打包进一个二进制,从集群外部运行。然后是 Operator 真正吐出的结果 — 4 个 GPU 节点中 Ready 为 0 个,也就是整支 GPU 舰队都
2026-07-11 · 8 分钟阅读 #rust#kubernetes#operator#gpu#kube-rs用 Rust 编写 Kubernetes Operator(kube-rs)
Kubernetes Operator 是把运维知识写进代码的控制器。本文从原理讲起,梳理 Operator 模式(CRD + 控制器 + reconcile 循环),然后讲如何用 kube-rs 构建真正的 Operator:用 CustomResource 派生宏定义 CRD、Api 与 Controller、watcher、reconcile 函数与 requeue、用 finalizer 处理清理逻辑,以及为什么会选 Rust
2026-06-25 · 17 分钟阅读 #rust#kubernetes#operator#kube-rs在 K8s 上运维 DB — CNPG、Percona、Vitess、Helm chart 完全指南
总整理在 Kubernetes 环境中运维数据库的方法。对比 CloudNativePG、Percona Operator、Vitess 以及主流 Helm chart,并分享实战运维经验。
2026-04-11 · 20 分钟阅读 #database#kubernetes#cnpg#postgresql#mysql