标签: #hands-on
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 7 篇
LabHub — 我做了一个在浏览器里操作真实服务器来学习的实操平台
有些东西光靠读是学不会的。连上服务器敲命令、敲错、再弄清楚为什么错了 — 这个过程没有任何替代办法。LabHub 就是把这个过程搬进浏览器里的学习平台。点下开始实验,专属的 Linux 容器立刻启动,用浏览器终端连上去解题,每一步由服务器检查实际状态并告诉你是否通过。里面有学习路径 12 条、课程 73 门、实验 261 个共 2058 步、测验 1876 题、理论 319 篇。从 IT 基础和 Linux 起步,一路延伸到容器、Kub
2026-08-20 · 10 分钟阅读 #labhub#kubernetes#devops#education#hands-on人人可懂的 AI 第1篇 — 用15分钟从零训练一个1600万参数的语言模型
用一张 GPU 从零训练语言模型。借助 TinyStories 数据集和1600万参数的仅解码器 Transformer,15分钟就生成出可读的英文童话。我们用真实的训练日志和未经修改的生成结果,来看因果掩码为何必要、权重共享节省了什么、以及 perplexity 8 究竟对应怎样的句子。基于 RTX 3090 实测。
2026-08-19 · 12 分钟阅读 #ai#llm#transformer#pytorch#hands-onRTX 5090 单卡亲手跑几个小模型 — microGPT·OCR·音乐生成
用一张 RTX 5090(Blackwell,32GB),通过 SSH 连上去直接跑了三个小模型。从零开始用 28 秒训练出一个 char-level GPT(10.75M 参数,117 万 tokens/s),把专用 OCR(TrOCR)和小型 VLM(Qwen2-VL-2B)放到同一张图上用 CER 一决高下,再用 MusicGen 在 1.9 秒(实时的 4.2 倍)里生成一段 8 秒的音乐。连同过程中遇到的那些诚实的陷阱 — 没
2026-07-11 · 10 分钟阅读 #pytorch#gpu#llm#ocr#hands-onRust 1.97.0 发布了 — 我正好在用那个 cargo 构建 Kubernetes Operator
Rust 1.97.0 于 2026 年 7 月 9 日作为 stable 发布。本文梳理发布说明里真正变了的三件事 — v0 符号修饰(symbol mangling)晋升为 stable、Cargo 的警告拒绝(deny warnings)、以及此前一直被隐藏的链接器输出默认显示 — 并与几天前我正好用那个 cargo 1.97 构建 Kubernetes GPU Operator 的实测经验相互对照。一个诚实的结论:写 Opera
2026-07-11 · 7 分钟阅读 #rust#rust-1.97#release-notes#cargo#kube-rsKubeVirt GPU 直通 VM 为何 112 天无法被调度 — 一次真实集群的尸检
一个用 Rust 写的 Operator 下达了"4 个 GPU 节点全部 NotReady"的诊断后,我在真实的 8 节点集群(GPU Operator v25.3.0、KubeVirt v1.7.0)里把这场死亡的病因追查到底。gpu-fedora 与 rhel9-gpu-vm 卡在 ErrorUnschedulable 长达 112 天,真正的原因不是花哨的 GPU 配置,而是 kubelet 的一行错误——"running wi
2026-07-11 · 7 分钟阅读 #kubevirt#gpu#kubernetes#nvidia#devopsCloudNativePG 在 Kubernetes 上跑起 Postgres 再杀掉它 — 实测故障转移 23 秒
在真实的 8 节点 Kubernetes 集群上安装 CloudNativePG(CNPG) v1.30.0,启动一个 3 实例的 Postgres 集群,然后真的把主库杀掉。从引导启动、复制确认,到强制删除主库后的故障转移(23.1 秒内副本晋升、数据零丢失),再到死掉的节点作为副本自愈、恢复到 3/3 — 全过程连同实测日志一并记录。运行在 NFS 存储之上的家庭实验室环境里那些诚实的数字与陷阱,也原样收录。
2026-07-11 · 7 分钟阅读 #cloudnativepg#postgresql#kubernetes#operator#database用 Rust 编写 Kubernetes GPU Operator — 用 kube-rs 诊断真实集群
面对一个 8 节点的实际运行家庭实验室集群(k8s v1.32.5),我用 kube-rs 亲手用 Rust 写了一个 GPU Operator 并跑了起来。我定义了 GpuInventory 自定义资源,并把两个控制器(节点扫描→记录 CR 状态、节点监视→更新 ConfigMap)打包进一个二进制,从集群外部运行。然后是 Operator 真正吐出的结果 — 4 个 GPU 节点中 Ready 为 0 个,也就是整支 GPU 舰队都
2026-07-11 · 8 分钟阅读 #rust#kubernetes#operator#gpu#kube-rs