标签: #nvidia
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 11 篇
三行配置文件让 4 张 GPU 死了一周 — containerd drop-in 合并的真相
节点不再广告 GPU。配置文件里 nvidia 运行时明明写得好好的,containerd config dump 里却没有。真凶是一周前加进去的三行 registry 配置,原因在于 containerd 的 imports 合并不是按字段合并,而是按插件整块替换。我把两次误诊的过程,以及最后给出答案的那个实验,原样记在这里。
2026-08-26 · 16 分钟阅读 #kubernetes#containerd#gpu#nvidia#troubleshootingAMD 与 NVIDIA 有何不同 — 问题不在硬件,而在软件栈
把 AMD GPU 与 NVIDIA GPU 的差异,按硬件结构、软件栈、移植路径、生态成熟度这四个层面拆开,不带感情地梳理一遍。从 SM 与 CU、Tensor Core 与 Matrix Core 的对应关系讲起,具体说明 warp 32 与 wavefront 64 到底会在代码里制造出什么样的 bug。区分 HIPIFY 能自动搬过去的部分和必须手动修改的部分,并解释在 cuBLAS 与 rocBLAS 这类库对应表中,为什么
2026-08-02 · 22 分钟阅读 #amd#rocm#hip#nvidia#cudaRust 1.97 砍掉了 Volta 之前的 GPU — nvptx64 基线上调的内幕
Rust 1.97(2026 年 7 月 9 日)把 nvptx64-nvidia-cuda 目标的最低要求提升到了 PTX ISA 7.0(需要 CUDA 11 及以上驱动)和 SM 7.0(Volta 及以上)。Maxwell、Pascal 两代 GPU 以及 CUDA 10 及更早的驱动,如今都不再是支持目标。本文梳理了实际改变的数字、编译器团队引用的三个具体缺陷(调试符号、原子操作顺序、target-feature 机制)、谁会
2026-07-16 · 18 分钟阅读 #rust#cuda#gpu#compiler#nvidiaKubeVirt GPU 直通 VM 为何 112 天无法被调度 — 一次真实集群的尸检
一个用 Rust 写的 Operator 下达了"4 个 GPU 节点全部 NotReady"的诊断后,我在真实的 8 节点集群(GPU Operator v25.3.0、KubeVirt v1.7.0)里把这场死亡的病因追查到底。gpu-fedora 与 rhel9-gpu-vm 卡在 ErrorUnschedulable 长达 112 天,真正的原因不是花哨的 GPU 配置,而是 kubelet 的一行错误——"running wi
2026-07-11 · 7 分钟阅读 #kubevirt#gpu#kubernetes#nvidia#devopsGPU Operator × KubeVirt 完全整理 — 组件、配置、版本,从部分 MIG 到手动 MIG
把 Kubernetes GPU 基础设施的两大支柱整理在一页里。涵盖 GPU Operator 的 operand 构成、ClusterPolicy 配置与版本体系,同时讲解只对节点上部分 GPU 应用 MIG 的自定义配置,以及用 nvidia-smi 手动创建、删除 MIG 的方法。接着介绍在 Kubernetes 上运行虚拟机的 KubeVirt 的四大组件(virt-operator、controller、handler、la
2026-07-09 · 12 分钟阅读 #kubernetes#gpu#kubevirt#mig#nvidiaNVIDIA GPU Operator 完全指南 — 从安装部署到 MIG 分区配置
在 Kubernetes 里手动搭建 GPU 节点的时代已经结束。本文梳理了 NVIDIA GPU Operator 如何用 Operator 模式把驱动、设备插件、监控这一整套栈全部管起来的原理,以及 Helm 安装与验证方法;还有把一张 A100/H100 切分成多个硬件隔离 GPU 来用的 MIG——它的概念、single/mixed 两种策略、基于节点标签的配置、自定义 Profile、以及运维注意事项,配合实际命令从头到尾讲清
2026-07-07 · 12 分钟阅读 #kubernetes#gpu#nvidia#mig#devops2026 年 6 月 AI 行情的过山车 — 半导体暴跌与反弹分析
梳理 2026 年 6 月初半导体个股的暴跌与快速反弹。均衡地考察波动的成因、多头与空头的视角,以及应对波动的原则。本文仅供信息参考,不构成投资建议。
2026-06-18 · 10 分钟阅读 #finance#ai-rally#semiconductor#volatility#nvidia英伟达5万亿美元 — AI基础设施周期走到哪一步了
英伟达市值史上首次突破5万亿美元。本文用数据梳理AI基础设施资本支出周期目前所处的位置,并均衡呈现看多与看空的观点、供应链瓶颈与风险。
2026-06-18 · 14 分钟阅读 #finance#nvidia#ai-infrastructure#capex#semiconductors2026年6月 AI 涨势过山车 — 半导体暴跌与反弹分析
本文用数据梳理了 2026 年 6 月初半导体股暴跌又迅速反弹的过程。从估值、业绩、利率三个角度分析波动的原因,并均衡呈现看多与看空两种视角,以及应对波动的原则。
2026-06-18 · 16 分钟阅读 #finance#ai-rally#semiconductors#volatility#nvidiaNVIDIA Triton Inference Server 生产指南:GPU 模型服务优化策略
基于 NVIDIA Triton Inference Server 的 GPU 模型服务优化指南。涵盖 Dynamic Batching、Model Ensemble、TensorRT 集成、多模型服务、Kubernetes 部署、性能画像分析与生产环境故障排查。
2026-03-08 · 38 分钟阅读 #ai-platform#triton#inference-server#gpu#model-servingNeMo Guardrails 完全指南:为 LLM 应用构建可编程安全防护
通过实践演示如何使用 NVIDIA NeMo Guardrails,为基于 LLM 的应用构建输入输出审核、话题控制、幻觉检测等可编程安全防护。
2026-03-03 · 31 分钟阅读 #ai-papers#nemo-guardrails#llm-safety#nvidia#guardrails