标签: #mlops
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 30 篇
编码智能体的开销不是靠额度管住的,而是靠摩擦
Databricks 在 2026 年 7 月和 8 月接连发布的两篇工程文章表明,处理编码智能体开销的方式正在从预算额度转向网关加渐进式摩擦。本文拆解这套设计:为什么硬预算是最后的手段,为什么要把日常暴走防护与月度治理分开,为什么单次增量的大小就是设计的全部,以及为什么真正主导账单的不是模型单价而是上下文 —— 全部整理成可以计算的形式。
2026-08-09 · 12 分钟阅读 #mlops#llm#cost#ai-gateway#developer-productivity多 GPU 训练的四种并行方式 —— 拆分什么,通信什么
用数字梳理了数据并行、张量并行、流水线并行、上下文并行各自拆分什么,又为此付出什么通信代价。首先搭建 Adam 混合精度训练中每参数 16 字节的账本,再计算 ZeRO 1 到 3 阶段分别把账本中的哪一项按 GPU 数量切分。接着用激活内存公式说明检查点技术为何能把 100GB 变成 1GB,并把各种并行方式的通信量换算成每步字节数,说明 NVLink 内部与节点之间的带宽差距为何决定批次配置。最后给出按模型规模和 GPU 数量选择组
2026-08-02 · 19 分钟阅读 #mlops#distributed-training#multi-gpu#fsdp#deepspeed从公开的训练案例中学习 —— 试过什么,又是什么失败了
挑选了七份公开的大规模训练技术报告与日志本,只抽取失败与应对,而不是成绩单。从 Llama 3 405B 54 天内 419 次中断的统计里反推出检查点周期,比较 DeepSeek-V3 与 Kimi K2 分别在哪一层消灭了损失尖峰。也讨论了 Olmo 系列为什么把稳定性修复留在了架构里、OPT-175B 与 BLOOM 日志本留下的失败记录原型,以及 SmolLM3 与 Marin 公开的数据混合实验笔记。每个案例都附上出处链接,并
2026-08-02 · 20 分钟阅读 #mlops#llm-training#case-study#training-stability#scaling2026 年 LLM 训练技术栈地图 —— 每一层替你做了什么,又藏起了什么
把 LLM 训练框架分成三层来梳理谱系。最底层是 PyTorch 分布式、DeepSpeed、Megatron-Core 这类执行引擎;中间层是 torchtitan、Megatron-Bridge 这类训练循环;最上层是 TRL、Axolotl 这类靠一份配置文件就能跑起微调的工具。文中记录了每一层替你做了什么、又用这个换来了藏起什么,以及上层框架反而会碍事的那些地方。所有版本号与日期均于 2026 年 8 月 2 日直接在 PyPI
2026-08-02 · 19 分钟阅读 #mlops#llm-training#pytorch#trl#framework用 Slurm 跑 GPU 集群 —— 比提交更重要的是知道为什么不跑
整理了在 GPU 集群上实务使用 Slurm 所需的一切。先建立分区、QoS、账户这套坐标系,再讲在 sbatch 脚本里申请 GPU、CPU、内存的方法,以及其间的绑定陷阱。用两段真正能跑起来的脚本,给出通过 srun 和 rendezvous 启动多节点训练的两种模式,还讲了如何用数组作业和依赖链把参数扫描和续训交给调度器去管。后半部分全是失败案例:按代码解读 PENDING 原因的方法、区分主机内存 OOM 与 GPU OOM 的
2026-08-02 · 20 分钟阅读 #mlops#slurm#hpc#gpu-cluster#distributed-trainingLLM Ops 到底在做什么 —— 可复现性、数据污染、检查点、模型晋升与回滚
本文把 LLM Ops 整理成一份责任清单,而不是工具清单。内容包括:让训练运行可以被重建的运行清单里应该包含什么、如何防止并审计评测集的数据污染、从故障率反推检查点间隔的公式与保存成本的真实数字、把评测接入 CI 时应该以什么作为门槛。后半部分讨论训练与服务之间的交接实际会在哪些地方出问题、部署后的回归检测,以及回滚设计。工具只按类别介绍,不涉及厂商定价。
2026-08-02 · 20 分钟阅读 #mlops#llmops#reproducibility#evaluation#model-registry多 GPU、多节点训练平台全面梳理 — 从框架生态地图到 Slurm、Kubeflow 实战指南
把用多张 GPU、多台节点训练模型的整体地形,梳理在一页之内。AI 库与框架生态地图(PyTorch、JAX、HuggingFace、DeepSpeed、Ray)、何时该选哪种并行化策略(DDP、FSDP、ZeRO、TP、PP)、torchrun 从单节点到多节点的扩展、HPC 标准 Slurm 的实战指南(sbatch 脚本与多节点 torchrun 的联动)、Kubernetes 阵营 Kubeflow 的实战指南(Training
2026-07-09 · 12 分钟阅读 #ai#ml#distributed-training#slurm#kubeflowNVIDIA GPU Operator 完全指南 — 从安装部署到 MIG 分区配置
在 Kubernetes 里手动搭建 GPU 节点的时代已经结束。本文梳理了 NVIDIA GPU Operator 如何用 Operator 模式把驱动、设备插件、监控这一整套栈全部管起来的原理,以及 Helm 安装与验证方法;还有把一张 A100/H100 切分成多个硬件隔离 GPU 来用的 MIG——它的概念、single/mixed 两种策略、基于节点标签的配置、自定义 Profile、以及运维注意事项,配合实际命令从头到尾讲清
2026-07-07 · 12 分钟阅读 #kubernetes#gpu#nvidia#mig#devopsAI 模型开发,从头到尾 — 从数据到部署的现实生命周期
模型开发不是从预训练开始,而是从决策阶梯开始 — 靠提示词能不能解决,靠 RAG 能不能解决,是否需要微调。先做评估集再做模型的 eval-first 原则、数据质量与合成数据的陷阱、缩放定律与分布式训练、从 LoRA 到 DPO 的微调光谱、量化与连续批处理的服务,以及部署后的数据飞轮 — 本文按实务顺序梳理 AI 模型开发的完整生命周期。
2026-07-07 · 14 分钟阅读 #ai#ml#llm#mlops#trainingLLMOps 完全指南:模型 · 提示词 · 评测集三轴版本管理、Canary、成本控制、平台团队 (2025)
把 LLM 产品做出来的方法已经变简单了,难的是让它可持续地跑下去。模型 · 提示词 · 评测集的三轴版本管理,Shadow/Canary/Blue-Green 发布,用 token、缓存与模型路由做成本控制,组织结构(AI 平台/Model 平台/Product AI),失败案例,直到 KPI 与 on-call。它是 MLOps 的延长线,同时正面处理 LLM 特有的课题。
2026-04-15 · 15 分钟阅读 #llmops#mlops#devops#canary#cost-controlDevOps/SRE 完全精通:从 CI/CD 到 Kubernetes、MLOps
从 DevOps 与 SRE 的核心概念,到 Kubernetes 实战运维、AI/ML 工作流自动化,结合实战代码为你完全精通。
2026-03-17 · 17 分钟阅读 #devops#sre#kubernetes#ci-cd#mlopsAI 时代生存指南 第 5 篇:数据科学家的未来 — 危机,还是机会?
AutoML 与 LLM 正在自动化传统数据科学工作的时代,本文为数据科学家梳理生存策略与发展方向,提供一份从单纯的数据分析成长为 AI 产品构建者的路线图。
2026-03-17 · 20 分钟阅读 #career#data-scientist#ai-era#career-transition#mlopsMLOps 与模型生命周期管理:MLflow、DVC 与 LLMOps 完全指南
从 MLOps 成熟度模型到 MLflow 实验追踪、DVC 数据版本管理、特征存储,再到 LLMOps,一份实战导向的 ML 流水线完全指南。
2026-03-17 · 23 分钟阅读 #mlops#mlflow#dvc#llmops#피처스토어AI 系统设计完全指南:从 LLM 服务到 MLOps 架构
将 AI 系统设计到生产级水准的完全指南。通过实战架构学习实时推理系统、向量检索基础设施、LLM 服务架构、数据管道、监控系统设计。
2026-03-17 · 34 分钟阅读 #system-design#ai-infrastructure#llm#mlops#architectureLLMOps 平台构建指南:模型部署、监控与 A/B 测试实战架构
本文讲解 LLMOps 平台的设计与实现。涵盖基于 vLLM/TGI 的模型服务、token 使用量/延迟/质量监控、提示词版本管理、A/B 测试框架、护栏(Guardrails)集成,用代码构建生产环境 LLM 运维的完整生命周期。
2026-03-13 · 20 分钟阅读 #ai-platform#llmops#model-serving#monitoring#ab-testingFeature Store 设计与运维指南:基于 Feast 构建 Online/Offline Store 与 ML 特征流水线自动化
从 Feature Store 的核心概念(Online/Offline Serving、Feature Freshness、Point-in-Time Correctness)出发,涵盖 Feast 架构、Feature 定义与 Entity 设计、Materialization 流水线、Online Store 后端(Redis、DynamoDB)、Offline Store(BigQuery、Redshift)、Training-
2026-03-12 · 16 分钟阅读 #ai-platform#feature-store#feast#mlops#online-storeKServe 模型服务完全指南:InferenceService、Canary 部署、Transformer、InferenceGraph 生产运维
本文讲解基于 Kubernetes、使用 KServe 进行模型服务的实践。涵盖用 InferenceService CRD 部署模型、用 Canary 策略实现安全上线、用 Transformer 搭建前后处理流水线、用 InferenceGraph 构建基于 DAG 的复合推理,并配合代码给出生产运维策略的落地实现。
2026-03-12 · 22 分钟阅读 #ai-platform#kserve#model-serving#kubernetes#inference-graphKubeflow Pipelines ML 工作流编排实战指南:从 KFP v2 SDK 到生产部署
以实战为中心讲解如何用 Kubeflow Pipelines 编排 ML 工作流。详细说明 KFP v2 SDK 架构、流水线组件编写、缓存策略、Argo Workflows/Airflow 对比,以及生产环境所需的故障应对策略。
2026-03-11 · 16 分钟阅读 #ai-platform#kubeflow#mlops#pipeline-orchestration#kubernetesMLflow 实验管理完全指南:实验追踪·模型注册表·部署流水线搭建
本文以实战为中心,讲解如何用 MLflow 做 ML 实验追踪、模型注册表管理与部署流水线搭建。从 Tracking Server 架构、自动日志记录、模型版本管理,到 Kubernetes/Docker 部署,详细说明生产环境中所需的 MLOps 策略。
2026-03-11 · 16 分钟阅读 #ai-platform#mlflow#experiment-tracking#model-registry#mlopsFeature Store 构建完全指南:Feast 架构、在线/离线服务与 ML 流水线集成
深入探讨 ML 系统的核心基础设施 Feature Store。涵盖 Feast 框架的架构与实现、在线/离线特征服务、特征工程流水线集成、与 Tecton 的对比分析,以及生产环境运维经验。
2026-03-10 · 17 分钟阅读 #ai-platform#feature-store#feast#mlops#ml-pipeline