标签: #kubeflow
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 5 篇
多 GPU、多节点训练平台全面梳理 — 从框架生态地图到 Slurm、Kubeflow 实战指南
把用多张 GPU、多台节点训练模型的整体地形,梳理在一页之内。AI 库与框架生态地图(PyTorch、JAX、HuggingFace、DeepSpeed、Ray)、何时该选哪种并行化策略(DDP、FSDP、ZeRO、TP、PP)、torchrun 从单节点到多节点的扩展、HPC 标准 Slurm 的实战指南(sbatch 脚本与多节点 torchrun 的联动)、Kubernetes 阵营 Kubeflow 的实战指南(Training
2026-07-09 · 12 分钟阅读 #ai#ml#distributed-training#slurm#kubeflowKubeflow Pipelines ML 工作流编排实战指南:从 KFP v2 SDK 到生产部署
以实战为中心讲解如何用 Kubeflow Pipelines 编排 ML 工作流。详细说明 KFP v2 SDK 架构、流水线组件编写、缓存策略、Argo Workflows/Airflow 对比,以及生产环境所需的故障应对策略。
2026-03-11 · 16 分钟阅读 #ai-platform#kubeflow#mlops#pipeline-orchestration#kubernetesKubeflow Pipelines v2 ML 工作流自动化与运维指南
从 KFP v2 架构,到用 KFP SDK 构建 ML 流水线、缓存、制品管理、CI/CD 集成,再到生产环境运维排障。
2026-03-06 · 19 分钟阅读 #ai-platform#kubeflow#ml-pipeline#mlops#2026-03Kubeflow Pipelines v2 实战指南 — 用 KFP SDK 构建 ML 流水线
一份使用 Kubeflow Pipelines v2 的 KFP SDK 构建 ML 流水线的实战指南。以代码为中心,涵盖组件定义、流水线编写、Artifact 管理直至 Kubernetes 部署。
2026-03-03 · 25 分钟阅读 #ai-platform#kubeflow#kfp#mlops#pipelineKubernetes AI 训练流水线:Volcano、Training Operator、Kueue 深度分析
基于 Volcano、Kubeflow Training Operator、Kueue 官方文档,分析如何在 Kubernetes 上构建分布式 AI 训练流水线。
2026-03-01 · 26 分钟阅读 #kubernetes#ai#distributed-training#volcano#kubeflow