标签: #distributed-training
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 14 篇
多 GPU 训练的四种并行方式 —— 拆分什么,通信什么
用数字梳理了数据并行、张量并行、流水线并行、上下文并行各自拆分什么,又为此付出什么通信代价。首先搭建 Adam 混合精度训练中每参数 16 字节的账本,再计算 ZeRO 1 到 3 阶段分别把账本中的哪一项按 GPU 数量切分。接着用激活内存公式说明检查点技术为何能把 100GB 变成 1GB,并把各种并行方式的通信量换算成每步字节数,说明 NVLink 内部与节点之间的带宽差距为何决定批次配置。最后给出按模型规模和 GPU 数量选择组
2026-08-02 · 19 分钟阅读 #mlops#distributed-training#multi-gpu#fsdp#deepspeed用 Slurm 跑 GPU 集群 —— 比提交更重要的是知道为什么不跑
整理了在 GPU 集群上实务使用 Slurm 所需的一切。先建立分区、QoS、账户这套坐标系,再讲在 sbatch 脚本里申请 GPU、CPU、内存的方法,以及其间的绑定陷阱。用两段真正能跑起来的脚本,给出通过 srun 和 rendezvous 启动多节点训练的两种模式,还讲了如何用数组作业和依赖链把参数扫描和续训交给调度器去管。后半部分全是失败案例:按代码解读 PENDING 原因的方法、区分主机内存 OOM 与 GPU OOM 的
2026-08-02 · 20 分钟阅读 #mlops#slurm#hpc#gpu-cluster#distributed-trainingPyTorch 2.13 的 torchcomms — 冲着替换 c10d 而来的新分布式通信后端
在 2026 年 7 月 8 日发布的 PyTorch 2.13 的众多亮点里,最具结构性的变化是 torchcomms — PyTorch Distributed 的新通信后端开始被整合进内核的 CI 与 DeviceMesh 路径。torchcomms 是 Meta 于 2025 年 10 月发布的实验性通信 API,官方路线图是清掉基于全局状态的 c10d ProcessGroup 的技术债(以 NCCL 为中心的设计、lazy
2026-07-17 · 15 分钟阅读 #pytorch#distributed-training#nccl#deep-learningKubernetes v1.36 的 Workload/PodGroup API — Gang Scheduling 正走进 kube-scheduler
AI 训练与批处理工作负载的 gang scheduling,迄今为止一直是 Volcano、Kueue 这类外部调度器的活儿,但 Kubernetes 已经开始把这项能力搬进核心。v1.35 以 alpha 形式发布了 Workload API 和第一版 gang scheduling 实现,而 2026 年 4 月 22 日发布的 v1.36 则对结构做了大改 — 把 Workload 拆分成静态模板,把新的 PodGroup 拆分
2026-07-16 · 29 分钟阅读 #kubernetes#scheduling#gang-scheduling#distributed-training#dra多 GPU、多节点训练平台全面梳理 — 从框架生态地图到 Slurm、Kubeflow 实战指南
把用多张 GPU、多台节点训练模型的整体地形,梳理在一页之内。AI 库与框架生态地图(PyTorch、JAX、HuggingFace、DeepSpeed、Ray)、何时该选哪种并行化策略(DDP、FSDP、ZeRO、TP、PP)、torchrun 从单节点到多节点的扩展、HPC 标准 Slurm 的实战指南(sbatch 脚本与多节点 torchrun 的联动)、Kubernetes 阵营 Kubeflow 的实战指南(Training
2026-07-09 · 12 分钟阅读 #ai#ml#distributed-training#slurm#kubeflowTorch-Titan 完全指南:PyTorch 大规模分布式训练全解析
一份掌握 PyTorch Titan(torchtitan)大规模 LLM 分布式训练的完全指南。涵盖 FSDP2、流水线并行、张量并行、4D 并行、Flash Attention 与混合精度,并配有实战示例。
2026-03-17 · 27 分钟阅读 #torch-titan#distributed-training#pytorch#fsdp#deep-learningPyTorch 内部结构与高级优化:从 autograd、torch.compile、FSDP 到 Triton
一份 PyTorch 完全攻略指南,涵盖 PyTorch autograd 引擎、torch.compile() 与 TorchInductor 优化、FSDP 分布式训练、gradient checkpointing,以及自定义 CUDA 算子。
2026-03-17 · 13 分钟阅读 #pytorch#torch-compile#fsdp#triton#혼합정밀도大规模模型训练完全指南:100B+ 参数 LLM 预训练策略
训练数百亿参数 LLM 的策略与技巧完全指南。从缩放定律(Chinchilla)、Megatron-LM、3D 并行化、检查点策略、训练稳定性到数据混合策略,全部结合实战讲解。
2026-03-17 · 27 分钟阅读 #large-scale-training#llm#megatron-lm#distributed-training#scaling-laws联邦学习(Federated Learning)完全指南:隐私保护分布式AI
全面掌握联邦学习(Federated Learning)的指南。学习如何在保护数据隐私的同时进行分布式训练,涵盖 FedAvg、FedProx、差分隐私,以及 Flower 框架的实战代码。
2026-03-17 · 34 分钟阅读 #federated-learning#privacy#distributed-training#differential-privacy#aiDeepSpeed 完全指南:ZeRO 优化与大规模模型训练
全面掌握 Microsoft DeepSpeed 的实战指南。涵盖 ZeRO-1/2/3 优化、Offload、流水线并行、混合精度、MoE、DeepSpeed Inference,配有实战配置和代码示例。
2026-03-17 · 21 分钟阅读 #deepspeed#zero-optimization#distributed-training#llm#pytorch分布式系统完全指南: 从 CAP theorem 到分布式 ML 训练、Kafka
从 CAP theorem、Raft 共识算法、Kafka 消息队列,到 Ring-AllReduce 分布式 ML 训练与 NCCL,一份写给 AI 工程师的分布式系统完全指南。
2026-03-17 · 21 分钟阅读 #distributed-systems#kafka#raft#pytorchdistributed#nccl深度学习训练方法完全指南:从优化到分布式训练
一份系统讲解深度学习模型高效训练全部技巧的完整指南。通过实战代码学习梯度下降法、优化器、学习率调度、正则化、批归一化、迁移学习、微调,直至分布式训练。
2026-03-17 · 38 分钟阅读 #deep-learning#training#optimization#regularization#distributed-trainingRing Attention 论文解析:在分布式环境中实现无限上下文窗口训练
解析 Ring Attention 论文,探讨在分布式环境中克服上下文长度限制的方法。涵盖与 Blockwise Parallel Transformer 的关联、实现细节、性能基准,以及生产环境应用时需要考虑的问题。
2026-03-08 · 46 分钟阅读 #ai-papers#ring-attention#distributed-training#long-context#transformerKubernetes AI 训练流水线:Volcano、Training Operator、Kueue 深度分析
基于 Volcano、Kubeflow Training Operator、Kueue 官方文档,分析如何在 Kubernetes 上构建分布式 AI 训练流水线。
2026-03-01 · 26 分钟阅读 #kubernetes#ai#distributed-training#volcano#kubeflow