标签: #deepspeed
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
多 GPU 训练的四种并行方式 —— 拆分什么,通信什么
用数字梳理了数据并行、张量并行、流水线并行、上下文并行各自拆分什么,又为此付出什么通信代价。首先搭建 Adam 混合精度训练中每参数 16 字节的账本,再计算 ZeRO 1 到 3 阶段分别把账本中的哪一项按 GPU 数量切分。接着用激活内存公式说明检查点技术为何能把 100GB 变成 1GB,并把各种并行方式的通信量换算成每步字节数,说明 NVLink 内部与节点之间的带宽差距为何决定批次配置。最后给出按模型规模和 GPU 数量选择组
2026-08-02 · 19 分钟阅读 #mlops#distributed-training#multi-gpu#fsdp#deepspeedDeepSpeed 完全指南:ZeRO 优化与大规模模型训练
全面掌握 Microsoft DeepSpeed 的实战指南。涵盖 ZeRO-1/2/3 优化、Offload、流水线并行、混合精度、MoE、DeepSpeed Inference,配有实战配置和代码示例。
2026-03-17 · 21 分钟阅读 #deepspeed#zero-optimization#distributed-training#llm#pytorch