标签: #fsdp
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 3 篇
多 GPU 训练的四种并行方式 —— 拆分什么,通信什么
用数字梳理了数据并行、张量并行、流水线并行、上下文并行各自拆分什么,又为此付出什么通信代价。首先搭建 Adam 混合精度训练中每参数 16 字节的账本,再计算 ZeRO 1 到 3 阶段分别把账本中的哪一项按 GPU 数量切分。接着用激活内存公式说明检查点技术为何能把 100GB 变成 1GB,并把各种并行方式的通信量换算成每步字节数,说明 NVLink 内部与节点之间的带宽差距为何决定批次配置。最后给出按模型规模和 GPU 数量选择组
2026-08-02 · 19 分钟阅读 #mlops#distributed-training#multi-gpu#fsdp#deepspeedTorch-Titan 完全指南:PyTorch 大规模分布式训练全解析
一份掌握 PyTorch Titan(torchtitan)大规模 LLM 分布式训练的完全指南。涵盖 FSDP2、流水线并行、张量并行、4D 并行、Flash Attention 与混合精度,并配有实战示例。
2026-03-17 · 27 分钟阅读 #torch-titan#distributed-training#pytorch#fsdp#deep-learningPyTorch 内部结构与高级优化:从 autograd、torch.compile、FSDP 到 Triton
一份 PyTorch 完全攻略指南,涵盖 PyTorch autograd 引擎、torch.compile() 与 TorchInductor 优化、FSDP 分布式训练、gradient checkpointing,以及自定义 CUDA 算子。
2026-03-17 · 13 分钟阅读 #pytorch#torch-compile#fsdp#triton#혼합정밀도