タグ: #nccl
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 4 件
PyTorch 2.13のtorchcomms — c10dを置き換えにきた新しい分散通信バックエンド
2026年7月8日にリリースされたPyTorch 2.13のハイライトのうち、最も構造的な変化はtorchcomms — PyTorch Distributedの新しい通信バックエンドが、コアのCIとDeviceMeshの経路に統合され始めたことです。torchcommsは2025年10月にMetaが発表した実験的な通信APIで、グローバル状態ベースのc10d ProcessGroupの技術的負債(NCCL中心の設計、lazy init
2026-07-17 · 18 分で読めます #pytorch#distributed-training#nccl#deep-learning分散学習 & GPUインフラ 2026 ディープダイブ — DeepSpeed、FSDP2、Megatron-LM、Ray Train、JAX、TorchTitan、Blackwell GB200、MI325X、TPU v5p 総まとめ
DeepSpeed/FSDP2/Megatron-LM/Ray Train/JAX/TorchTitan/Composerを比較し、NVIDIA Blackwell GB200 NVL72、AMD MI325X、Intel Gaudi 3、AWS Trainium 2、Google TPU v5p/v6e Trillimuまで。3D並列化、ZeRO-FSDP等価性、MoEのAll-to-All、fp8/mxfp4精度、NCCLチューニン
2026-05-16 · 20 分で読めます #distributed-training#deepspeed#fsdp#megatron-lm#rayCUDA GPU プログラミング上級編: Warp最適化、Tensor Core、Tritonカーネル作成まで
CUDAメモリ階層、Warp最適化、Tensor Core WMMA API、Flash Attention実装、Tritonカスタムカーネル作成まで、AIモデル学習高速化のためのGPUプログラミング上級ガイドです。
2026-03-17 · 23 分で読めます #cuda#GPUプログラミング#tensorcore#triton#flash-attention分散システム完全ガイド: CAP定理から分散ML学習、Kafkaまで
CAP定理、Raftコンセンサスアルゴリズム、Kafkaメッセージキューから、Ring-AllReduceによる分散ML学習とNCCLまで、AIエンジニアのための分散システム完全ガイドです。
2026-03-17 · 24 分で読めます #分散システム#kafka#raft#pytorchdistributed#nccl