태그: #nccl
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 5 편
PyTorch 2.13의 torchcomms — c10d를 대체하러 온 새 분산 통신 백엔드
2026년 7월 8일 릴리스된 PyTorch 2.13의 하이라이트 가운데 가장 구조적인 변화는 torchcomms — PyTorch Distributed의 새 통신 백엔드가 코어의 CI와 DeviceMesh 경로에 통합되기 시작한 것입니다. torchcomms는 2025년 10월 Meta가 발표한 실험적 통신 API로, 전역 상태 기반 c10d ProcessGroup의 기술 부채(NCCL 중
2026-07-17 · 19 분 읽기 #pytorch#distributed-training#nccl#deep-learning분산 학습 & GPU 인프라 2026 딥다이브 — DeepSpeed, FSDP2, Megatron-LM, Ray Train, JAX, TorchTitan, Blackwell GB200, MI325X, TPU v5p 총정리
DeepSpeed/FSDP2/Megatron-LM/Ray Train/JAX/TorchTitan/Composer를 비교하고, NVIDIA Blackwell GB200 NVL72, AMD MI325X, Intel Gaudi 3, AWS Trainium 2, Google TPU v5p/v6e Trillium까지. 3D 병렬화, ZeRO-FSDP 등가성, MoE All-to-All, fp8/mxfp
2026-05-16 · 23 분 읽기 #distributed-training#deepspeed#fsdp#megatron-lm#rayRDMA 완전 가이드 2025: InfiniBand, RoCE, NCCL, GPU 통신 — AI 학습의 숨은 인프라
GPT-4가 10만 GPU로 학습될 수 있었던 비결. RDMA의 원리, InfiniBand와 RoCE, NVIDIA NCCL, GPU Direct까지 — AI 인프라의 숨은 기반을 720줄로 완전 분석한다.
2026-04-15 · 32 분 읽기 #rdma#infiniband#roce#nccl#gpuCUDA GPU 프로그래밍 심화: Warp 최적화, Tensor Core, Triton 커널 작성까지
CUDA 메모리 계층, Warp 최적화, Tensor Core WMMA API, Flash Attention 구현, Triton 커스텀 커널 작성까지 AI 모델 학습 가속화를 위한 GPU 프로그래밍 심화 가이드입니다.
2026-03-17 · 26 분 읽기 #cuda#gpu-programming#tensorcore#triton#flash-attention분산 시스템 완전 정복: CAP theorem부터 분산 ML 학습, Kafka까지
CAP theorem, Raft 합의 알고리즘, Kafka 메시지 큐부터 Ring-AllReduce 분산 ML 학습과 NCCL까지 AI 엔지니어를 위한 분산 시스템 완전 가이드입니다.
2026-03-17 · 24 분 읽기 #distributed-systems#kafka#raft#pytorchdistributed#nccl