태그: #병렬컴퓨팅
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 2 편
행렬이 GPU에서 어떻게 날아다니는가: GEMM부터 FlashAttention까지 완전 해부
딥러닝 연산의 80% 이상을 차지하는 행렬 곱셈이 GPU에서 어떻게 최적화되는가. 순진한 O(n³) 구현부터 캐시 블로킹, cuBLAS, 그리고 FlashAttention의 IO-aware 혁신까지 완전 해부한다.
2026-03-18 · 22 분 읽기 #gemm#행렬곱셈#flash-attention#gpu#병렬컴퓨팅NVIDIA GPU와 CUDA 완전 해부: 왜 GPU가 AI를 지배하는가
H100 스펙부터 Tensor Core WMMA API까지. SIMT 실행 모델, 공유 메모리 타일링, Warp divergence를 실제 CUDA 코드와 함께 완전 해부한다.
2026-03-18 · 22 분 읽기 #cuda#gpu#nvidia#행렬연산#병렬컴퓨팅