태그: #CUDA최적화
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 1 편
행렬이 GPU에서 어떻게 날아다니는가: GEMM부터 FlashAttention까지 완전 해부
딥러닝 연산의 80% 이상을 차지하는 행렬 곱셈이 GPU에서 어떻게 최적화되는가. 순진한 O(n³) 구현부터 캐시 블로킹, cuBLAS, 그리고 FlashAttention의 IO-aware 혁신까지 완전 해부한다.
2026-03-18 · 22 분 읽기 #gemm#행렬곱셈#flash-attention#gpu#병렬컴퓨팅