GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 1 편
한국어English日本語中文
← 전체 글
H100 스펙부터 Tensor Core WMMA API까지. SIMT 실행 모델, 공유 메모리 타일링, Warp divergence를 실제 CUDA 코드와 함께 완전 해부한다.