태그: #딥러닝
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 2 편
AMD GPU & ROCm 완전 분석: CUDA의 대안은 가능한가?
AMD MI300X의 192GB HBM3 메모리, ROCm 소프트웨어 스택, HIP 프로그래밍 모델을 심층 분석합니다. vLLM과 llama.cpp로 실제 LLM 서빙 성능을 측정하고, NVIDIA CUDA 대비 현실적인 장단점과 선택 기준을 제시합니다.
2026-03-18 · 22 분 읽기 #amd#rocm#gpu#mi300x#LLM서빙NVIDIA GPU와 CUDA 완전 해부: 왜 GPU가 AI를 지배하는가
H100 스펙부터 Tensor Core WMMA API까지. SIMT 실행 모델, 공유 메모리 타일링, Warp divergence를 실제 CUDA 코드와 함께 완전 해부한다.
2026-03-18 · 22 분 읽기 #cuda#gpu#nvidia#행렬연산#병렬컴퓨팅