태그: #LLM서빙
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 7 편
행렬이 GPU에서 어떻게 날아다니는가: GEMM부터 FlashAttention까지 완전 해부
딥러닝 연산의 80% 이상을 차지하는 행렬 곱셈이 GPU에서 어떻게 최적화되는가. 순진한 O(n³) 구현부터 캐시 블로킹, cuBLAS, 그리고 FlashAttention의 IO-aware 혁신까지 완전 해부한다.
2026-03-18 · 22 분 읽기 #gemm#행렬곱셈#flash-attention#gpu#병렬컴퓨팅AMD GPU & ROCm 완전 분석: CUDA의 대안은 가능한가?
AMD MI300X의 192GB HBM3 메모리, ROCm 소프트웨어 스택, HIP 프로그래밍 모델을 심층 분석합니다. vLLM과 llama.cpp로 실제 LLM 서빙 성능을 측정하고, NVIDIA CUDA 대비 현실적인 장단점과 선택 기준을 제시합니다.
2026-03-18 · 22 분 읽기 #amd#rocm#gpu#mi300x#LLM서빙NVIDIA GPU와 CUDA 완전 해부: 왜 GPU가 AI를 지배하는가
H100 스펙부터 Tensor Core WMMA API까지. SIMT 실행 모델, 공유 메모리 타일링, Warp divergence를 실제 CUDA 코드와 함께 완전 해부한다.
2026-03-18 · 22 분 읽기 #cuda#gpu#nvidia#행렬연산#병렬컴퓨팅LLM 서빙 최적화 완전 가이드: KV Cache, PagedAttention, 양자화의 모든 것
LLM 서빙의 핵심 최적화 기술을 완전 해부한다. KV Cache의 메모리 문제부터 PagedAttention의 가상 메모리 혁신, 연속 배칭, 추측 디코딩, 양자화, 그리고 vLLM/TGI/TensorRT-LLM 비교까지.
2026-03-18 · 48 분 읽기 #LLM서빙#KV캐시#paged-attention#vllm#양자화cuDNN 완전 해부: 딥러닝 연산이 GPU에서 빛처럼 빠른 이유
im2col 변환부터 Winograd 알고리즘, FlashAttention 타일링, TensorRT INT8 양자화까지. cuDNN이 딥러닝 연산을 어떻게 10~100배 빠르게 만드는지 실제 코드와 함께 완전 해부한다.
2026-03-18 · 20 분 읽기 #cudnn#gpu#nvidia#딥러닝최적화#컨볼루션Google TPU 완전 해부: Systolic Array가 행렬 곱셈을 어떻게 완벽히 해결하는가
Google TPU의 핵심 혁신인 Systolic Array가 행렬 곱셈을 어떻게 극한까지 최적화하는지 완전 해부합니다. INT8 추론부터 bfloat16, XLA 컴파일러, TPU Pod까지 실제 숫자와 코드로 깊이 파헤칩니다.
2026-03-18 · 21 분 읽기 #tpu#google#systolic-array#LLM서빙#jaxApple Silicon에서 LLM 서빙하기: M4/M5 칩의 비밀과 한계
Apple M4/M5 칩의 유니파이드 메모리 아키텍처가 LLM 추론에 미치는 영향을 깊이 파헤칩니다. Neural Engine, MLX 프레임워크, llama.cpp Metal 백엔드를 활용한 실전 벤치마크와 함께 NVIDIA GPU 대비 실질적인 선택 기준을 제시합니다.
2026-03-18 · 21 분 읽기 #apple-silicon#m5#LLM서빙#유니파이드메모리#mlx