태그: #KV캐시
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 2 편
NPU 완전 해부: 트랜스포머 아키텍처가 실리콘 위에서 어떻게 달리는가
NPU가 CPU/GPU와 무엇이 다른지, 트랜스포머의 모든 연산이 하드웨어에 어떻게 매핑되는지, 왜 LLM 추론은 메모리 바운드인지를 루프라인 모델과 실제 코드로 완전 해부합니다. Apple ANE부터 Qualcomm Hexagon, Groq LPU까지.
2026-03-18 · 28 분 읽기 #npu#트랜스포머#ai-hardware#양자화#KV캐시LLM 서빙 최적화 완전 가이드: KV Cache, PagedAttention, 양자화의 모든 것
LLM 서빙의 핵심 최적화 기술을 완전 해부한다. KV Cache의 메모리 문제부터 PagedAttention의 가상 메모리 혁신, 연속 배칭, 추측 디코딩, 양자화, 그리고 vLLM/TGI/TensorRT-LLM 비교까지.
2026-03-18 · 48 분 읽기 #LLM서빙#KV캐시#paged-attention#vllm#양자화