한국어
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 1 편
← 전체 글
1.7B 모델 한 개를 8GB급 GPU 한 장에 올리고, 동시 요청을 늘리며 처리량과 첫 토큰 시간이 어디서 꺾이는지, KV 캐시 용량이 식과 맞는지, 접두사 캐시와 KV 8비트와 청크 크기가 각각 무엇을 바꾸는지 직접 쟀습니다.