한국어
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 1 편
← 전체 글
기본 모델 하나에 LoRA 어댑터 여러 개를 얹어 서빙할 때 처리량이 얼마나 줄어드는지, 어댑터 수가 슬롯 수를 넘으면 무슨 일이 생기는지, 실행 중에 어댑터를 올리는 데 얼마나 걸리는지를 1.7B 모델과 vLLM 으로 직접 쟀습니다.