태그: #처리량
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 2 편
LoRA 어댑터 서빙을 직접 재 보기: 처리량 비용, 어댑터 슬롯, 실행 중 적재
기본 모델 하나에 LoRA 어댑터 여러 개를 얹어 서빙할 때 처리량이 얼마나 줄어드는지, 어댑터 수가 슬롯 수를 넘으면 무슨 일이 생기는지, 실행 중에 어댑터를 올리는 데 얼마나 걸리는지를 1.7B 모델과 vLLM 으로 직접 쟀습니다.
2026-10-06 · 18 분 읽기 #LoRA#vLLM#멀티 어댑터#서빙#처리량작은 모델로 vLLM 직접 재 보기: 부하, KV 캐시 용량, 접두사 캐시, 청크 크기
1.7B 모델 한 개를 8GB급 GPU 한 장에 올리고, 동시 요청을 늘리며 처리량과 첫 토큰 시간이 어디서 꺾이는지, KV 캐시 용량이 식과 맞는지, 접두사 캐시와 KV 8비트와 청크 크기가 각각 무엇을 바꾸는지 직접 쟀습니다.
2026-10-06 · 26 분 읽기 #vLLM#부하 테스트#KV 캐시#접두사 캐시#청크 프리필