태그: #vLLM
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 5 편
#vLLM 태그가 붙은 글은 5편이고, 가장 최근 글은 2026-10-06에 올라왔습니다.
함께 자주 붙은 태그: #토스 ML/AI Infra 준비 5 #KV 캐시 2 #처리량 2 #AI스토리지 1 #KV캐시 1
최근 90일 동안 많이 읽힌 글:
LoRA 어댑터 서빙을 직접 재 보기: 처리량 비용, 어댑터 슬롯, 실행 중 적재
기본 모델 하나에 LoRA 어댑터 여러 개를 얹어 서빙할 때 처리량이 얼마나 줄어드는지, 어댑터 수가 슬롯 수를 넘으면 무슨 일이 생기는지, 실행 중에 어댑터를 올리는 데 얼마나 걸리는지를 1.7B 모델과 vLLM 으로 직접 쟀습니다.
2026-10-06 · 18 분 읽기 #LoRA#vLLM#멀티 어댑터#서빙#처리량작은 모델로 vLLM 직접 재 보기: 부하, KV 캐시 용량, 접두사 캐시, 청크 크기
1.7B 모델 한 개를 8GB급 GPU 한 장에 올리고, 동시 요청을 늘리며 처리량과 첫 토큰 시간이 어디서 꺾이는지, KV 캐시 용량이 식과 맞는지, 접두사 캐시와 KV 8비트와 청크 크기가 각각 무엇을 바꾸는지 직접 쟀습니다.
2026-10-06 · 26 분 읽기 #vLLM#부하 테스트#KV 캐시#접두사 캐시#청크 프리필vLLM 과 SGLang 비교, 그리고 벤치마크를 제대로 하는 법
두 추론 엔진을 접두사 캐시 구조와 설계 철학, 기능, 워크로드 모양별 선택 기준으로 비교하고, 열린 루프 부하와 접두사 캐시 함정, 퍼센타일 읽기를 포함한 벤치마크 방법을 공식 도구로 확인해 정리합니다. 결과를 SLO 기준의 GPU 대수로 바꾸는 절차까지 다루며, 우열을 단정하지 않고 직접 측정하는 법을 남깁니다.
2026-10-06 · 36 분 읽기 #vLLM#SGLang#RadixAttention#벤치마크#용량 계획AI 스토리지와 KV 캐시 오프로드: 가중치 로딩 경로부터 LMCache 실측까지
대형 모델 서빙에서 콜드 스타트를 결정하는 가중치 로딩 경로와, GPU 메모리에 다 들어가지 않는 KV 캐시를 CPU 메모리와 디스크로 내리는 방법을 정리합니다. 필자가 잰 LMCache 실측(TTFT 576ms 에서 48.6ms)과 그 한계를 그대로 밝힙니다.
2026-10-06 · 35 분 읽기 #AI스토리지#모델로딩#KV캐시#LMCache#vLLMLLM 추론의 기본과 vLLM 내부: KV 캐시, PagedAttention, 스케줄러
decode 가 메모리 대역폭 한계인 이유를 산술 강도로 설명하고, KV 캐시 크기 식과 vLLM v0.30.0 의 블록 관리, 접두사 캐시, 스케줄러, 선점, 운영 파라미터를 소스와 문서로 확인해 정리합니다. 8GB급 노트북 GPU 에서 잰 실측과 그 한계도 있는 그대로 적습니다.
2026-10-06 · 28 분 읽기 #LLM 추론#vLLM#KV 캐시#PagedAttention#스케줄링