태그: #벤치마크
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 1 편
vLLM 과 SGLang 비교, 그리고 벤치마크를 제대로 하는 법
두 추론 엔진을 접두사 캐시 구조와 설계 철학, 기능, 워크로드 모양별 선택 기준으로 비교하고, 열린 루프 부하와 접두사 캐시 함정, 퍼센타일 읽기를 포함한 벤치마크 방법을 공식 도구로 확인해 정리합니다. 결과를 SLO 기준의 GPU 대수로 바꾸는 절차까지 다루며, 우열을 단정하지 않고 직접 측정하는 법을 남깁니다.
2026-10-06 · 36 분 읽기 #vLLM#SGLang#RadixAttention#벤치마크#용량 계획