LLM 서빙
클라우드 네이티브 아키텍처 · 고급 · 이론 7 · 퀴즈 7 · 실습 5
이 코스에는 GPU 도 모델 가중치도 없습니다. 대신 서빙을 서빙으로 만드는 기계 장치 — 토큰 스트리밍, 연속 배칭, KV 캐시 메모리 산정, 레이트리밋과 토큰 회계, 평가 회귀 방지 — 를 직접 구현합니다. vLLM 을 켜기 전에 무엇이 왜 그렇게 설계됐는지 아는 것이 목표이고, 그 앎이 GPU 를 붙였을 때 설정값의 의미를 아는 사람과 모르는 사람을 가릅니다.
커리큘럼
서빙이 학습과 다른 이유
지연, 처리량, 그리고 KV 캐시라는 새 자원.
토큰 스트리밍과 SSE
첫 글자를 빨리 보여 주는 것이 절반이다.
배칭(연속 배칭)과 큐잉
빈 슬롯을 즉시 채우는 것이 전부다.
- 정적 배칭이 버리는 것 이론
- 연속 배칭 스케줄러 시뮬레이션 실습
- 퀴즈: 배칭 퀴즈
모델 서버 선택과 재현 가능한 비교
같은 측정 계약으로 비교하고 운영 제약까지 함께 고른다.
GPU 메모리 산정과 양자화
들어가는지 계산하고 시작한다.
게이트웨이·레이트리밋·비용 관리
요청이 아니라 토큰을 세야 한다.
평가와 회귀 방지
모델을 바꾸기 전에 재는 자를 먼저 만든다.