LLM 서빙 · 모델 서버 선택과 재현 가능한 비교 · 퀴즈
퀴즈: 모델 서버 선택
문항 6개. 정답과 해설은 풀어 본 뒤에 보여 드립니다.
vLLM 의 핵심 기여인 PagedAttention 이 개선하는 것은?
- 같은 프롬프트에 대한 모델 출력의 정확도
- 토큰을 내보내는 구간의 네트워크 지연
- 입력을 자르는 토크나이저의 처리 속도
- KV 캐시의 내부 단편화를 줄여 같은 메모리에 더 많은 시퀀스를 담도록 돕는 것
공통 접두어가 긴 다중 턴 요청이 많은 서비스에서 서버 후보를 좁히는 가장 적절한 방법은?
- 접두어 재사용 기능이 있는 후보를 포함해 실제 접두어 비율과 동시성으로 비교한다
- 문서의 단일 처리량 순위만 따른다
- 로컬 실행이 쉬운 후보를 곧바로 선택한다
- GPU 이름이 같으면 모든 서버가 동일하다고 가정한다
사전 빌드 엔진 방식의 모델 서버를 평가할 때 성능과 함께 반드시 확인할 것은?
- 대상 모델·GPU 지원 범위와 엔진 빌드·업그레이드 운영 비용
- 문서에 적힌 최고 처리량 숫자
- 커뮤니티에서의 서버 이름 인지도
- 스트리밍 UI 의 색상과 디자인
로컬 개발에 쓰던 서버를 소규모 프로덕션 후보로 검토할 때 올바른 판단은?
- 로컬 개발용 도구이므로 무조건 제외한다
- 로컬에서 빨랐으므로 그대로 채택한다
- GPU 를 쓰면 서버 선택은 무의미하다
- 필요 기능을 확인하고 목표 부하로 시험해 SLO 와 운영 비용을 비교한다
남의 벤치마크 숫자를 그대로 믿으면 안 되는 이유는?
- 공개 결과는 모두 조작되기 때문에
- GPU 이름만 다르면 언제나 무효이기 때문에
- 서버 버전만 같으면 나머지 조건은 무관하기 때문에
- 버전·하드웨어·입출력 길이·동시성 조건이 우리 워크로드와 다르기 때문에
서버 선택보다 앞에 와야 하는 결정은?
- 앞단에 둘 로드밸런서 선택
- 지표를 모을 모니터링 도구
- 모델 크기와 양자화 — GPU 메모리에 들어가는지가 먼저다
- 클라이언트의 프로그래밍 언어