LabHub

LLM 서빙 · 모델 서버 선택과 재현 가능한 비교 · 퀴즈

퀴즈: 모델 서버 선택

LabHub 에서 이어서 보기

문항 6개. 정답과 해설은 풀어 본 뒤에 보여 드립니다.

  1. vLLM 의 핵심 기여인 PagedAttention 이 개선하는 것은?

    1. 같은 프롬프트에 대한 모델 출력의 정확도
    2. 토큰을 내보내는 구간의 네트워크 지연
    3. 입력을 자르는 토크나이저의 처리 속도
    4. KV 캐시의 내부 단편화를 줄여 같은 메모리에 더 많은 시퀀스를 담도록 돕는 것
  2. 공통 접두어가 긴 다중 턴 요청이 많은 서비스에서 서버 후보를 좁히는 가장 적절한 방법은?

    1. 접두어 재사용 기능이 있는 후보를 포함해 실제 접두어 비율과 동시성으로 비교한다
    2. 문서의 단일 처리량 순위만 따른다
    3. 로컬 실행이 쉬운 후보를 곧바로 선택한다
    4. GPU 이름이 같으면 모든 서버가 동일하다고 가정한다
  3. 사전 빌드 엔진 방식의 모델 서버를 평가할 때 성능과 함께 반드시 확인할 것은?

    1. 대상 모델·GPU 지원 범위와 엔진 빌드·업그레이드 운영 비용
    2. 문서에 적힌 최고 처리량 숫자
    3. 커뮤니티에서의 서버 이름 인지도
    4. 스트리밍 UI 의 색상과 디자인
  4. 로컬 개발에 쓰던 서버를 소규모 프로덕션 후보로 검토할 때 올바른 판단은?

    1. 로컬 개발용 도구이므로 무조건 제외한다
    2. 로컬에서 빨랐으므로 그대로 채택한다
    3. GPU 를 쓰면 서버 선택은 무의미하다
    4. 필요 기능을 확인하고 목표 부하로 시험해 SLO 와 운영 비용을 비교한다
  5. 남의 벤치마크 숫자를 그대로 믿으면 안 되는 이유는?

    1. 공개 결과는 모두 조작되기 때문에
    2. GPU 이름만 다르면 언제나 무효이기 때문에
    3. 서버 버전만 같으면 나머지 조건은 무관하기 때문에
    4. 버전·하드웨어·입출력 길이·동시성 조건이 우리 워크로드와 다르기 때문에
  6. 서버 선택보다 앞에 와야 하는 결정은?

    1. 앞단에 둘 로드밸런서 선택
    2. 지표를 모을 모니터링 도구
    3. 모델 크기와 양자화 — GPU 메모리에 들어가는지가 먼저다
    4. 클라이언트의 프로그래밍 언어