LabHub

LLM 서빙 · GPU 메모리 산정과 양자화 · 퀴즈

퀴즈: 메모리 산정

LabHub 에서 이어서 보기

문항 6개. 정답과 해설은 풀어 본 뒤에 보여 드립니다.

  1. KV 캐시 공식 `2 x layers x hidden x seq x batch x dtype` 에서 앞의 2는?

    1. 양방향 어텐션
    2. 키와 값 두 벌
    3. fp16 바이트 수
    4. 안전 계수
  2. 7B(32층, 은닉 4096) fp16 을 128K 컨텍스트, 배치 8 로 돌릴 때 KV 캐시는?

    1. 약 64 GiB
    2. 약 512 GiB
    3. 약 128 GiB
    4. 약 14 GiB
  3. GQA 8그룹을 적용하면 KV 캐시는?

    1. 8분의 1 수준으로 줄어든다
    2. 이전과 변화가 없다
    3. 절반 수준으로 줄어든다
    4. 두 배로 늘어난다
  4. '4비트로 양자화했는데 메모리가 별로 안 줄었다'의 흔한 원인은?

    1. 양자화 과정 자체가 잘못됐다
    2. 가중치만 양자화했고 KV 캐시는 그대로이기 때문
    3. GPU 드라이버 쪽 문제가 있다
    4. 배치 크기를 너무 작게 잡았다
  5. 최대 동시 요청 수를 구하는 계산은?

    1. 전체 GPU 메모리 / 가중치 크기
    2. (GPU 메모리 - 가중치 - 오버헤드) / 요청당 KV 크기
    3. 배치 크기 x 레이어 수 x 헤드 수
    4. 초당 처리량 x 평균 지연 시간
  6. 메모리 계산을 생략하고 배포했을 때 OOM 이 특히 나쁜 시점에 나는 이유는?

    1. OOM 이 어떤 로그에도 남지 않기 때문에
    2. 파이썬 가비지 컬렉션이 그때 겹치기 때문에
    3. 동시 요청이 몰릴 때 KV 캐시 사용량이 최대가 되므로 트래픽 피크에 터지기 때문
    4. 네트워크 수신 버퍼가 함께 커지기 때문에