LLM 서빙 · GPU 메모리 산정과 양자화 · 퀴즈
퀴즈: 메모리 산정
문항 6개. 정답과 해설은 풀어 본 뒤에 보여 드립니다.
KV 캐시 공식 `2 x layers x hidden x seq x batch x dtype` 에서 앞의 2는?
- 양방향 어텐션
- 키와 값 두 벌
- fp16 바이트 수
- 안전 계수
7B(32층, 은닉 4096) fp16 을 128K 컨텍스트, 배치 8 로 돌릴 때 KV 캐시는?
- 약 64 GiB
- 약 512 GiB
- 약 128 GiB
- 약 14 GiB
GQA 8그룹을 적용하면 KV 캐시는?
- 8분의 1 수준으로 줄어든다
- 이전과 변화가 없다
- 절반 수준으로 줄어든다
- 두 배로 늘어난다
'4비트로 양자화했는데 메모리가 별로 안 줄었다'의 흔한 원인은?
- 양자화 과정 자체가 잘못됐다
- 가중치만 양자화했고 KV 캐시는 그대로이기 때문
- GPU 드라이버 쪽 문제가 있다
- 배치 크기를 너무 작게 잡았다
최대 동시 요청 수를 구하는 계산은?
- 전체 GPU 메모리 / 가중치 크기
- (GPU 메모리 - 가중치 - 오버헤드) / 요청당 KV 크기
- 배치 크기 x 레이어 수 x 헤드 수
- 초당 처리량 x 평균 지연 시간
메모리 계산을 생략하고 배포했을 때 OOM 이 특히 나쁜 시점에 나는 이유는?
- OOM 이 어떤 로그에도 남지 않기 때문에
- 파이썬 가비지 컬렉션이 그때 겹치기 때문에
- 동시 요청이 몰릴 때 KV 캐시 사용량이 최대가 되므로 트래픽 피크에 터지기 때문
- 네트워크 수신 버퍼가 함께 커지기 때문에