LabHub
배우기 러닝패스 코스

PCA — 프로메테우스 인증 어소시에이트 · GPU 와 서빙 지표 — DCGM 이 말하는 것과 말하지 않는 것 · 실습

GPU 넉 장의 실측으로 '노는 카드' 판정하기

LabHub 에서 이어서 보기

목표

GPU 넉 장의 실측 3시간치로 "이 카드는 노는가" 를 판정하고, 그 판정의 근거를
보고서로 남깁니다. 마지막에는 vLLM 형식의 서빙 지표에서 첫 토큰 지연을 구합니다.

왜 중요한가

GPU 는 비싸고 잘 안 늘어나서, 용량 판정을 틀리면 바로 돈과 시간이 샙니다. 그런데
사용률 하나만 보면 반드시 틀립니다 — 사용률 0 인 카드가 메모리 13.7 GiB 를 잡고
있으면 그 카드는 노는 동시에 차 있습니다. 게다가 어느 파드가 쓰는지 알려 주는
귀속 라벨은 노드 구성에 따라 통째로 비어 있을 수 있어서, "누가 쓰는지 모르는 GPU"
가 실제로 생깁니다. 이 실습은 그 두 가지를 지표로 판정하는 연습입니다.

자료에 대해

단계

1. DCGM 이 보고하는 GPU 개수를 세는 쿼리를 /root/pca-gpu/01-inventory.promql 에 씁니다.
2. 창 내내 사용률이 0 이면서 프레임버퍼를 가장 많이 잡고 있는 GPU 의 노드 이름을
/root/pca-gpu/02-idle.txt 에 한 줄로 씁니다.
3. 그 GPU 의 DCGM_FI_DEV_FB_USED 를 내는 쿼리를 /root/pca-gpu/03-fbused.promql 에 씁니다.
4. exported_pod 라벨이 비어 있는 GPU 의 노드 이름을
/root/pca-gpu/04-attribution.txt 에 한 줄로 씁니다.
5. nuc1 GPU 의 누적 에너지 카운터에서 평균 전력(W)을 내는 쿼리를
/root/pca-gpu/05-energy.promql 에 씁니다.
6. 창 전체로 보아 사용률이 한 번도 0 을 넘지 않은 GPU 의 개수를 세는 쿼리를
/root/pca-gpu/06-idle-window.promql 에 씁니다.
7. 서빙 표본의 첫 토큰 지연 p95 를 구하는 쿼리를 /root/pca-gpu/07-ttft.promql 에 씁니다.
8. 판정 두 개와 근거, 그리고 무엇이 실측이고 무엇이 표본인지를
/root/pca-gpu/08-report.md 에 300자 이상으로 적습니다.

참고

단계 8개

  1. DCGM 이 보고하는 GPU 세기
  2. 메모리는 잡고 있는데 창 내내 노는 GPU 찾기
  3. 그 GPU 가 잡고 있는 프레임버퍼 재기
  4. 누가 쓰는지 알 수 없는 GPU 찾기
  5. 누적 에너지 카운터에서 평균 전력 끌어내기
  6. 창 전체로 노는 GPU 개수 세기
  7. 서빙 지표에서 첫 토큰 지연 p95 구하기
  8. 판정과 근거를, 무엇이 실측인지와 함께 적기