LabHub

GPU Operator 와 타임슬라이싱 · 한 장을 여럿이 쓴다는 말의 뜻 · 퀴즈

퀴즈: 공유와 롤아웃

LabHub 에서 이어서 보기

문항 6개. 정답과 해설은 풀어 본 뒤에 보여 드립니다.

  1. 물리 GPU 4장에 타임슬라이싱 replicas 5 를 걸면 노드가 광고하는 자원 수는?

    1. 20 이고 각 슬롯에 보장된 VRAM 은 없다
    2. 20 이고 각 슬롯이 VRAM 을 5분의 1씩 갖는다
    3. 5 이고 나머지 세 장은 광고되지 않는다
    4. 4 이고 파드마다 5개씩 스트림을 받는다
  2. 프로덕션 추론 서비스와 실험용 노트북을 같은 GPU 에 태워야 한다면?

    1. 타임슬라이싱 replicas 를 늘려 자리를 넉넉히 만든다
    2. 노드 풀을 갈라 격리가 필요한 쪽을 따로 둔다
    3. MPS 데몬을 켜서 커널을 동시에 실행시킨다
    4. 요청을 2로 올려 각자 슬라이스를 두 개씩 쥔다
  3. failRequestsGreaterThanOne 을 true 로 두는 이유는?

    1. 슬라이스가 남아 있을 때만 파드를 받도록 하려고
    2. 요청 수만큼 메모리 상한을 자동으로 걸어 주려고
    3. 슬라이스 여러 개가 곧 장치 여러 장이 아니기 때문에
    4. 장치 수보다 많은 파드가 뜨는 것을 막으려고
  4. 데몬셋이 DESIRED 3 · READY 2 · UP-TO-DATE 1 에서 움직이지 않는다. 이 상태의 의미는?

    1. 세 노드 모두 새 스펙을 받았고 준비만 기다리는 중이다
    2. 컨트롤러가 잠시 멈췄다가 곧 다음 노드로 넘어간다
    3. 데몬셋이 두 노드를 대상에서 제외해 축소된 상태다
    4. 한 노드가 새 파드를 못 띄워 두 노드가 옛 스펙으로 남았다
  5. 롤아웃 정지를 알림으로 잡으려면 무엇을 봐야 하는가?

    1. desired 와 ready 가 몇 분 이상 어긋나 있는지
    2. 데몬셋 파드의 재시작 횟수가 늘고 있는지
    3. 컨테이너 로그에 오류 문자열이 찍히는지
    4. 노드의 GPU 사용률이 갑자기 떨어졌는지
  6. 새 스펙이 안 뜨는 원인이 톨러레이션 누락일 때 나타나는 차이는?

    1. 파드가 Pending 이 아니라 ImagePullBackOff 로 남는다
    2. DESIRED 숫자 자체가 줄어들고 파드가 사라진다
    3. UP-TO-DATE 가 먼저 전체 노드 수까지 올라간다
    4. 롤아웃이 멈추지 않고 마지막 노드까지 진행된다