LabHub

GPU Operator 와 타임슬라이싱 · 사고를 처음부터 다시 밟는다 · 퀴즈

퀴즈: 사고 재현에서 배운 것

LabHub 에서 이어서 보기

문항 6개. 정답과 해설은 풀어 본 뒤에 보여 드립니다.

  1. 실습에서 만든 점검 스크립트가 파일 대신 dump 를 읽어야 하는 이유는?

    1. 파일은 권한 문제로 읽지 못하는 경우가 잦기 때문
    2. dump 가 파일보다 훨씬 빠르게 응답하기 때문
    3. 파일에는 원하는 내용이 그대로 남아 있기 때문
    4. 파일 형식이 버전마다 달라 파싱이 어렵기 때문
  2. 노드 status 에 nvidia.com/gpu 숫자만 적어도 스케줄링이 재현되는 이유는?

    1. kubelet 이 장치 유무를 나중에 다시 확인하기 때문
    2. 확장 자원은 노드마다 임의로 정의할 수 있기 때문
    3. 스케줄러가 장치를 열어 보고 숫자를 대조하기 때문
    4. 스케줄러의 판단 근거가 장치가 아니라 그 숫자이기 때문
  3. 실습에서 파드의 Pending 사유를 파일로 저장하게 한 이유는?

    1. 조건과 이벤트는 상태가 바뀌면 사라지기 때문
    2. 채점기가 클러스터에 접근할 수 없기 때문
    3. 같은 사유가 여러 노드에서 다르게 나오기 때문
    4. 파드가 자동으로 삭제되어 조회할 수 없기 때문
  4. 슬롯 계산표에서 보장 메모리를 0 으로 적는 것이 뜻하는 바는?

    1. 슬롯을 받은 파드가 메모리를 전혀 쓸 수 없다는 뜻
    2. 한 파드가 메모리를 다 쓰면 나머지가 실패한다는 뜻
    3. 메모리 사용량을 지표로 측정할 수 없다는 뜻
    4. 파드마다 메모리 상한을 따로 걸어야 한다는 뜻
  5. 롤아웃이 멈춘 클러스터에서 가장 먼저 해야 할 일은?

    1. 새 스펙이 안 뜨는 원인을 끝까지 규명한다
    2. 동시 중단 허용치를 높여 롤아웃을 밀어붙인다
    3. 옛 스펙으로 되돌려 노드 상태를 하나로 모은다
    4. 멈춘 노드를 비우고 클러스터에서 제외한다
  6. 이 실습 환경에서 실증할 수 없어 개념으로만 다룬 것은?

    1. 자원이 없을 때 파드가 대기하는 동작
    2. 데몬셋 롤링 업데이트가 멈추는 동작
    3. RuntimeClass 오브젝트가 저장되는 동작
    4. 재시작해야 런타임 핸들러가 등록되는 동작