GPU Operator 와 타임슬라이싱 · 사고를 처음부터 다시 밟는다 · 퀴즈
퀴즈: 사고 재현에서 배운 것
문항 6개. 정답과 해설은 풀어 본 뒤에 보여 드립니다.
실습에서 만든 점검 스크립트가 파일 대신 dump 를 읽어야 하는 이유는?
- 파일은 권한 문제로 읽지 못하는 경우가 잦기 때문
- dump 가 파일보다 훨씬 빠르게 응답하기 때문
- 파일에는 원하는 내용이 그대로 남아 있기 때문
- 파일 형식이 버전마다 달라 파싱이 어렵기 때문
노드 status 에 nvidia.com/gpu 숫자만 적어도 스케줄링이 재현되는 이유는?
- kubelet 이 장치 유무를 나중에 다시 확인하기 때문
- 확장 자원은 노드마다 임의로 정의할 수 있기 때문
- 스케줄러가 장치를 열어 보고 숫자를 대조하기 때문
- 스케줄러의 판단 근거가 장치가 아니라 그 숫자이기 때문
실습에서 파드의 Pending 사유를 파일로 저장하게 한 이유는?
- 조건과 이벤트는 상태가 바뀌면 사라지기 때문
- 채점기가 클러스터에 접근할 수 없기 때문
- 같은 사유가 여러 노드에서 다르게 나오기 때문
- 파드가 자동으로 삭제되어 조회할 수 없기 때문
슬롯 계산표에서 보장 메모리를 0 으로 적는 것이 뜻하는 바는?
- 슬롯을 받은 파드가 메모리를 전혀 쓸 수 없다는 뜻
- 한 파드가 메모리를 다 쓰면 나머지가 실패한다는 뜻
- 메모리 사용량을 지표로 측정할 수 없다는 뜻
- 파드마다 메모리 상한을 따로 걸어야 한다는 뜻
롤아웃이 멈춘 클러스터에서 가장 먼저 해야 할 일은?
- 새 스펙이 안 뜨는 원인을 끝까지 규명한다
- 동시 중단 허용치를 높여 롤아웃을 밀어붙인다
- 옛 스펙으로 되돌려 노드 상태를 하나로 모은다
- 멈춘 노드를 비우고 클러스터에서 제외한다
이 실습 환경에서 실증할 수 없어 개념으로만 다룬 것은?
- 자원이 없을 때 파드가 대기하는 동작
- 데몬셋 롤링 업데이트가 멈추는 동작
- RuntimeClass 오브젝트가 저장되는 동작
- 재시작해야 런타임 핸들러가 등록되는 동작