GPU Operatorとタイムスライシング
쿠버네티스에 GPU 를 붙이는 일은 드라이버를 까는 일이 아니라 노드의 컨테이너 런타임 설정을 오퍼레이터에게 맡기는 일입니다. 그래서 잘 돌던 클러스터가 타임슬라이싱 설정 한 줄 때문에 GPU 전량을 못 쓰게 되는 일이 실제로 일어납니다. 이 코스는 그 사고를 처음부터 다시 밟습니다 — containerd 설정의 병합 규칙, '로드된 것'을 보는 습관, ClusterPolicy 와 데몬셋과 RuntimeClass 의 연결, 타임슬라이싱이 나누는 것과 나누지 않는 것, 그리고 롤아웃이 한 노드에서 멈추는 자리. 실습 환경에는 진짜 GPU 도 GPU Operator 도 없습니다. 설정 파일과 파서, 그리고 kwok 이 띄운 진짜 컨트롤 플레인 위에서 재현할 수 있는 것만 실습으로 다루고, 무엇이 실물이고 무엇이 흉내인지는 실습 안내에 그대로 밝혀 둡니다.
고급 · 레슨 32 · 실습 10
커리큘럼
GPUをクラスタに付けるということ
ランタイム登録が静かに失敗する場所
一枚を複数人で使うということ
- タイムスライシング・MPS・MIG reading
- ロールアウトが一つのノードで止まるとき reading
- 共有の設定 — スライス・MIG・クォータで分けておく lab
- クイズ: 共有とロールアウト quiz
事故を最初から辿り直す
- 何が実物で何が真似なのか reading
- GPU事故の再現 — 設定のマージからロールアウト停止まで lab
- クイズ: 事故の再現から学んだこと quiz