LabHub
배우기 러닝패스 코스

GPU Operatorとタイムスライシング

쿠버네티스에 GPU 를 붙이는 일은 드라이버를 까는 일이 아니라 노드의 컨테이너 런타임 설정을 오퍼레이터에게 맡기는 일입니다. 그래서 잘 돌던 클러스터가 타임슬라이싱 설정 한 줄 때문에 GPU 전량을 못 쓰게 되는 일이 실제로 일어납니다. 이 코스는 그 사고를 처음부터 다시 밟습니다 — containerd 설정의 병합 규칙, '로드된 것'을 보는 습관, ClusterPolicy 와 데몬셋과 RuntimeClass 의 연결, 타임슬라이싱이 나누는 것과 나누지 않는 것, 그리고 롤아웃이 한 노드에서 멈추는 자리. 실습 환경에는 진짜 GPU 도 GPU Operator 도 없습니다. 설정 파일과 파서, 그리고 kwok 이 띄운 진짜 컨트롤 플레인 위에서 재현할 수 있는 것만 실습으로 다루고, 무엇이 실물이고 무엇이 흉내인지는 실습 안내에 그대로 밝혀 둡니다.

고급 · 레슨 32 · 실습 10

실습 시작하기

커리큘럼

GPUをクラスタに付けるということ

ランタイム登録が静かに失敗する場所

一枚を複数人で使うということ

事故を最初から辿り直す

GPU ノードであるという事実はラベルに書かれている

オペランドはラベルが点けた分だけ立ち上がる

ドライバーはアプリケーションではなくカーネルモジュールだ

GPU ポッドが起動しない — 原因を順番に絞る

GPU は何で見るのか

GPU を使うのはコンテナだけではない