タグ: #gpu-operator
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 6 件
GPU障害診断プレイブック — 層を決めてから降りる
KubernetesでGPUの問題を診断するとき最大の無駄は、順序なくあちこち突くことです。Podがスケジュールされない、Podは起動したのにGPUが見えない、ドライバとツールキットのバージョンがずれている、メモリが足りない、ノードからGPUが消える、これらは別の層の問題であり確認順序が異なります。本記事ではNVIDIA GPU Operatorの公式トラブルシューティングドキュメントとdcgm-exporterリポジトリを根拠に、五つ
2026-08-12 · 13 分で読めます #gpu#kubernetes#troubleshooting#nvidia#gpu-operatorNVIDIA GPU Operator入門 — もともと手で入れていた六つの部品
KubernetesでGPUを使うには、ドライバ、NVIDIA Container Toolkit、デバイスプラグイン、DCGM、GPU Feature Discovery、Node Feature Discoveryをノードごとに手で揃える必要がありました。NVIDIA GPU Operatorはそれらを一つのオペレータにまとめ、ClusterPolicy一つで望ましい状態を管理します。各コンポーネントが実際に何をするのか、Helmチ
2026-08-12 · 10 分で読めます #gpu#kubernetes#gpu-operator#nvidia#dcgmMIGとtime-slicing — GPU一枚を複数で使う二つの方法
GPU一枚に複数のワークロードを載せる方法は大きく二つあります。時間を分けるtime-slicingとハードウェアを分けるMIGですが、名前が似て見えるのとは裏腹に隔離の水準がまったく異なります。本記事ではNVIDIA GPU Operatorの公式ドキュメントを基準に、両方式の設定ファイル構造とノードラベル、広告されるリソース名、対応ハードウェア条件を整理し、time-slicingのレプリカ間にメモリ隔離も障害隔離も無いという事実が
2026-08-12 · 11 分で読めます #gpu#kubernetes#mig#time-slicing#nvidiaデバイスプラグインとGPUスケジューリング — nvidia.com/gpuはどこから来るのか
KubernetesはGPUを知りません。ノードにGPUをリソースとして広告させるのはkubeletに登録されたデバイスプラグインであり、その結果生まれる名前が拡張リソースnvidia.com/gpuです。本記事では、デバイスプラグインが実装すべきgRPCインターフェースと登録ソケットのパス、拡張リソースでrequestsとlimitsが必ず一致しなければならない理由、GPUをCPUのようにミリコアへ分割できない根本的な理由、そしてGP
2026-08-12 · 10 分で読めます #gpu#kubernetes#device-plugin#scheduling#nvidiaNVIDIA GPU Operator完全ガイド:コンポーネント、インストール、KubeVirt GPUパススルーまで総まとめ
NVIDIA GPU Operatorのアーキテクチャと7大コアコンポーネント(Driver、Container Toolkit、Device Plugin、DCGM、MIG Manager、Node Feature Discovery、GFD)の役割を詳細に分析し、Helmベースのインストール、KubeVirtとのGPU/vGPUパススルー統合、MIGパーティショニング、モニタリング、トラブルシューティングまで実践ガイドを総まとめする
2026-03-01 · 12 分で読めます #gpu-operator#nvidia#kubernetes#kubevirt#gpuKubernetes GPUワークロード管理:NVIDIA GPU Operator完全ガイド
NVIDIA GPU Operator公式ドキュメントに基づき、KubernetesクラスタでGPUリソースを効率的に管理し、AIワークロードを運用する方法を分析する。
2026-03-01 · 29 分で読めます #kubernetes#gpu#nvidia#gpu-operator#ai