태그: #nvidia
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 38 편
GPU Operator 설치 중 만난 "no runtime for nvidia is configured" — 컨테이너 런타임과 Helm 업그레이드가 실제로 하는 일
5노드 홈랩에 NVIDIA GPU Operator를 올리다 파드가 전부 Init에서 멈췄습니다. 원인은 컨테이너 런타임에 nvidia 핸들러가 없다는 것이었고, 호스트에 nvidia-ctk 바이너리가 있다고 방심한 제 판단 착오였습니다. 왜 쿠버네티스에서 container toolkit이 필수인지, Helm upgrade가 내부적으로 무엇을 바꾸는지, 그리고 Operator가 containe
2026-08-27 · 20 분 읽기 #kubernetes#gpu#nvidia#containerd#helm세 줄짜리 설정 파일이 GPU 4장을 일주일 동안 죽였다 — containerd 드롭인 병합의 진실
노드가 GPU를 광고하지 않았습니다. 설정 파일에는 nvidia 런타임이 멀쩡히 적혀 있는데 containerd config dump에는 없었습니다. 범인은 일주일 전에 넣은 세 줄짜리 레지스트리 설정이었고, 이유는 containerd의 imports 병합이 필드 단위가 아니라 플러그인 단위 통째 교체이기 때문이었습니다. 두 번 잘못 진단한 과정과, 결국 답을 준 실험을 그대로 옮깁니다.
2026-08-26 · 20 분 읽기 #kubernetes#containerd#gpu#nvidia#troubleshootingMIG와 time-slicing — GPU 한 장을 여럿이 쓰는 두 가지 방법
GPU 한 장에 여러 워크로드를 올리는 방법은 크게 두 가지입니다. 시간을 나누는 time-slicing과 하드웨어를 나누는 MIG인데, 이름이 비슷해 보이는 것과 달리 격리 수준이 전혀 다릅니다. 이 글은 NVIDIA GPU Operator 공식 문서를 기준으로 두 방식의 설정 파일 구조와 노드 라벨, 광고되는 리소스 이름, 지원 하드웨어 조건을 정리하고, time-slicing 복제본 사
2026-08-12 · 12 분 읽기 #gpu#kubernetes#mig#time-slicing#nvidiaDCGM Exporter — GPU 이용률은 당신이 생각하는 그것이 아니다
DCGM Exporter는 GPU 텔레메트리를 프로메테우스 형식으로 노출하는 표준 경로지만, 가장 많이 대시보드에 올라가는 GPU 이용률 계열 메트릭은 사람들이 기대하는 것을 재지 않습니다. 이 글은 dcgm-exporter 저장소의 기본 카운터 CSV와 DCGM 공식 문서, NVML API 문서를 직접 읽고 기본으로 켜져 있는 메트릭 목록, 이용률 메트릭이 실제로 무엇을 뜻하는지, 함께 봐
2026-08-12 · 17 분 읽기 #gpu#kubernetes#dcgm#prometheus#observabilityGPU 장애 진단 플레이북 — 계층을 정해 놓고 내려간다
쿠버네티스에서 GPU 문제를 진단할 때 가장 큰 낭비는 순서 없이 아무 데나 찔러 보는 것입니다. 파드가 스케줄되지 않는 것, 파드는 떴는데 GPU가 안 보이는 것, 드라이버와 툴킷 버전이 어긋난 것, 메모리가 부족한 것, 노드에서 GPU가 사라지는 것은 서로 다른 계층의 문제라 확인 순서가 다릅니다. 이 글은 NVIDIA GPU Operator 공식 트러블슈팅 문서와 dcgm-exporte
2026-08-12 · 14 분 읽기 #gpu#kubernetes#troubleshooting#nvidia#gpu-operator디바이스 플러그인과 GPU 스케줄링 — nvidia.com/gpu는 어디서 오는가
쿠버네티스는 GPU를 모릅니다. 노드가 GPU를 자원으로 광고하게 만드는 것은 kubelet에 등록된 디바이스 플러그인이고, 그 결과로 생기는 이름이 확장 리소스 nvidia.com/gpu입니다. 이 글은 디바이스 플러그인이 구현해야 하는 gRPC 인터페이스와 등록 소켓 경로, 확장 리소스에서 requests와 limits가 반드시 같아야 하는 이유, GPU를 CPU처럼 밀리코어로 쪼갤 수
2026-08-12 · 11 분 읽기 #gpu#kubernetes#device-plugin#scheduling#nvidiaNVIDIA GPU Operator 소개 — 원래 손으로 깔아야 했던 여섯 조각
쿠버네티스에서 GPU를 쓰려면 드라이버, NVIDIA Container Toolkit, 디바이스 플러그인, DCGM, GPU Feature Discovery, Node Feature Discovery를 노드마다 손으로 맞춰야 했습니다. NVIDIA GPU Operator는 이 조각들을 하나의 오퍼레이터로 묶고 ClusterPolicy 하나로 상태를 관리합니다. 각 컴포넌트가 정확히 무엇을 하
2026-08-12 · 11 분 읽기 #gpu#kubernetes#gpu-operator#nvidia#dcgmAMD와 NVIDIA, 무엇이 다른가 — 하드웨어보다 스택이 문제인 이유
AMD GPU와 NVIDIA GPU의 차이를 하드웨어 구조, 소프트웨어 스택, 이식 경로, 생태계 성숙도의 네 층위로 나눠 감정 없이 정리합니다. SM과 CU, 텐서 코어와 매트릭스 코어의 대응 관계부터, 워프 32와 웨이브프론트 64가 코드에 실제로 어떤 버그를 만드는지 구체적으로 다룹니다. HIPIFY가 자동으로 옮겨 주는 것과 반드시 손으로 고쳐야 하는 것을 구분하고, cuBLAS와 r
2026-08-02 · 27 분 읽기 #amd#rocm#hip#nvidia#cudaRust 1.97이 Volta 이전 GPU를 잘라냈다 — nvptx64 베이스라인 상향의 내막
Rust 1.97(2026년 7월 9일)은 nvptx64-nvidia-cuda 타깃의 최소 사양을 PTX ISA 7.0(CUDA 11 드라이버 이상)과 SM 7.0(Volta 이상)으로 올렸습니다. Maxwell·Pascal 세대 GPU와 CUDA 10 이하 드라이버는 이제 대상이 아닙니다. 이 글은 실제로 바뀐 숫자, 컴파일러 팀이 근거로 든 세 개의 구체적인 결함(디버그 심볼·아토믹 순서
2026-07-16 · 21 분 읽기 #rust#cuda#gpu#compiler#nvidiaKubeVirt GPU 패스스루 VM은 왜 112일간 스케줄되지 못했나 — 실제 클러스터 부검
Rust 오퍼레이터가 "GPU 노드 4개 전부 NotReady"라는 진단을 내린 뒤, 그 죽음의 원인을 실제 8노드 클러스터(GPU Operator v25.3.0, KubeVirt v1.7.0)에서 끝까지 추적했습니다. gpu-fedora와 rhel9-gpu-vm이 112일간 ErrorUnschedulable로 멈춰 있던 진짜 이유는 화려한 GPU 설정이 아니라 kubelet 한 줄 에러 —
2026-07-11 · 8 분 읽기 #kubevirt#gpu#kubernetes#nvidia#devopsGPU Operator × KubeVirt 총정리 — 구성요소·설정·버전, 부분 MIG와 수동 MIG까지
쿠버네티스 GPU 인프라의 두 기둥을 한 장에 정리합니다. GPU Operator의 오퍼랜드 구성과 ClusterPolicy 설정, 버전 체계와 함께, 노드의 일부 GPU에만 MIG를 적용하는 커스텀 설정과 nvidia-smi로 MIG를 수동 생성·삭제하는 방법을 다루고, VM을 쿠버네티스에서 돌리는 KubeVirt의 4대 컴포넌트(virt-operator·controller·handler·
2026-07-09 · 14 분 읽기 #kubernetes#gpu#kubevirt#mig#nvidiaNVIDIA GPU Operator 완전 정복 — 설치·배포부터 MIG 분할 설정까지
쿠버네티스에서 GPU 노드를 손으로 셋업하는 시대는 끝났습니다. NVIDIA GPU Operator가 드라이버부터 디바이스 플러그인, 모니터링까지 전부 오퍼레이터 패턴으로 관리하는 원리와 Helm 설치·검증 방법, 그리고 A100/H100 한 장을 하드웨어 격리된 여러 GPU로 쪼개 쓰는 MIG의 개념·single/mixed 전략·노드 라벨 기반 설정·커스텀 프로필·운영 주의사항까지, 실제
2026-07-07 · 15 분 읽기 #kubernetes#gpu#nvidia#mig#devopsCUDA 아키텍처 시각화 — 스레드부터 텐서코어까지
CUDA의 실행 모델과 GPU 하드웨어 구조를 다이어그램으로 한눈에 정리합니다. 그리드·블록·워프·스레드 계층, SM 내부 구조, 메모리 계층, 워프 스케줄링과 점유율, 텐서코어, 스트림까지 핵심 개념을 그림과 커널 예제로 살펴봅니다.
2026-06-27 · 30 분 읽기 #cuda#gpu#tensor-core#warp#memory-hierarchyAI 버블인가 혁명인가 — 2026년의 논쟁을 정리하다
2026년 6월 현재 AI 주식 랠리를 둘러싼 버블 논쟁을 균형 있게 정리합니다. 밸류에이션·capex·수익화 지연·순환 매출 같은 우려와 실수요·생산성 향상 같은 반론을 닷컴 버블과 비교하며 데이터, 시나리오, 체크포인트로 살펴봅니다.
2026-06-18 · 46 분 읽기 #ai#investing#bubble#nvidia#valuation커스텀 ASIC vs GPU — 칩 전쟁의 투자 관점
클라우드 사업자의 자체 칩(커스텀 ASIC) 부상과 추론 시장의 변화를 투자 관점에서 분석합니다. 엔비디아의 해자와 그에 대한 도전, 밸류체인 수혜 지도, 그리고 핵심 리스크를 균형 있게 정리합니다.
2026-06-18 · 39 분 읽기 #asic#gpu#semiconductor#investing#nvidia2026년 6월 AI 랠리의 롤러코스터 — 반도체 급락과 반등 분석
2026년 6월 초 반도체 종목의 급락과 빠른 반등을 정리합니다. 변동성의 원인, 강세와 약세 시각, 그리고 변동성에 대응하는 원칙을 균형 있게 살펴봅니다. 본 글은 정보 제공 목적이며 투자 권유가 아닙니다.
2026-06-18 · 12 분 읽기 #finance#ai-rally#semiconductor#volatility#nvidia엔비디아 5조 달러 — AI 인프라 사이클은 어디까지 왔나
엔비디아가 시가총액 5조 달러를 사상 처음 돌파했습니다. 이 글은 AI 인프라 자본지출 사이클이 지금 어디쯤 와 있는지를 데이터로 짚고, 강세론과 약세론, 공급망 병목과 리스크를 균형 있게 정리합니다.
2026-06-18 · 16 분 읽기 #finance#nvidia#ai-infrastructure#capex#semiconductors2026년 6월 AI 랠리의 롤러코스터 — 반도체 급락과 반등 분석
2026년 6월 초 반도체주가 급락했다가 빠르게 반등한 과정을 데이터로 정리합니다. 변동성의 원인을 밸류에이션, 실적, 금리 관점에서 살펴보고 강세와 약세 시각, 그리고 변동성 대응 원칙을 균형 있게 다룹니다.
2026-06-18 · 20 분 읽기 #finance#ai-rally#semiconductors#volatility#nvidiaAI 반도체 공급망과 시장 — 누가 칩을 만드는가 (2026)
AI 칩 한 장이 만들어지기까지의 가치사슬을 설계, EDA, IP, 파운드리, 패키징, HBM, 장비로 나누어 짚어 봅니다. TSMC와 삼성, ASML의 EUV, CoWoS 병목, 지정학과 수출통제, 클라우드 자체 칩의 부상, 그리고 2026년 투자 사이클 논쟁까지 누가 칩을 만드는지를 정리합니다.
2026-06-16 · 38 분 읽기 #gpu-cuda#ai-hardware#semiconductor#supply-chain#tsmc로보틱스 개발 ROS 2 2026 — Nav2 / MoveIt / Gazebo / Isaac Sim / MuJoCo / LeRobot / GR00T 심층 가이드
2026년의 로보틱스 개발은 더 이상 ROS 1과 Gazebo Classic의 세계가 아니다. ROS 2 Jazzy/Kilted/Lyrical이 1년 주기 LTS 케이던스를 굳혔고, Nav2와 MoveIt 2가 사실상 표준이 되었으며, Gazebo Harmonic이 클래식의 뒤를 이었다. NVIDIA Isaac Sim 5.0과 GR00T가 휴머노이드의 데이터 부족을 시뮬레이션으로 풀고, Mu
2026-05-15 · 45 분 읽기 #robotics#ros2#nav2#moveit#gazebo