태그: #gpu
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 74 편
KubeVirt GPU 패스스루 VM은 왜 112일간 스케줄되지 못했나 — 실제 클러스터 부검
Rust 오퍼레이터가 "GPU 노드 4개 전부 NotReady"라는 진단을 내린 뒤, 그 죽음의 원인을 실제 8노드 클러스터(GPU Operator v25.3.0, KubeVirt v1.7.0)에서 끝까지 추적했습니다. gpu-fedora와 rhel9-gpu-vm이 112일간 ErrorUnschedulable로 멈춰 있던 진짜 이유는 화려한 GPU 설정이 아니라 kubelet 한 줄 에러 —
2026-07-11 · 8 분 읽기 #kubevirt#gpu#kubernetes#nvidia#devopsRust로 쿠버네티스 GPU 오퍼레이터 만들기 — kube-rs로 실제 클러스터를 진단하다
8노드 실운영 홈랩 클러스터(k8s v1.32.5)를 상대로, kube-rs를 써서 GPU 오퍼레이터를 Rust로 직접 만들어 돌렸습니다. GpuInventory 커스텀 리소스를 정의하고, 두 개의 컨트롤러(노드 스캔→CR 상태 기록, 노드 감시→ConfigMap 갱신)를 한 바이너리로 띄워 클러스터 밖에서 실행했습니다. 그리고 오퍼레이터가 실제로 뱉은 결과 — GPU 노드 4개 중 Read
2026-07-11 · 10 분 읽기 #rust#kubernetes#operator#gpu#kube-rsGPU Operator × KubeVirt 총정리 — 구성요소·설정·버전, 부분 MIG와 수동 MIG까지
쿠버네티스 GPU 인프라의 두 기둥을 한 장에 정리합니다. GPU Operator의 오퍼랜드 구성과 ClusterPolicy 설정, 버전 체계와 함께, 노드의 일부 GPU에만 MIG를 적용하는 커스텀 설정과 nvidia-smi로 MIG를 수동 생성·삭제하는 방법을 다루고, VM을 쿠버네티스에서 돌리는 KubeVirt의 4대 컴포넌트(virt-operator·controller·handler·
2026-07-09 · 14 분 읽기 #kubernetes#gpu#kubevirt#mig#nvidia멀티 GPU·멀티노드 학습 플랫폼 총정리 — 프레임워크 지도부터 Slurm·Kubeflow 실전 가이드까지
GPU 여러 장, 노드 여러 대로 모델을 학습시키는 전체 지형을 한 장에 정리합니다. AI 라이브러리·프레임워크 생태계 지도(PyTorch·JAX·HuggingFace·DeepSpeed·Ray), 병렬화 전략(DDP·FSDP·ZeRO·TP·PP)을 언제 무엇으로 고르는지, torchrun 단일노드→멀티노드 확장, HPC의 표준 Slurm 사용 가이드(sbatch 스크립트와 멀티노드 torch
2026-07-09 · 13 분 읽기 #ai#ml#distributed-training#slurm#kubeflowNVIDIA GPU Operator 완전 정복 — 설치·배포부터 MIG 분할 설정까지
쿠버네티스에서 GPU 노드를 손으로 셋업하는 시대는 끝났습니다. NVIDIA GPU Operator가 드라이버부터 디바이스 플러그인, 모니터링까지 전부 오퍼레이터 패턴으로 관리하는 원리와 Helm 설치·검증 방법, 그리고 A100/H100 한 장을 하드웨어 격리된 여러 GPU로 쪼개 쓰는 MIG의 개념·single/mixed 전략·노드 라벨 기반 설정·커스텀 프로필·운영 주의사항까지, 실제
2026-07-07 · 15 분 읽기 #kubernetes#gpu#nvidia#mig#devopsCUDA 아키텍처 시각화 — 스레드부터 텐서코어까지
CUDA의 실행 모델과 GPU 하드웨어 구조를 다이어그램으로 한눈에 정리합니다. 그리드·블록·워프·스레드 계층, SM 내부 구조, 메모리 계층, 워프 스케줄링과 점유율, 텐서코어, 스트림까지 핵심 개념을 그림과 커널 예제로 살펴봅니다.
2026-06-27 · 30 분 읽기 #cuda#gpu#tensor-core#warp#memory-hierarchy커스텀 ASIC vs GPU — 칩 전쟁의 투자 관점
클라우드 사업자의 자체 칩(커스텀 ASIC) 부상과 추론 시장의 변화를 투자 관점에서 분석합니다. 엔비디아의 해자와 그에 대한 도전, 밸류체인 수혜 지도, 그리고 핵심 리스크를 균형 있게 정리합니다.
2026-06-18 · 39 분 읽기 #asic#gpu#semiconductor#investing#nvidia추론을 빠르게 — 양자화, 희소성, Dataflow의 하드웨어 관점
추론 비용의 구조를 메모리 월 관점에서 풀어내고, 양자화(INT8/FP8/FP4)와 구조적 희소성(2:4), dataflow 아키텍처, 연산자 융합, 배칭과 KV 캐시까지 하드웨어-소프트웨어 공동설계의 큰 그림을 정리합니다. 2026년 Blackwell FP4와 Vera Rubin 흐름을 반영해 실무 적용 포인트를 짚습니다.
2026-06-16 · 35 분 읽기 #inference#quantization#sparsity#dataflow#gpuGPU vs TPU vs ASIC — 2026 추론 전쟁
2026년 추론 워크로드를 두고 벌어지는 GPU·TPU·ASIC의 경쟁을 비교합니다. Google TPU v6 Trillium과 Ironwood, 급성장하는 클라우드 자체 추론 ASIC, 처리량·지연·비용·전력 트레이드오프, 그리고 CUDA와 XLA로 갈라지는 컴파일러 스택까지 다룹니다.
2026-06-16 · 43 분 읽기 #gpu#tpu#asic#inference#ai-hardware2026 AI 가속기 지형 — Blackwell에서 Vera Rubin까지
2026년 AI 가속기 시장을 한눈에 정리합니다. NVIDIA Blackwell과 차세대 Vera Rubin, AMD MI350X, 추론 capex가 학습을 처음 추월한 변화, 그리고 워크로드별로 어떤 칩을 골라야 하는지 개발자 관점에서 살펴봅니다.
2026-06-16 · 40 분 읽기 #ai-hardware#nvidia-blackwell#vera-rubin#inference#gpu로컬 LLM 인퍼런스 최적화 — 양자화부터 VRAM 한계 돌파까지
프라이버시와 비용, 그리고 빅테크 피로감 속에 로컬 LLM이 다시 뜨고 있습니다. VRAM 중심의 하드웨어 선택, GGUF와 AWQ 양자화, llama.cpp와 vLLM과 Ollama 비교, KV cache 메모리 산수, VRAM을 스왑으로 쓰는 역발상 해킹까지 로컬 인퍼런스 최적화의 전체 지도를 그립니다.
2026-06-12 · 29 분 읽기 #llm#inference#quantization#llama-cpp#vllm리눅스 메모리 계층 해킹 — swap, zram, 그리고 VRAM을 스왑으로 쓰는 역발상
GPU의 VRAM을 NBD 블록 디바이스로 노출해 스왑으로 쓰는 nbd-vram 프로젝트가 Hacker News에서 화제가 됐습니다. 이를 출발점으로 리눅스 메모리 관리의 기초, swappiness와 zram/zswap 튜닝, OOM 대응, cgroup v2 메모리 제어, 컨테이너 환경의 함정까지 실전 중심으로 정리합니다.
2026-06-12 · 28 분 읽기 #linux#memory#swap#zram#kernelAI는 정말 둔화하고 있는가 — 데이터센터 경제학으로 읽는 2026 AI 버블 논쟁
2026년 상반기를 달군 AI is slowing down 논쟁을 데이터센터 경제학의 관점에서 분해합니다. 2030년까지 연 2조 달러 매출이 필요하다는 주장과 190GW 데이터센터 계획의 산수, 토큰 단가 하락과 마진 구조, 추론 수요 폭증이라는 반론, 닷컴 버블과의 비교, 그리고 개발자와 기업이 취해야 할 실용적 전략까지 균형 있게 다룹니다.
2026-06-12 · 41 분 읽기 #ai#economics#datacenter#gpu#infrastructureAI 하드웨어 가속기 2026 — NVIDIA Blackwell / AMD Instinct MI400 / Google TPU Trillium / Cerebras WSE-3 / Groq LPU / Tenstorrent / Etched Sohu / Furiosa / Rebellions 심층 가이드
2026년 AI 하드웨어는 더 이상 NVIDIA 한 곳의 이야기가 아니다. Blackwell(B100/B200/GB200 NVL72/B300)이 GTC 2024에서 등장하고, 2026년 9월 Rubin이 예고된 가운데 AMD Instinct는 MI300X에서 MI355X를 거쳐 MI400 Helios까지 진격했다. Intel Gaudi 3가 마지막 별도 라인으로 출하되고 Falcon Shor
2026-05-16 · 27 분 읽기 #ai-hardware#gpu#accelerator#nvidia-blackwell#b100운영체제의 현대적 이해 — io_uring, cgroups/namespaces, eBPF, NUMA, GPU UVM, EEVDF, Zero-Copy 완벽 가이드 (2025)
epoll의 후계자 iouring, Docker를 만든 cgroups + namespaces, 커널에 안전하게 코드를 주입하는 eBPF, NUMA가 주는 숨은 비용, GPU 드라이버와 UVM, 2024년 Linux에 들어온 EEVDF 스케줄러, Zero-Copy + RDMA, WSL2. 앱 밑에서 OS가 하는 모든 일을 현대적 관점으로 한 번에 정리.
2026-04-15 · 18 분 읽기 #operating-systems#linux#io-uring#cgroups#namespacesRDMA 완전 가이드 2025: InfiniBand, RoCE, NCCL, GPU 통신 — AI 학습의 숨은 인프라
GPT-4가 10만 GPU로 학습될 수 있었던 비결. RDMA의 원리, InfiniBand와 RoCE, NVIDIA NCCL, GPU Direct까지 — AI 인프라의 숨은 기반을 720줄로 완전 분석한다.
2026-04-15 · 32 분 읽기 #rdma#infiniband#roce#nccl#gpuFlashAttention & Efficient Attention Deep Dive — Tiling, Online Softmax, PagedAttention, GQA 완전 정복 (2025)
LLaMA 3, GPT-4, Claude 같은 대형 모델을 효율적으로 훈련하고 서빙 가능하게 만든 핵심 최적화, FlashAttention과 그 후속 기법들. 이 글은 efficient attention을 처음부터 해부합니다. Naive attention의 O(N²) 메모리 문제, Tri Dao의 2022년 IO-aware 통찰, Tiling과 Online Softmax, SRAM vs HB
2026-04-15 · 32 분 읽기 #flashattention#attention#llm#transformer#gpu데이터·AI FinOps 2025 완전 정복: Snowflake·Databricks·BigQuery 비용 해부, 웨어하우스 튜닝으로 50% 절감, LLM·GPU 비용 관리, Reserved vs On-Demand, Showback·Chargeback, OpenCost·Vantage·CloudZero 비교, 탄소발자국
2025년 데이터·AI 조직의 생존을 좌우하는 FinOps의 모든 것. Snowflake·Databricks·BigQuery 비용 구조 해부, 웨어하우스 튜닝으로 50% 절감 실전 기법, Storage 계층화와 Iceberg 절감, Reserved Capacity vs On-Demand 선택, LLM·GPU 클러스터 비용 관리, OpenCost·Vantage·CloudZero 도구 비교, S
2026-04-15 · 23 분 읽기 #finops#data-cost#snowflake-cost#databricks-cost#bigquery-costCUDA GPU 프로그래밍 모델 Deep Dive — SIMT, 메모리 계층, Tensor Core, 커널 최적화 완전 정복 (2025)
ChatGPT, Stable Diffusion, Sora를 돌리는 엔진, NVIDIA GPU와 CUDA. 이 글은 CUDA 프로그래밍 모델을 처음부터 해부합니다. GPU 하드웨어 아키텍처(SM, Warp, CUDA Core), SIMT vs SIMD, 스레드 계층(Grid/Block/Thread), 메모리 계층(Global/Shared/Constant/Register), Memory Coal
2026-04-15 · 36 분 읽기 #cuda#gpu#nvidia#ai#machine-learning컴퓨터 아키텍처의 현대 — CPU 파이프라인·Out-of-Order·캐시·브랜치 예측·Meltdown·Apple Silicon·ARM·RISC-V·SIMD·GPU 심층 가이드 (2025)
왜 배열이 linked list를 이기는가, 왜 분기가 10배 느려지는가, M1이 Intel을 어떻게 이겼는가. CPU 파이프라인·Out-of-Order·L1~L3 캐시·브랜치 예측·Meltdown/Spectre·Apple Silicon·ARM/x86/RISC-V·SIMD·GPU SM/Warp·HBM/CXL까지 — 소프트웨어 엔지니어가 알아야 할 2025년 하드웨어 전부.
2026-04-15 · 28 분 읽기 #computer-architecture#cpu#cache#branch-prediction#apple-silicon