태그: #cuda
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 24 편
GPU 커널을 직접 손본다는 것 — 전치 커널 하나를 5배 빠르게 만들기까지
GPU 커널을 직접 수정한다는 것이 실제로 무엇을 뜻하는지, 스레드와 워프와 메모리 계층부터 짚습니다. 점유율이 왜 목표가 아니라 증상인지, 그리고 대부분의 커널이 연산이 아니라 메모리 대역폭에 묶여 있다는 사실을 루프라인 관점에서 설명합니다. 행렬 전치 커널 하나를 naive에서 코얼레싱, 셰어드 메모리 타일링, 뱅크 충돌 제거까지 네 단계로 고치면서 각 단계의 유효 대역폭을 직접 재는 하
2026-08-02 · 32 분 읽기 #cuda#gpu-kernel#nsight-compute#memory-bandwidth#performanceAMD와 NVIDIA, 무엇이 다른가 — 하드웨어보다 스택이 문제인 이유
AMD GPU와 NVIDIA GPU의 차이를 하드웨어 구조, 소프트웨어 스택, 이식 경로, 생태계 성숙도의 네 층위로 나눠 감정 없이 정리합니다. SM과 CU, 텐서 코어와 매트릭스 코어의 대응 관계부터, 워프 32와 웨이브프론트 64가 코드에 실제로 어떤 버그를 만드는지 구체적으로 다룹니다. HIPIFY가 자동으로 옮겨 주는 것과 반드시 손으로 고쳐야 하는 것을 구분하고, cuBLAS와 r
2026-08-02 · 27 분 읽기 #amd#rocm#hip#nvidia#cuda커널을 쓰는 세 가지 층위 — CUDA C++, Triton, CUTLASS를 같은 문제로 비교하기
같은 GPU 커널을 손으로 쓰는 CUDA C++, 파이썬으로 타일 단위로 쓰는 Triton, 템플릿으로 조립하는 CUTLASS와 CuTe로 각각 접근할 때 무엇이 달라지는지 비교합니다. 행 단위 softmax를 CUDA C++와 Triton으로 실제로 짜서 코드량과 성능을 나란히 재고, 그 차이가 어디서 오는지 컴파일 파이프라인 수준에서 설명합니다. Triton이 커스텀 어텐션 커널의 사실상
2026-08-02 · 28 분 읽기 #triton#cuda#cutlass#gpu-kernel#compilerRust 1.97이 Volta 이전 GPU를 잘라냈다 — nvptx64 베이스라인 상향의 내막
Rust 1.97(2026년 7월 9일)은 nvptx64-nvidia-cuda 타깃의 최소 사양을 PTX ISA 7.0(CUDA 11 드라이버 이상)과 SM 7.0(Volta 이상)으로 올렸습니다. Maxwell·Pascal 세대 GPU와 CUDA 10 이하 드라이버는 이제 대상이 아닙니다. 이 글은 실제로 바뀐 숫자, 컴파일러 팀이 근거로 든 세 개의 구체적인 결함(디버그 심볼·아토믹 순서
2026-07-16 · 21 분 읽기 #rust#cuda#gpu#compiler#nvidia확산 LLM이 CUDA 커널을 쓴다 — DICE와 왜 병렬 생성이 도움이 되는가
DICE는 2026년 2월 프리프린트로, 확산(diffusion) 대규모 언어 모델이 CUDA 커널 생성에서 같은 규모의 자기회귀(autoregressive) 모델을 능가하고 새로운 최고 성능(SOTA)을 세웠다고 주장합니다. 핵심 아이디어는 토큰을 왼쪽에서 오른쪽으로 하나씩 쓰는 대신, 전체 시퀀스를 병렬로 생성하고 어느 위치든 비순차적으로 고쳐 쓸 수 있다는 것 — 전역 구조가 중요한 코
2026-07-11 · 12 분 읽기 #ai#llm#diffusion#cuda#gpuCUDA 아키텍처 시각화 — 스레드부터 텐서코어까지
CUDA의 실행 모델과 GPU 하드웨어 구조를 다이어그램으로 한눈에 정리합니다. 그리드·블록·워프·스레드 계층, SM 내부 구조, 메모리 계층, 워프 스케줄링과 점유율, 텐서코어, 스트림까지 핵심 개념을 그림과 커널 예제로 살펴봅니다.
2026-06-27 · 30 분 읽기 #cuda#gpu#tensor-core#warp#memory-hierarchyGPU vs TPU vs ASIC — 2026 추론 전쟁
2026년 추론 워크로드를 두고 벌어지는 GPU·TPU·ASIC의 경쟁을 비교합니다. Google TPU v6 Trillium과 Ironwood, 급성장하는 클라우드 자체 추론 ASIC, 처리량·지연·비용·전력 트레이드오프, 그리고 CUDA와 XLA로 갈라지는 컴파일러 스택까지 다룹니다.
2026-06-16 · 43 분 읽기 #gpu#tpu#asic#inference#ai-hardware분산 학습 & GPU 인프라 2026 딥다이브 — DeepSpeed, FSDP2, Megatron-LM, Ray Train, JAX, TorchTitan, Blackwell GB200, MI325X, TPU v5p 총정리
DeepSpeed/FSDP2/Megatron-LM/Ray Train/JAX/TorchTitan/Composer를 비교하고, NVIDIA Blackwell GB200 NVL72, AMD MI325X, Intel Gaudi 3, AWS Trainium 2, Google TPU v5p/v6e Trillium까지. 3D 병렬화, ZeRO-FSDP 등가성, MoE All-to-All, fp8/mxfp
2026-05-16 · 23 분 읽기 #distributed-training#deepspeed#fsdp#megatron-lm#rayFlashAttention & Efficient Attention Deep Dive — Tiling, Online Softmax, PagedAttention, GQA 완전 정복 (2025)
LLaMA 3, GPT-4, Claude 같은 대형 모델을 효율적으로 훈련하고 서빙 가능하게 만든 핵심 최적화, FlashAttention과 그 후속 기법들. 이 글은 efficient attention을 처음부터 해부합니다. Naive attention의 O(N²) 메모리 문제, Tri Dao의 2022년 IO-aware 통찰, Tiling과 Online Softmax, SRAM vs HB
2026-04-15 · 32 분 읽기 #flashattention#attention#llm#transformer#gpuCUDA GPU 프로그래밍 모델 Deep Dive — SIMT, 메모리 계층, Tensor Core, 커널 최적화 완전 정복 (2025)
ChatGPT, Stable Diffusion, Sora를 돌리는 엔진, NVIDIA GPU와 CUDA. 이 글은 CUDA 프로그래밍 모델을 처음부터 해부합니다. GPU 하드웨어 아키텍처(SM, Warp, CUDA Core), SIMT vs SIMD, 스레드 계층(Grid/Block/Thread), 메모리 계층(Global/Shared/Constant/Register), Memory Coal
2026-04-15 · 36 분 읽기 #cuda#gpu#nvidia#ai#machine-learning반도체 심화 — CPU, GPU, RAM, ASIC, CUDA 구조 완전 가이드
CPU는 어떻게 명령어를 실행하고, RAM은 어떻게 데이터를 저장하며, GPU/CUDA는 왜 AI에 필수인가? 반도체의 원리부터 ASIC 주문형 반도체까지 깊이 파헤칩니다.
2026-04-10 · 39 분 읽기 #ai#semiconductor#cpu#gpu#cudaGPU Software Engineer 합격 가이드: CUDA 아키텍처부터 vGPU/MIG, InfiniBand, K8s GPU 스케줄링까지 시스템 최적화 완전 정복
LG유플러스 GPU Software Engineer JD를 완전 분석합니다. GPU 연산 구조, 메모리 계층, CUDA 프로그래밍, vGPU/MIG 가상화, InfiniBand/RDMA 네트워킹, K8s GPU Device Plugin, 대규모 클러스터 최적화까지 — 희소한 GPU 시스템 엔지니어가 되기 위한 딥다이브 + 면접 질문 30선 + 10개월 학습 로드맵.
2026-03-23 · 76 분 읽기 #gpu#cuda#system-software#virtualization#vgpuNVIDIA GPU와 CUDA 완전 해부: 왜 GPU가 AI를 지배하는가
H100 스펙부터 Tensor Core WMMA API까지. SIMT 실행 모델, 공유 메모리 타일링, Warp divergence를 실제 CUDA 코드와 함께 완전 해부한다.
2026-03-18 · 22 분 읽기 #cuda#gpu#nvidia#행렬연산#병렬컴퓨팅AI를 위한 GPU 하드웨어 완전 가이드: 아키텍처부터 선택 기준까지
AI 연구와 학습을 위한 GPU 하드웨어 완전 가이드. NVIDIA GPU 아키텍처(Hopper, Blackwell), Tensor Core, NVLink, HBM 메모리, A100/H100/H200/B200 비교, 클라우드 GPU 옵션까지 상세히 다룹니다.
2026-03-17 · 39 분 읽기 #gpu#hardware#nvidia#cuda#gpu-cudaCUDA 프로그래밍 완전 정복: GPU 병렬 컴퓨팅 Zero to Hero
CUDA 프로그래밍의 기초부터 고급 최적화까지 완전히 마스터하는 가이드. GPU 아키텍처 이해, 커널 작성, 메모리 최적화, 혼합 정밀도 학습, cuDNN/cuBLAS 활용까지 실전 예제와 함께 배웁니다.
2026-03-17 · 44 분 읽기 #cuda#gpu#gpu-cuda#parallel-computing#nvidiaCUDA GPU 프로그래밍 심화: Warp 최적화, Tensor Core, Triton 커널 작성까지
CUDA 메모리 계층, Warp 최적화, Tensor Core WMMA API, Flash Attention 구현, Triton 커스텀 커널 작성까지 AI 모델 학습 가속화를 위한 GPU 프로그래밍 심화 가이드입니다.
2026-03-17 · 26 분 읽기 #cuda#gpu-programming#tensorcore#triton#flash-attention딥러닝을 위한 Linux GPU 서버 완전 구축 가이드
NVIDIA 공식 문서를 기반으로 딥러닝 개발을 위한 Linux GPU 서버를 NVIDIA 드라이버부터 Docker GPU 환경까지 단계별로 구축하는 가이드를 정리한다.
2026-03-01 · 27 분 읽기 #linux#gpu#cuda#nvidia-driver#deep-learningNVIDIA GPU Operator 완벽 가이드: 구성요소, 설치, KubeVirt GPU 패스스루까지 총정리
NVIDIA GPU Operator의 아키텍처와 7대 핵심 구성요소(Driver, Container Toolkit, Device Plugin, DCGM, MIG Manager, Node Feature Discovery, GFD)의 역할을 상세히 분석하고, Helm 기반 설치, KubeVirt와의 GPU/vGPU 패스스루 통합, MIG 파티셔닝, 모니터링, 트러블슈팅까지 실전 가이드를 총정리한
2026-03-01 · 60 분 읽기 #gpu-operator#nvidia#kubernetes#kubevirt#gpuMulti-GPU 분산 학습 완전 가이드: DDP, FSDP, DeepSpeed
PyTorch 공식 문서 기반으로 Multi-GPU 분산 학습의 핵심인 DDP, FSDP, DeepSpeed ZeRO를 체계적으로 분석하고 실전 설정법을 정리한다.
2026-03-01 · 31 분 읽기 #gpu#cuda#distributed-training#deep-learning#pytorchCUDA Hands-on 완벽 가이드: GPU 컴퓨팅의 모든 것
NVIDIA CUDA의 기초 개념부터 GPU 아키텍처, C/C++ 커널 프로그래밍, 메모리 최적화, Python 연동(PyTorch, Numba, CuPy), Multi-GPU 학습, 프로파일링, 트러블슈팅까지 실전 중심으로 다루는 종합 가이드.
2026-03-01 · 64 분 읽기 #cuda#gpu#nvidia#deep-learning#machine-learning