태그: #gpu
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 74 편
NVIDIA Triton Inference Server 프로덕션 가이드: GPU 모델 서빙 최적화 전략
NVIDIA Triton Inference Server를 활용한 GPU 모델 서빙 최적화 가이드. Dynamic Batching, Model Ensemble, TensorRT 통합, 멀티 모델 서빙, Kubernetes 배포, 성능 프로파일링과 프로덕션 트러블슈팅까지 다룹니다.
2026-03-08 · 44 분 읽기 #ai-platform#triton#inference-server#gpu#model-servingKubernetes DRA(Dynamic Resource Allocation)로 GPU 워크로드 스케줄링 최적화 가이드
Kubernetes DRA의 DeviceClass, ResourceClaim 기반 GPU 스케줄링 아키텍처와 MIG 파티셔닝, 멀티 클라우드 배포, 운영 트러블슈팅까지 다루는 실전 가이드.
2026-03-06 · 32 분 읽기 #kubernetes#dra#gpu#dynamic-resource-allocation#schedulingAI 메모리 슈퍼사이클의 정점: 2026년 반도체 시장을 뒤흔들 HBM의 5가지 결정적 모멘텀
HBM4의 16단 적층 기술, 커스텀 HBM(cHBM)의 등장, SK하이닉스·삼성·마이크론의 전략적 격돌, 메모리 슈퍼사이클의 시장 전망, HBM vs GDDR 비교까지 — 2026년 AI 반도체 시장의 핵심인 고대역폭 메모리(HBM)의 5가지 결정적 모멘텀을 심층 분석한다.
2026-03-01 · 53 분 읽기 #hbm#semiconductor#memory#ai-hardware#sk-hynixvLLM을 넘어선 새로운 왕좌: SGLang이 LLM 인퍼런스의 판도를 바꾸는 5가지 이유
SGLang의 RadixAttention 기반 KV 캐시 관리, 29% 처리량 우위의 하이퍼 스페셜라이즈드 설계, 4000라인 Python Zero-Overhead 스케줄러, Prefill-Decode Disaggregation, Compressed FSM 기반 구조화된 생성까지 — vLLM을 넘어 차세대 LLM 인퍼런스 표준으로 부상한 SGLang의 5가지 혁신을 심층 분석한다.
2026-03-01 · 52 분 읽기 #sglang#llm-inference#vllm#radix-attention#model-serving딥러닝을 위한 Linux GPU 서버 완전 구축 가이드
NVIDIA 공식 문서를 기반으로 딥러닝 개발을 위한 Linux GPU 서버를 NVIDIA 드라이버부터 Docker GPU 환경까지 단계별로 구축하는 가이드를 정리한다.
2026-03-01 · 27 분 읽기 #linux#gpu#cuda#nvidia-driver#deep-learningNVIDIA GPU Operator 완벽 가이드: 구성요소, 설치, KubeVirt GPU 패스스루까지 총정리
NVIDIA GPU Operator의 아키텍처와 7대 핵심 구성요소(Driver, Container Toolkit, Device Plugin, DCGM, MIG Manager, Node Feature Discovery, GFD)의 역할을 상세히 분석하고, Helm 기반 설치, KubeVirt와의 GPU/vGPU 패스스루 통합, MIG 파티셔닝, 모니터링, 트러블슈팅까지 실전 가이드를 총정리한
2026-03-01 · 60 분 읽기 #gpu-operator#nvidia#kubernetes#kubevirt#gpuKubernetes GPU 워크로드 관리: NVIDIA GPU Operator 완전 가이드
NVIDIA GPU Operator 공식 문서를 기반으로 Kubernetes 클러스터에서 GPU 리소스를 효율적으로 관리하고 AI 워크로드를 운영하는 방법을 분석한다.
2026-03-01 · 30 분 읽기 #kubernetes#gpu#nvidia#gpu-operator#aiMulti-GPU 분산 학습 완전 가이드: DDP, FSDP, DeepSpeed
PyTorch 공식 문서 기반으로 Multi-GPU 분산 학습의 핵심인 DDP, FSDP, DeepSpeed ZeRO를 체계적으로 분석하고 실전 설정법을 정리한다.
2026-03-01 · 31 분 읽기 #gpu#cuda#distributed-training#deep-learning#pytorchCUDA Hands-on 완벽 가이드: GPU 컴퓨팅의 모든 것
NVIDIA CUDA의 기초 개념부터 GPU 아키텍처, C/C++ 커널 프로그래밍, 메모리 최적화, Python 연동(PyTorch, Numba, CuPy), Multi-GPU 학습, 프로파일링, 트러블슈팅까지 실전 중심으로 다루는 종합 가이드.
2026-03-01 · 64 분 읽기 #cuda#gpu#nvidia#deep-learning#machine-learningSlurm 완전 정복: HPC/AI 클러스터 워크로드 매니저 실전 가이드
Slurm 워크로드 매니저를 완전 정복한다. 아키텍처(slurmctld/slurmd/slurmdbd), 핵심 개념(파티션/QoS/Fairshare), 필수 명령어(sbatch/srun/salloc), GPU 스케줄링(GRES/MIG/MPS), 다중 노드 분산 학습(PyTorch DDP/DeepSpeed/Horovod), 컨테이너 통합(Singularity/Enroot+Pyxis), 설정·모니
2026-03-01 · 17 분 읽기 #slurm#hpc#gpu#distributed-training#clusterFlashAttention: GPU 메모리 계층을 활용한 어텐션 최적화 분석
FlashAttention 논문을 리뷰하고, GPU HBM/SRAM 메모리 계층을 활용한 IO-aware 어텐션 최적화 원리를 상세 분석한다.
2026-03-01 · 27 분 읽기 #ai-papers#flash-attention#gpu#optimization#transformervLLM & Ollama 완벽 가이드: LLM 서빙 엔진의 구동, 파라미터, 환경변수 총정리
vLLM의 PagedAttention 아키텍처와 Ollama의 로컬 LLM 실행 환경을 심층 비교한다. 설치부터 서버 구동, API 호출, 주요 CLI 인자, 샘플링 파라미터, 환경변수, 양자화(AWQ/GPTQ/GGUF), 멀티 GPU 구성, Docker 배포, 성능 튜닝까지 — LLM 서빙에 필요한 모든 설정을 실전 예제와 함께 총정리한다.
2026-03-01 · 56 분 읽기 #vllm#ollama#model-serving#inference#gpuGPU 메모리 최적화와 Mixed Precision Training 완전 가이드
NVIDIA 공식 문서 기반으로 GPU 메모리 구성 요소를 분석하고, Mixed Precision Training, Gradient Checkpointing 등 메모리 최적화 기법을 정리한다.
2026-03-01 · 32 분 읽기 #gpu#cuda#mixed-precision#optimization#deep-learningCUDA 프로그래밍 기초: GPU 병렬 컴퓨팅 완전 가이드
NVIDIA 공식 문서 기반으로 CUDA 프로그래밍의 핵심 개념인 Thread 계층 구조, 메모리 모델, Kernel 작성법을 체계적으로 분석한다.
2026-03-01 · 35 분 읽기 #gpu#cuda#parallel-computing#nvidia