태그: #optimization
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 24 편
Speculative Decoding으로 LLM 추론 2~3배 빠르게: 원리부터 실전 구현까지
Speculative Decoding의 수학적 원리, Draft-Verify 파이프라인, 수용 확률 분석, vLLM/TensorRT-LLM에서의 실전 적용법, 그리고 Apple의 Mirror Speculative Decoding까지 심층 분석한다.
2026-03-02 · 9 분 읽기 #llm#speculative-decoding#inference#optimization#vllmLLM 추론 최적화: vLLM과 TensorRT-LLM 심층 분석
vLLM과 TensorRT-LLM 공식 문서를 기반으로 PagedAttention, Continuous Batching, 양자화 등 LLM 추론 최적화 핵심 기술을 분석한다.
2026-03-01 · 35 분 읽기 #llm#inference#vllm#tensorrt-llm#optimizationFlashAttention: GPU 메모리 계층을 활용한 어텐션 최적화 분석
FlashAttention 논문을 리뷰하고, GPU HBM/SRAM 메모리 계층을 활용한 IO-aware 어텐션 최적화 원리를 상세 분석한다.
2026-03-01 · 27 분 읽기 #ai-papers#flash-attention#gpu#optimization#transformerGPU 메모리 최적화와 Mixed Precision Training 완전 가이드
NVIDIA 공식 문서 기반으로 GPU 메모리 구성 요소를 분석하고, Mixed Precision Training, Gradient Checkpointing 등 메모리 최적화 기법을 정리한다.
2026-03-01 · 32 분 읽기 #gpu#cuda#mixed-precision#optimization#deep-learning