태그: #flash-attention
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 7 편
LLM 랜드마크 논문 2026 완벽 가이드 - Transformer · Scaling Laws · Flash Attention · Mamba · DeepSeek-R1 · Titans 심층 분석
2017년 Attention Is All You Need에서 2026년 Titans와 DeepSeek-R1까지, LLM 시대를 만든 50여 편의 랜드마크 논문을 테마별로 정리한다. Transformer · BERT · GPT 시리즈 · Scaling Laws · Chinchilla · InstructGPT · PaLM · Flash Attention 1/2/3 · LLaMA 1/2/3/4 ·
2026-05-16 · 34 분 읽기 #llm-papers#transformer#scaling-laws#flash-attention#mamba행렬이 GPU에서 어떻게 날아다니는가: GEMM부터 FlashAttention까지 완전 해부
딥러닝 연산의 80% 이상을 차지하는 행렬 곱셈이 GPU에서 어떻게 최적화되는가. 순진한 O(n³) 구현부터 캐시 블로킹, cuBLAS, 그리고 FlashAttention의 IO-aware 혁신까지 완전 해부한다.
2026-03-18 · 22 분 읽기 #gemm#행렬곱셈#flash-attention#gpu#병렬컴퓨팅LLM 서빙 최적화 완전 가이드: KV Cache, PagedAttention, 양자화의 모든 것
LLM 서빙의 핵심 최적화 기술을 완전 해부한다. KV Cache의 메모리 문제부터 PagedAttention의 가상 메모리 혁신, 연속 배칭, 추측 디코딩, 양자화, 그리고 vLLM/TGI/TensorRT-LLM 비교까지.
2026-03-18 · 48 분 읽기 #LLM서빙#KV캐시#paged-attention#vllm#양자화LLM 사전 학습 & 스케일링 법칙: Chinchilla, Flash Attention, MoE까지
Chinchilla 스케일링 법칙, Common Crawl 데이터 준비, Flash Attention 2, GQA, MoE 아키텍처부터 DeepSeek-V3, Llama 3.1 사전 학습 레시피까지 LLM 사전 학습 완전 가이드입니다.
2026-03-17 · 22 분 읽기 #llm-pretraining#scaling-laws#chinchilla#flash-attention#mixtralmoeCUDA GPU 프로그래밍 심화: Warp 최적화, Tensor Core, Triton 커널 작성까지
CUDA 메모리 계층, Warp 최적화, Tensor Core WMMA API, Flash Attention 구현, Triton 커스텀 커널 작성까지 AI 모델 학습 가속화를 위한 GPU 프로그래밍 심화 가이드입니다.
2026-03-17 · 26 분 읽기 #cuda#gpu-programming#tensorcore#triton#flash-attentionFlashAttention 논문 분석: IO-Aware Exact Attention으로 Transformer 학습·추론 속도 혁신
FlashAttention 시리즈(v1~v3) 핵심 논문 분석. IO-Aware 알고리즘의 tiling 전략, GPU SRAM/HBM 메모리 계층 활용, 역전파 recomputation, FlashAttention-2의 병렬화 개선, FlashAttention-3의 FP8 지원과 비동기 파이프라이닝까지 실전 벤치마크와 함께 다룹니다.
2026-03-09 · 34 분 읽기 #ai-papers#flash-attention#transformer#gpu-optimization#attention-mechanismFlashAttention: GPU 메모리 계층을 활용한 어텐션 최적화 분석
FlashAttention 논문을 리뷰하고, GPU HBM/SRAM 메모리 계층을 활용한 IO-aware 어텐션 최적화 원리를 상세 분석한다.
2026-03-01 · 27 분 읽기 #ai-papers#flash-attention#gpu#optimization#transformer