태그: #transformer
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 33 편
Mixture of Experts(MoE) 아키텍처 심층 분석: Switch Transformer부터 Mixtral·DeepSeek까지
Mixture of Experts(MoE) 아키텍처를 심층 분석합니다. Sparse MoE의 수학적 기초부터 Switch Transformer, Mixtral 8x7B, DeepSeek-V3의 라우팅 전략, 학습 안정성 기법, 추론 최적화까지 논문 기반으로 상세히 다룹니다.
2026-03-10 · 23 분 읽기 #ai-papers#moe#transformer#mixtral#deepseekFlashAttention 논문 분석: IO-Aware Exact Attention으로 Transformer 학습·추론 속도 혁신
FlashAttention 시리즈(v1~v3) 핵심 논문 분석. IO-Aware 알고리즘의 tiling 전략, GPU SRAM/HBM 메모리 계층 활용, 역전파 recomputation, FlashAttention-2의 병렬화 개선, FlashAttention-3의 FP8 지원과 비동기 파이프라이닝까지 실전 벤치마크와 함께 다룹니다.
2026-03-09 · 34 분 읽기 #ai-papers#flash-attention#transformer#gpu-optimization#attention-mechanismRing Attention 논문 분석: 분산 환경에서 무한 컨텍스트 윈도우 트레이닝 구현
Ring Attention 논문을 분석하고 분산 환경에서 컨텍스트 길이 제한을 극복하는 방법을 탐구합니다. Blockwise Parallel Transformer와의 연결, 구현 세부사항, 성능 벤치마크, 그리고 프로덕션 적용 시 고려사항까지 다룹니다.
2026-03-08 · 55 분 읽기 #ai-papers#ring-attention#distributed-training#long-context#transformerLLM 롱 컨텍스트 성능과 KV Cache 최적화 완전 가이드: MQA에서 Ring Attention까지
LLM의 롱 컨텍스트 처리를 가능하게 하는 KV Cache의 원리부터 메모리 소비 분석, MQA·GQA·PagedAttention·슬라이딩 윈도우·Ring Attention 등 최적화 기법, 모델별 컨텍스트 윈도우 비교, Needle-in-a-Haystack 벤치마크까지 실무 관점에서 포괄적으로 다룹니다.
2026-03-07 · 26 분 읽기 #llm#kv-cache#long-context#multi-query-attention#grouped-query-attentionMamba와 State Space Model 논문 심층 분석: 선택적 SSM부터 Mamba-2까지 Transformer 대안 아키텍처
Mamba 논문의 선택적 State Space Model 메커니즘, S4에서 Mamba-2로의 발전 과정, Transformer 대비 선형 시간 복잡도의 장단점, 그리고 비전·오디오·시계열 분야 적용 사례까지 다루는 SSM 아키텍처 종합 분석.
2026-03-07 · 44 분 읽기 #ai-papers#mamba#state-space-model#ssm#transformer나만의 GPT 만들기 — nanoGPT로 처음부터 학습하는 언어 모델
Andrej Karpathy의 nanoGPT를 활용해 GPT 언어 모델을 처음부터 학습합니다. Transformer 아키텍처의 핵심 원리, 토크나이저, Self-Attention, 학습 루프까지 코드와 함께 완전 해부합니다.
2026-03-03 · 9 분 읽기 #ai#llm#gpt#nanogpt#transformerMamba 논문 리뷰: Selective State Space Models로 Transformer를 넘어서
Mamba(Selective State Space Models) 논문을 심층 리뷰한다. S4에서 Mamba까지의 발전 과정, Selective Scan 메커니즘, Hardware-Aware 알고리즘, 그리고 Mamba-2의 State Space Duality까지 코드와 함께 분석.
2026-03-02 · 11 분 읽기 #mamba#state-space-model#ssm#transformer#linear-attentionMamba: Linear-Time Sequence Modeling with Selective State Spaces 논문 분석
Transformer의 대안으로 주목받는 Mamba 아키텍처를 깊이 분석합니다. Selective State Space Model의 핵심 아이디어, 하드웨어 최적화 알고리즘, 실험 결과까지 논문의 주요 내용을 코드와 함께 살펴봅니다.
2026-03-02 · 11 분 읽기 #ai-papers#mamba#ssm#state-space-model#transformerFlashAttention: GPU 메모리 계층을 활용한 어텐션 최적화 분석
FlashAttention 논문을 리뷰하고, GPU HBM/SRAM 메모리 계층을 활용한 IO-aware 어텐션 최적화 원리를 상세 분석한다.
2026-03-01 · 27 분 읽기 #ai-papers#flash-attention#gpu#optimization#transformerGPT 시리즈 논문 완벽 분석: GPT-1부터 GPT-4까지, 언어 모델이 세상을 바꾸기까지의 여정
OpenAI의 GPT 시리즈를 세대별로 완벽 분석한다. GPT-1의 비지도 사전학습, GPT-2의 Zero-shot 학습, GPT-3의 In-context Learning과 Scaling Law, InstructGPT의 RLHF, GPT-4의 멀티모달까지 — 각 논문의 핵심 기여와 아키텍처 진화를 수식과 함께 정리한다.
2026-03-01 · 61 분 읽기 #gpt#openai#language-model#transformer#pre-trainingAttention Is All You Need - Transformer 논문 완전 분석
Transformer 아키텍처의 핵심인 "Attention Is All You Need" 논문을 Self-Attention, Multi-Head Attention, Positional Encoding 등 핵심 메커니즘을 하나씩 분석한다.
2026-03-01 · 27 분 읽기 #ai-papers#transformer#deep-learning#attentionVision Transformer(ViT) 논문 완벽 분석: 이미지 한 장은 16x16 단어의 가치가 있다
Google의 ViT 논문을 심층 분석한다. 이미지를 패치 시퀀스로 변환하는 혁신적 접근, Patch Embedding과 Position Embedding의 원리, CNN 대비 성능과 데이터 효율성 트레이드오프, 그리고 DeiT, Swin Transformer, BEiT 등 후속 연구까지 총정리한다.
2026-03-01 · 45 분 읽기 #vit#vision-transformer#computer-vision#transformer#image-classificationBERT 논문 완벽 분석: 양방향 Transformer가 NLP의 판도를 바꾼 방법
Google의 BERT 논문을 심층 분석한다. Masked Language Model(MLM)과 Next Sentence Prediction(NSP)을 통한 양방향 사전학습, Fine-tuning 전략, 그리고 11개 NLP 벤치마크를 석권한 아키텍처의 핵심 원리를 수식과 코드 예제로 정리한다.
2026-03-01 · 43 분 읽기 #bert#nlp#transformer#pre-training#fine-tuning