태그: #self-attention
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3 편
Transformer 구조 완전 해부 — Attention부터 KV Cache까지
Transformer의 self-attention, 멀티헤드, 위치 인코딩, FFN, 잔차 연결과 정규화를 처음부터 분해해 설명합니다. 텐서 shape와 파라미터 수 계산, causal mask, 인코더/디코더 구조, 그리고 추론 단계의 KV cache까지 연결해 전체 그림을 그립니다.
2026-06-26 · 26 분 읽기 #llm#transformer#attention#positional-encoding#kv-cacheTransformer 아키텍처 완전 가이드 2025: Self-Attention, Positional Encoding, Multi-Head, GPT vs BERT — ChatGPT 뒤의 수학
ChatGPT, Claude, Gemini의 공통 기반인 Transformer를 완전 분석. Attention 메커니즘, positional encoding, multi-head, encoder vs decoder, GPT와 BERT의 차이까지 — Transformer의 모든 것을 720줄로 수학과 함께 파헤친다.
2026-04-15 · 29 분 읽기 #transformer#attention#self-attention#gpt#bertVision Transformer(ViT) 논문 완벽 분석: 이미지 한 장은 16x16 단어의 가치가 있다
Google의 ViT 논문을 심층 분석한다. 이미지를 패치 시퀀스로 변환하는 혁신적 접근, Patch Embedding과 Position Embedding의 원리, CNN 대비 성능과 데이터 효율성 트레이드오프, 그리고 DeiT, Swin Transformer, BEiT 등 후속 연구까지 총정리한다.
2026-03-01 · 45 분 읽기 #vit#vision-transformer#computer-vision#transformer#image-classification