태그: #attention
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 12 편
Qwen3.8-27B의 하이브리드 어텐션 — 64개 층 중 16개만 KV 캐시를 쌓는 구조
27B 모델이 26만 토큰 컨텍스트를 노트북에서 감당하는 이유는 파라미터 수가 아니라 층 구성에 있습니다. Qwen3.8-27B는 64개 층 중 48개를 선형 어텐션(Gated DeltaNet)으로, 16개만 일반 어텐션으로 배치해 KV 캐시가 자라는 층 자체를 4분의 1로 줄였습니다. 이 구조가 무엇을 아끼고 무엇을 잃는지, FP8 블록 양자화가 어디에 적용되는지, 그리고 로컬 추론을 검토
2026-08-14 · 15 분 읽기 #llm#inference#quantization#local-llm#attention어텐션 변형 — MHA에서 MLA까지, KV 캐시는 어떻게 줄어드는가
MHA, MQA, GQA, MLA를 실제 config 값으로 비교합니다. Qwen3, Mixtral, GLM-4.5의 그룹 쿼리 어텐션과 DeepSeek-V3, Kimi K2의 잠재 어텐션이 토큰당 KV 캐시를 몇 배 줄이는지 공식과 숫자로 계산하고, 그 대가로 무엇을 내주는지 정리합니다.
2026-08-12 · 10 분 읽기 #ai-papers#model-internals#attention#gqa#mlaHybrid SWA로 긴 컨텍스트 추론 최적화하기 — Xiaomi MiMo v2.5가 실제로 한 것
슬라이딩 윈도우 어텐션(SWA)과 풀 어텐션을 층별로 섞는 하이브리드 SWA는 긴 컨텍스트 추론의 KV 캐시 메모리와 연산량을 함께 줄이는 최근의 주류 설계입니다. Xiaomi가 공개한 MiMo v2.5 추론 최적화 글을 근거로, 하이브리드 SWA가 무엇이고 왜 중요한지, MiMo v2.5가 실제로 어떤 아키텍처와 시스템 엔지니어링을 했는지(70층 중 10층만 풀 어텐션, 윈도우 128, 이
2026-07-11 · 15 분 읽기 #ai#llm#inference#attention#optimization깊이 읽고 오래 생각하기 — 사색의 기술
끝없이 훑어보는 시대에 우리는 깊이 읽는 법을 조금씩 잃어가고 있다. 이 글은 얕은 읽기와 깊은 읽기의 차이, 인터넷이 우리 주의력에 남긴 흔적, 능동적 읽기와 통합적 읽기의 기술, 느린 사고와 다시 읽기의 가치, 그리고 고독과 지루함이 통찰의 토양이 되는 방식을 차분히 살펴본다. 목표는 죄책감이 아니라, 깊이 읽는 습관을 다시 세우는 구체적인 길이다.
2026-07-05 · 32 분 읽기 #learning#reading#reflection#attention도파민 디톡스의 진실 — 집중력 미신과 과학
도파민은 쾌락 물질이 아니라 동기와 예측의 신호입니다. 유행하는 도파민 디톡스의 과학적 근거를 따져보고, 자극 과잉 시대에 정말로 집중력에 도움이 되는 것이 무엇인지 근거 기반으로 유쾌하게 살펴봅니다.
2026-07-01 · 55 분 읽기 #culture#dopamine#attention#focus#neuroscienceTransformer 구조 완전 해부 — Attention부터 KV Cache까지
Transformer의 self-attention, 멀티헤드, 위치 인코딩, FFN, 잔차 연결과 정규화를 처음부터 분해해 설명합니다. 텐서 shape와 파라미터 수 계산, causal mask, 인코더/디코더 구조, 그리고 추론 단계의 KV cache까지 연결해 전체 그림을 그립니다.
2026-06-26 · 26 분 읽기 #llm#transformer#attention#positional-encoding#kv-cache어텐션의 진화 — MQA, GQA, FlashAttention, 그리고 긴 컨텍스트
표준 어텐션의 메모리와 연산 비용을 분석하고, MQA와 GQA가 KV cache를 어떻게 줄이는지, FlashAttention이 IO를 어떻게 최적화하는지 설명합니다. 슬라이딩 윈도우와 롱컨텍스트 기법, 그리고 이 모든 선택이 서빙 메모리에 미치는 영향까지 비교합니다.
2026-06-26 · 31 분 읽기 #llm#attention#flashattention#gqa#mqaTransformer 아키텍처 완전 가이드 2025: Self-Attention, Positional Encoding, Multi-Head, GPT vs BERT — ChatGPT 뒤의 수학
ChatGPT, Claude, Gemini의 공통 기반인 Transformer를 완전 분석. Attention 메커니즘, positional encoding, multi-head, encoder vs decoder, GPT와 BERT의 차이까지 — Transformer의 모든 것을 720줄로 수학과 함께 파헤친다.
2026-04-15 · 29 분 읽기 #transformer#attention#self-attention#gpt#bertFlashAttention & Efficient Attention Deep Dive — Tiling, Online Softmax, PagedAttention, GQA 완전 정복 (2025)
LLaMA 3, GPT-4, Claude 같은 대형 모델을 효율적으로 훈련하고 서빙 가능하게 만든 핵심 최적화, FlashAttention과 그 후속 기법들. 이 글은 efficient attention을 처음부터 해부합니다. Naive attention의 O(N²) 메모리 문제, Tri Dao의 2022년 IO-aware 통찰, Tiling과 Online Softmax, SRAM vs HB
2026-04-15 · 32 분 읽기 #flashattention#attention#llm#transformer#gpuLLM 완전 가이드 — Transformer·Attention·RLHF·RAG·Agent·Evaluation (Season 2 Ep 6, 2025)
LLM을 "프롬프트에 답하는 블랙박스"로만 쓰면 임계점에서 막힌다. Transformer의 Attention이 실제로 어떻게 토큰 관계를 계산하는지, Pre-training → SFT → RLHF → DPO 파이프라인이 왜 이 순서로 설계됐는지, RAG 1/2/3세대의 차이와 Agentic RAG의 본질, Agent 설계(ReAct, Plan-and-Execute, Multi-Agent)의
2026-04-15 · 19 분 읽기 #llm#transformer#attention#rlhf#dpoTransformer 아키텍처 완전 분석: Attention부터 최신 LLM까지
Transformer 아키텍처를 처음부터 완전히 이해하는 가이드. Self-Attention, Multi-Head Attention, Positional Encoding, Encoder-Decoder 구조부터 Flash Attention, RoPE, GQA까지 수식과 코드로 완벽히 설명합니다.
2026-03-17 · 36 분 읽기 #transformer#attention#deep-learning#nlp#aiAttention Is All You Need - Transformer 논문 완전 분석
Transformer 아키텍처의 핵심인 "Attention Is All You Need" 논문을 Self-Attention, Multi-Head Attention, Positional Encoding 등 핵심 메커니즘을 하나씩 분석한다.
2026-03-01 · 27 분 읽기 #ai-papers#transformer#deep-learning#attention