태그: #mqa
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 1 편
어텐션의 진화 — MQA, GQA, FlashAttention, 그리고 긴 컨텍스트
표준 어텐션의 메모리와 연산 비용을 분석하고, MQA와 GQA가 KV cache를 어떻게 줄이는지, FlashAttention이 IO를 어떻게 최적화하는지 설명합니다. 슬라이딩 윈도우와 롱컨텍스트 기법, 그리고 이 모든 선택이 서빙 메모리에 미치는 영향까지 비교합니다.
2026-06-26 · 31 분 읽기 #llm#attention#flashattention#gqa#mqa