タグ: #gqa
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 3 件
アテンションの変種 — MHA から MLA まで、KV キャッシュはどう縮むか
MHA、MQA、GQA、MLA を実際の config 値で比較します。Qwen3、Mixtral、GLM-4.5 のグループクエリアテンションと、DeepSeek-V3、Kimi K2 の潜在アテンションがトークンあたりの KV キャッシュを何倍縮めるのかを式と数字で計算し、その代償に何を差し出すのかを整理します。
2026-08-12 · 10 分で読めます #ai-papers#model-internals#attention#gqa#mlaアテンションの進化 — MQA、GQA、FlashAttention、そして長いコンテキスト
標準アテンションのメモリと演算コストを分析し、MQAとGQAがKV cacheをどう削減するか、FlashAttentionがIOをどう最適化するかを説明します。スライディングウィンドウや長コンテキスト手法を比較し、これらの選択がサービングメモリに与える影響までたどります。
2026-06-26 · 28 分で読めます #llm#attention#flashattention#gqa#mqaKV Cache 最適化 深層分析: GQA・MLA・MHA アテンションメカニズムとメモリ効率化戦略
Transformer Self-AttentionのKV Cache基本原理からMHA、MQA、GQA(Llama 2/3)、MLA(DeepSeek-V2/V3)メカニズムのメモリ分析と比較、KV Cache圧縮技法(量子化、エビクションポリシー、スライディングウィンドウ)、PagedAttention(vLLM)実装、PyTorchコード例、OOM障害事例と最適化チェックリストを解説します。
2026-03-11 · 22 分で読めます #ai-papers#kv-cache#attention-mechanism#gqa#mla