タグ: #mqa
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 1 件
アテンションの進化 — MQA、GQA、FlashAttention、そして長いコンテキスト
標準アテンションのメモリと演算コストを分析し、MQAとGQAがKV cacheをどう削減するか、FlashAttentionがIOをどう最適化するかを説明します。スライディングウィンドウや長コンテキスト手法を比較し、これらの選択がサービングメモリに与える影響までたどります。
2026-06-26 · 28 分で読めます #llm#attention#flashattention#gqa#mqa