タグ: #attention-mechanism
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 2 件
KV Cache 最適化 深層分析: GQA・MLA・MHA アテンションメカニズムとメモリ効率化戦略
Transformer Self-AttentionのKV Cache基本原理からMHA、MQA、GQA(Llama 2/3)、MLA(DeepSeek-V2/V3)メカニズムのメモリ分析と比較、KV Cache圧縮技法(量子化、エビクションポリシー、スライディングウィンドウ)、PagedAttention(vLLM)実装、PyTorchコード例、OOM障害事例と最適化チェックリストを解説します。
2026-03-11 · 22 分で読めます #ai-papers#kv-cache#attention-mechanism#gqa#mlaFlashAttention 論文分析: IO-Aware Exact AttentionによるTransformer学習・推論速度の革新
FlashAttentionシリーズ(v1〜v3)の中核論文を分析します。IO-Awareアルゴリズムのタイリング戦略、GPU SRAM/HBMメモリ階層の活用、逆伝播のrecomputation、FlashAttention-2の並列化改善、FlashAttention-3のFP8対応と非同期パイプラインまで、実践ベンチマークとともに解説します。
2026-03-09 · 32 分で読めます #ai-papers#flash-attention#transformer#gpu-optimization#attention-mechanism