タグ: #flash-attention
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 7 件
LLM ランドマーク論文ロードマップ 2026 - Transformer / Scaling Laws / Flash Attention / Mamba / DeepSeek-R1 / Titans 徹底解説
2017年の Attention Is All You Need から 2026年の Titans と DeepSeek-R1 まで、LLM 時代を作った 50 篇超のランドマーク論文をテーマ別に整理する。Transformer、BERT、GPT 1-3、Scaling Laws、Chinchilla、InstructGPT、PaLM、FlashAttention 1-3、LLaMA 1-4、GPT-4、Mistral と Mixtra
2026-05-16 · 31 分で読めます #llm-papers#transformer#scaling-laws#flash-attention#mambaLLM サービング最適化完全ガイド:KVキャッシュ、PagedAttention、量子化のすべて
LLMサービングの核心最適化技術を完全解剖する。KVキャッシュのメモリ問題からPagedAttentionの仮想メモリ革新、連続バッチング、投機的デコーディング、量子化、そしてvLLM/TGI/TensorRT-LLMの比較まで。
2026-03-18 · 44 分で読めます #LLMサービング#KVキャッシュ#paged-attention#vllm#量子化行列はGPUでどう飛び回るか:GEMMからFlashAttentionまで完全解剖
深層学習演算の80%以上を占める行列乗算がGPU上でどのように最適化されるか。ナイーブなO(n³)実装からキャッシュブロッキング、cuBLAS、テンソルコア、そしてFlashAttentionのIO-aware革新まで完全に解剖する。
2026-03-18 · 17 分で読めます #gemm#行列乗算#flash-attention#gpu#並列コンピューティングLLM事前学習とスケーリング則:Chinchillaからフラッシュアテンション・MoEまで
Chinchillaスケーリング則、Common Crawlデータパイプライン、Flash Attention 2、GQA、MoEアーキテクチャから DeepSeek-V3・Llama 3.1の最新事前学習レシピまでを網羅したLLM事前学習完全ガイドです。
2026-03-17 · 20 分で読めます #LLM事前学習#スケーリング則#chinchilla#flash-attention#mixtralmoeCUDA GPU プログラミング上級編: Warp最適化、Tensor Core、Tritonカーネル作成まで
CUDAメモリ階層、Warp最適化、Tensor Core WMMA API、Flash Attention実装、Tritonカスタムカーネル作成まで、AIモデル学習高速化のためのGPUプログラミング上級ガイドです。
2026-03-17 · 23 分で読めます #cuda#GPUプログラミング#tensorcore#triton#flash-attentionFlashAttention 論文分析: IO-Aware Exact AttentionによるTransformer学習・推論速度の革新
FlashAttentionシリーズ(v1〜v3)の中核論文を分析します。IO-Awareアルゴリズムのタイリング戦略、GPU SRAM/HBMメモリ階層の活用、逆伝播のrecomputation、FlashAttention-2の並列化改善、FlashAttention-3のFP8対応と非同期パイプラインまで、実践ベンチマークとともに解説します。
2026-03-09 · 32 分で読めます #ai-papers#flash-attention#transformer#gpu-optimization#attention-mechanismFlashAttention: GPUメモリ階層を活用したアテンション最適化の分析
FlashAttention論文をレビューし、GPU HBM/SRAMメモリ階層を活用したIO-awareアテンション最適化の原理を詳細に分析する。
2026-03-01 · 27 分で読めます #ai-papers#flash-attention#gpu#optimization#transformer