タグ: #gpu-optimization
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 2 件
LLM推論最適化完全ガイド2025:vLLM、TensorRT-LLM、KV Cache、Speculative Decoding
LLM推論最適化のすべて!vLLM(PagedAttention)、TensorRT-LLM(FP8/INT4)、KV Cache管理、Speculative Decoding、Continuous Batching、FlashAttention、量子化(GPTQ/AWQ/GGUF)、モデルサービング(Triton/vLLM/TGI)、GPUメモリ最適化、コスト分析。
2026-04-14 · 31 分で読めます #llm-inference#vllm#tensorrt-llm#kv-cache#speculative-decodingFlashAttention 論文分析: IO-Aware Exact AttentionによるTransformer学習・推論速度の革新
FlashAttentionシリーズ(v1〜v3)の中核論文を分析します。IO-Awareアルゴリズムのタイリング戦略、GPU SRAM/HBMメモリ階層の活用、逆伝播のrecomputation、FlashAttention-2の並列化改善、FlashAttention-3のFP8対応と非同期パイプラインまで、実践ベンチマークとともに解説します。
2026-03-09 · 32 分で読めます #ai-papers#flash-attention#transformer#gpu-optimization#attention-mechanism