タグ: #量子化
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 2 件
LLM サービング最適化完全ガイド:KVキャッシュ、PagedAttention、量子化のすべて
LLMサービングの核心最適化技術を完全解剖する。KVキャッシュのメモリ問題からPagedAttentionの仮想メモリ革新、連続バッチング、投機的デコーディング、量子化、そしてvLLM/TGI/TensorRT-LLMの比較まで。
2026-03-18 · 44 分で読めます #LLMサービング#KVキャッシュ#paged-attention#vllm#量子化NPU完全解剖:トランスフォーマーアーキテクチャはシリコン上でいかに動くか
NPUがCPU/GPUと何が異なるのか、トランスフォーマーの各演算がハードウェアにどうマッピングされるのか、そしてLLM推論がなぜメモリバウンドなのかをルーフラインモデルと実際のコードで完全解剖。Apple ANEからQualcomm Hexagon、Groq LPUまで実測値で比較。
2026-03-18 · 21 分で読めます #npu#トランスフォーマー#AIハードウェア#量子化#KVキャッシュ