タグ: #LLM推論
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 2 件
NPU完全解剖:トランスフォーマーアーキテクチャはシリコン上でいかに動くか
NPUがCPU/GPUと何が異なるのか、トランスフォーマーの各演算がハードウェアにどうマッピングされるのか、そしてLLM推論がなぜメモリバウンドなのかをルーフラインモデルと実際のコードで完全解剖。Apple ANEからQualcomm Hexagon、Groq LPUまで実測値で比較。
2026-03-18 · 21 分で読めます #npu#トランスフォーマー#AIハードウェア#量子化#KVキャッシュGPUメモリ管理とLLM推論最適化: vLLM、PagedAttention、GPTQ、TensorRT-LLMまで
HBMメモリ階層、KVキャッシュ計算、PagedAttention、GPTQ/AWQ量子化、continuous batching、vLLM vs TensorRT-LLM比較まで、LLM推論最適化の完全ガイドです。
2026-03-17 · 22 分で読めます #GPUメモリ#LLM推論#vllm#paged-attention#gptq