タグ: #sparsity
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 1 件
推論を速く — 量子化、スパース性、Dataflow のハードウェア視点
推論コストの構造をメモリウォールの観点から解きほぐし、量子化(INT8/FP8/FP4)、構造化スパース性(2:4)、dataflow アーキテクチャ、演算子融合、バッチングと KV キャッシュまでをハードウェアとソフトウェアの協調設計として一枚の絵にまとめます。2026 年の Blackwell FP4 と Vera Rubin の流れを反映し、実務での適用ポイントを示します。
2026-06-16 · 32 分で読めます #inference#quantization#sparsity#dataflow#gpu