タグ: #dataflow
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 3 件
Groq と SambaNova — 推論に全振りしたチップたち
学習ではなく推論にすべてを賭けた2つのチップ、Groq LPU と SambaNova RDU の動作原理を深く覗き込みます。決定的実行とコンパイラスケジューリング、reconfigurable dataflow がどう低遅延を生むか、そしてGPUに対しどこで勝ちどこで負けるかを整理します。
2026-06-16 · 35 分で読めます #groq#sambanova#inference#ai-hardware#lpuシストリックアレイとデータフローアーキテクチャ — TPUの心臓原理
AIアクセラレータの中核演算である行列積を効率的に処理するシストリックアレイの動作原理を、ASCII図とともに深く掘り下げます。weight-stationaryやoutput-stationaryといったデータフロー戦略、データ再利用とエネルギー、テンソルコアとの比較、コンパイラのマッピングまで、TPUの心臓原理を整理します。
2026-06-16 · 36 分で読めます #gpu-cuda#systolic-array#dataflow#tpu#ai-hardware推論を速く — 量子化、スパース性、Dataflow のハードウェア視点
推論コストの構造をメモリウォールの観点から解きほぐし、量子化(INT8/FP8/FP4)、構造化スパース性(2:4)、dataflow アーキテクチャ、演算子融合、バッチングと KV キャッシュまでをハードウェアとソフトウェアの協調設計として一枚の絵にまとめます。2026 年の Blackwell FP4 と Vera Rubin の流れを反映し、実務での適用ポイントを示します。
2026-06-16 · 32 分で読めます #inference#quantization#sparsity#dataflow#gpu