Tag: #kernel-optimization
Writing on GPUs, LLMs, MLOps, Kubernetes — and mindset · 1 posts
cuDNN Internals: Why Deep Learning Operations Fly on GPU
From im2col transformation to Winograd algorithm, FlashAttention tiling, and TensorRT INT8 quantization. A complete breakdown of how cuDNN makes deep learning operations 10-100x faster than naive CUDA.
2026-03-18 · 13 min read #cudnn#gpu#deep-learning-optimization#convolution#model-serving