标签: #pytorch
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 17 篇
人人可懂的 AI 第6篇 — 用111万参数的扩散模型从单词画出数字
我们用111万参数做了一个条件扩散模型:输入 "zero" 就画出 0。加噪的 forward 只是一行公式,还原的 reverse 就是把这一行倒着走 400 次。本文用真实生成结果说明扩散如何绕开第5篇中 L1 损失导致的颜色发灰问题,以及为什么模型被训练去预测噪声而不是图像。
2026-08-24 · 11 分钟阅读 #ai#diffusion#ddpm#generative#pytorch人人可懂的 AI 第5篇 — 用47万参数的 U-Net 给黑白照片上色,以及颜色为何发灰
本系列最小的模型 —— 47万参数的 U-Net —— 把 CIFAR-10 的黑白图像还原成彩色。形状保留得很好,颜色却明显发灰。这不是容量问题,而是选用 L1 损失的必然结果。我们用真实输出图像说明 skip connection 究竟运送了什么,以及回归损失为何会抽干饱和度。
2026-08-23 · 10 分钟阅读 #ai#computer-vision#unet#colorization#pytorch人人可懂的 AI 第4篇 — 用137万参数给图像配句子,以及第3篇的 bug 为何没出现在这里
把 CNN 编码器接上 Transformer 解码器,给 Fashion-MNIST 图像配字幕。137万参数、十分钟训练,标签命中率达到 91%。本文讲清编码器-解码器结构中 cross-attention 在做什么,并把两个函数并排放在一起,说明让第3篇正确率跌到 7.5% 的 EOS bug 为何没有出现在这份代码里。
2026-08-22 · 9 分钟阅读 #ai#captioning#multimodal#transformer#pytorch人人可懂的 AI 第3篇 — 损失0.0017却只有7.5%正确率,元凶是一格填充
我们用148万参数做了一个 VQA 模型:同时接收图像和问题并给出答案。训练损失降到 0.0017,正确率却只有 7.5%,比随机猜还差。原因不在模型,而在生成标签的一行代码;改掉之后变成 99.5%。本文用真实输出说明:为什么低损失并不保证好模型,以及如何识破这个陷阱。
2026-08-21 · 10 分钟阅读 #ai#vqa#multimodal#debugging#pytorch人人可懂的 AI 第1篇 — 用15分钟从零训练一个1600万参数的语言模型
用一张 GPU 从零训练语言模型。借助 TinyStories 数据集和1600万参数的仅解码器 Transformer,15分钟就生成出可读的英文童话。我们用真实的训练日志和未经修改的生成结果,来看因果掩码为何必要、权重共享节省了什么、以及 perplexity 8 究竟对应怎样的句子。基于 RTX 3090 实测。
2026-08-19 · 12 分钟阅读 #ai#llm#transformer#pytorch#hands-on2026 年 LLM 训练技术栈地图 —— 每一层替你做了什么,又藏起了什么
把 LLM 训练框架分成三层来梳理谱系。最底层是 PyTorch 分布式、DeepSpeed、Megatron-Core 这类执行引擎;中间层是 torchtitan、Megatron-Bridge 这类训练循环;最上层是 TRL、Axolotl 这类靠一份配置文件就能跑起微调的工具。文中记录了每一层替你做了什么、又用这个换来了藏起什么,以及上层框架反而会碍事的那些地方。所有版本号与日期均于 2026 年 8 月 2 日直接在 PyPI
2026-08-02 · 19 分钟阅读 #mlops#llm-training#pytorch#trl#frameworkGPU 编译器与框架全景图 — 接收计算图、产出核函数,同一个问题,每一层给出不同的答案
本文把 NVCC 与 PTX、LLVM、MLIR、Triton、torch.compile、XLA、IREE、TVM 全部放到同一张地图上。它们名字不同、所属组织也不同,但解决的是同一个问题:接收计算图,产出可执行的核函数。文章梳理了每一层切走了这个问题的哪一部分、层为什么会变得这么多,以及工程师在什么情况下需要下探到哪一层。内容基于 2026 年 8 月 2 日核实的版本与官方文档写成,未能核实之处也如实标出。
2026-08-02 · 32 分钟阅读 #gpu#compiler#mlir#triton#pytorchPyTorch 2.13 的 torchcomms — 冲着替换 c10d 而来的新分布式通信后端
在 2026 年 7 月 8 日发布的 PyTorch 2.13 的众多亮点里,最具结构性的变化是 torchcomms — PyTorch Distributed 的新通信后端开始被整合进内核的 CI 与 DeviceMesh 路径。torchcomms 是 Meta 于 2025 年 10 月发布的实验性通信 API,官方路线图是清掉基于全局状态的 c10d ProcessGroup 的技术债(以 NCCL 为中心的设计、lazy
2026-07-17 · 15 分钟阅读 #pytorch#distributed-training#nccl#deep-learningRTX 5090 单卡亲手跑几个小模型 — microGPT·OCR·音乐生成
用一张 RTX 5090(Blackwell,32GB),通过 SSH 连上去直接跑了三个小模型。从零开始用 28 秒训练出一个 char-level GPT(10.75M 参数,117 万 tokens/s),把专用 OCR(TrOCR)和小型 VLM(Qwen2-VL-2B)放到同一张图上用 CER 一决高下,再用 MusicGen 在 1.9 秒(实时的 4.2 倍)里生成一段 8 秒的音乐。连同过程中遇到的那些诚实的陷阱 — 没
2026-07-11 · 10 分钟阅读 #pytorch#gpu#llm#ocr#hands-onTorch-Titan 完全指南:PyTorch 大规模分布式训练全解析
一份掌握 PyTorch Titan(torchtitan)大规模 LLM 分布式训练的完全指南。涵盖 FSDP2、流水线并行、张量并行、4D 并行、Flash Attention 与混合精度,并配有实战示例。
2026-03-17 · 27 分钟阅读 #torch-titan#distributed-training#pytorch#fsdp#deep-learningPyTorch 高级技巧完全指南:torch.compile、Custom Ops、内存优化
全面掌握 PyTorch 高级技巧的实战指南。涵盖 torch.compile、自定义算子、内存优化、Gradient Checkpointing、torch.vmap、functorch、PyTorch Profiler,配有实战示例讲解。
2026-03-17 · 21 分钟阅读 #pytorch#advanced#torch-compile#memory-optimization#custom-operatorsPyTorch 内部结构与高级优化:从 autograd、torch.compile、FSDP 到 Triton
一份 PyTorch 完全攻略指南,涵盖 PyTorch autograd 引擎、torch.compile() 与 TorchInductor 优化、FSDP 分布式训练、gradient checkpointing,以及自定义 CUDA 算子。
2026-03-17 · 13 分钟阅读 #pytorch#torch-compile#fsdp#triton#혼합정밀도DeepSpeed 完全指南:ZeRO 优化与大规模模型训练
全面掌握 Microsoft DeepSpeed 的实战指南。涵盖 ZeRO-1/2/3 优化、Offload、流水线并行、混合精度、MoE、DeepSpeed Inference,配有实战配置和代码示例。
2026-03-17 · 21 分钟阅读 #deepspeed#zero-optimization#distributed-training#llm#pytorchPyTorch 完全征服指南:从入门到精通 — 从张量到分布式训练
PyTorch 从基础到高级技巧的完全征服指南。通过实战示例循序渐进地学习张量运算、自动微分、CNN/RNN/Transformer 实现,直至分布式训练。
2026-03-17 · 33 分钟阅读 #pytorch#deep-learning#ai#python#neural-network深度学习调试完全指南:从训练失败诊断到性能优化
系统性诊断和解决深度学习模型训练失败的完全指南。涵盖 Loss NaN、梯度消失/爆炸、过拟合、收敛缓慢、显存不足等所有常见问题的原因与解决方案,并配有实战代码。
2026-03-17 · 30 分钟阅读 #deep-learning#debugging#pytorch#training#optimizationtorchaudio 完全指南 — 从音频处理到语音识别、TTS、音乐分析
用 torchaudio 讲透音频加载、频谱图变换、Mel 滤波器组、MFCC、语音识别(Wav2Vec2/Whisper)、TTS、说话人分离、降噪。音频 AI 的方方面面,全部用 PyTorch 覆盖。
2026-03-02 · 10 分钟阅读 #ai-platform#pytorch#torchaudio#audio#speech-recognitiontorchvision 完全指南 — 从图像分类到 Object Detection、Segmentation
从 torchvision 的 transforms v2、预训练模型(ResNet〜ViT)、数据集,到 Object Detection(Faster R-CNN、YOLO)、Segmentation,再到实战微调。用 PyTorch 全面掌握计算机视觉实务。
2026-03-02 · 10 分钟阅读 #ai-platform#pytorch#torchvision#computer-vision#cnn