标签: #tiny-models
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 5 篇
人人可懂的 AI 第6篇 — 用111万参数的扩散模型从单词画出数字
我们用111万参数做了一个条件扩散模型:输入 "zero" 就画出 0。加噪的 forward 只是一行公式,还原的 reverse 就是把这一行倒着走 400 次。本文用真实生成结果说明扩散如何绕开第5篇中 L1 损失导致的颜色发灰问题,以及为什么模型被训练去预测噪声而不是图像。
2026-08-24 · 11 分钟阅读 #ai#diffusion#ddpm#generative#pytorch人人可懂的 AI 第5篇 — 用47万参数的 U-Net 给黑白照片上色,以及颜色为何发灰
本系列最小的模型 —— 47万参数的 U-Net —— 把 CIFAR-10 的黑白图像还原成彩色。形状保留得很好,颜色却明显发灰。这不是容量问题,而是选用 L1 损失的必然结果。我们用真实输出图像说明 skip connection 究竟运送了什么,以及回归损失为何会抽干饱和度。
2026-08-23 · 10 分钟阅读 #ai#computer-vision#unet#colorization#pytorch人人可懂的 AI 第4篇 — 用137万参数给图像配句子,以及第3篇的 bug 为何没出现在这里
把 CNN 编码器接上 Transformer 解码器,给 Fashion-MNIST 图像配字幕。137万参数、十分钟训练,标签命中率达到 91%。本文讲清编码器-解码器结构中 cross-attention 在做什么,并把两个函数并排放在一起,说明让第3篇正确率跌到 7.5% 的 EOS bug 为何没有出现在这份代码里。
2026-08-22 · 9 分钟阅读 #ai#captioning#multimodal#transformer#pytorch人人可懂的 AI 第3篇 — 损失0.0017却只有7.5%正确率,元凶是一格填充
我们用148万参数做了一个 VQA 模型:同时接收图像和问题并给出答案。训练损失降到 0.0017,正确率却只有 7.5%,比随机猜还差。原因不在模型,而在生成标签的一行代码;改掉之后变成 99.5%。本文用真实输出说明:为什么低损失并不保证好模型,以及如何识破这个陷阱。
2026-08-21 · 10 分钟阅读 #ai#vqa#multimodal#debugging#pytorch人人可懂的 AI 第1篇 — 用15分钟从零训练一个1600万参数的语言模型
用一张 GPU 从零训练语言模型。借助 TinyStories 数据集和1600万参数的仅解码器 Transformer,15分钟就生成出可读的英文童话。我们用真实的训练日志和未经修改的生成结果,来看因果掩码为何必要、权重共享节省了什么、以及 perplexity 8 究竟对应怎样的句子。基于 RTX 3090 实测。
2026-08-19 · 12 分钟阅读 #ai#llm#transformer#pytorch#hands-on