标签: #captioning
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 1 篇
人人可懂的 AI 第4篇 — 用137万参数给图像配句子,以及第3篇的 bug 为何没出现在这里
把 CNN 编码器接上 Transformer 解码器,给 Fashion-MNIST 图像配字幕。137万参数、十分钟训练,标签命中率达到 91%。本文讲清编码器-解码器结构中 cross-attention 在做什么,并把两个函数并排放在一起,说明让第3篇正确率跌到 7.5% 的 EOS bug 为何没有出现在这份代码里。
2026-08-22 · 9 分钟阅读 #ai#captioning#multimodal#transformer#pytorch