标签: #transformer
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 18 篇
人人可懂的 AI 第4篇 — 用137万参数给图像配句子,以及第3篇的 bug 为何没出现在这里
把 CNN 编码器接上 Transformer 解码器,给 Fashion-MNIST 图像配字幕。137万参数、十分钟训练,标签命中率达到 91%。本文讲清编码器-解码器结构中 cross-attention 在做什么,并把两个函数并排放在一起,说明让第3篇正确率跌到 7.5% 的 EOS bug 为何没有出现在这份代码里。
2026-08-22 · 9 分钟阅读 #ai#captioning#multimodal#transformer#pytorch人人可懂的 AI 第1篇 — 用15分钟从零训练一个1600万参数的语言模型
用一张 GPU 从零训练语言模型。借助 TinyStories 数据集和1600万参数的仅解码器 Transformer,15分钟就生成出可读的英文童话。我们用真实的训练日志和未经修改的生成结果,来看因果掩码为何必要、权重共享节省了什么、以及 perplexity 8 究竟对应怎样的句子。基于 RTX 3090 实测。
2026-08-19 · 12 分钟阅读 #ai#llm#transformer#pytorch#hands-on深度学习时间序列分析完全指南:LSTM、Transformer、PatchTST、TimesFM
用深度学习完全掌握时间序列数据的指南。从时间序列预处理、ARIMA、LSTM,到 Temporal Fusion Transformer、PatchTST、Mamba、TimesFM 等最新基础模型,通过实战示例学习。
2026-03-17 · 28 分钟阅读 #time-series#lstm#transformer#forecasting#deep-learning自然语言处理(NLP)完全指南:从零到精通 - 从文本处理到LLM
一份从 NLP 基础到最新 LLM 的完全指南。通过实战代码逐步学习文本预处理、Word2Vec、RNN/LSTM、Attention、Transformer、BERT、GPT。
2026-03-17 · 46 分钟阅读 #nlp#natural-language-processing#transformer#bert#gptMixture of Experts (MoE) 架构论文深度解析:从 GShard 到 DeepSeek-MoE
分析 Mixture of Experts 架构的核心论文,比较 GShard、Switch Transformer、Mixtral、DeepSeek-MoE 的路由策略与训练稳定性技巧。
2026-03-14 · 28 分钟阅读 #ai-papers#moe#transformer#deepseekKV Cache 优化深度解析:GQA、MLA、MHA 注意力机制与内存效率化策略
从 Transformer Self-Attention 的 KV Cache 基本原理出发,深入分析并比较 MHA、MQA、GQA(Llama 2/3)、MLA(DeepSeek-V2/V3)机制的内存占用,涵盖 KV Cache 压缩技术(量化、驱逐策略、滑动窗口)、PagedAttention(vLLM)实现、PyTorch 代码示例、OOM 故障案例与优化清单。
2026-03-11 · 22 分钟阅读 #ai-papers#kv-cache#attention-mechanism#gqa#mlaMixture of Experts(MoE)架构深度解析:从 Switch Transformer 到 Mixtral、DeepSeek
深度解析 Mixture of Experts(MoE)架构。从 Sparse MoE 的数学基础,到 Switch Transformer、Mixtral 8x7B、DeepSeek-V3 的路由策略、训练稳定性技巧、推理优化,基于论文进行详细梳理。
2026-03-10 · 19 分钟阅读 #ai-papers#moe#transformer#mixtral#deepseekFlashAttention 论文解析:用 IO-Aware Exact Attention 革新 Transformer 训练与推理速度
深入解析 FlashAttention 系列(v1~v3)核心论文。涵盖 IO-Aware 算法的 tiling 策略、GPU SRAM/HBM 内存层级的利用、反向传播的 recomputation、FlashAttention-2 的并行化改进,以及 FlashAttention-3 的 FP8 支持与异步流水线,并配有实战基准测试。
2026-03-09 · 29 分钟阅读 #ai-papers#flash-attention#transformer#gpu-optimization#attention-mechanismRing Attention 论文解析:在分布式环境中实现无限上下文窗口训练
解析 Ring Attention 论文,探讨在分布式环境中克服上下文长度限制的方法。涵盖与 Blockwise Parallel Transformer 的关联、实现细节、性能基准,以及生产环境应用时需要考虑的问题。
2026-03-08 · 46 分钟阅读 #ai-papers#ring-attention#distributed-training#long-context#transformerMamba 与 State Space Model 论文深度解析:从选择性 SSM 到 Mamba-2 的 Transformer 替代架构
涵盖 Mamba 论文的选择性 State Space Model 机制、从 S4 到 Mamba-2 的发展过程、相对于 Transformer 的线性时间复杂度的优缺点,以及视觉、音频、时间序列领域应用案例的 SSM 架构综合分析。
2026-03-07 · 38 分钟阅读 #ai-papers#mamba#state-space-model#ssm#transformer打造属于自己的 GPT — 用 nanoGPT 从零开始训练语言模型
借助 Andrej Karpathy 的 nanoGPT,从零开始训练 GPT 语言模型。结合代码,完整解剖 Transformer 架构的核心原理、分词器、Self-Attention、训练循环。
2026-03-03 · 8 分钟阅读 #ai#llm#gpt#nanogpt#transformerMamba 论文精读:用 Selective State Space Models 超越 Transformer
深入解读 Mamba(Selective State Space Models)论文。梳理从 S4 到 Mamba 的发展脉络、Selective Scan 机制、Hardware-Aware 算法,以及 Mamba-2 的 State Space Duality,并配合代码逐一分析。
2026-03-02 · 10 分钟阅读 #mamba#state-space-model#ssm#transformer#linear-attentionMamba: Linear-Time Sequence Modeling with Selective State Spaces 论文分析
深入分析作为 Transformer 替代方案而备受关注的 Mamba 架构。从 Selective State Space Model 的核心思想、硬件优化算法,到实验结果,结合代码梳理论文的主要内容。
2026-03-02 · 10 分钟阅读 #ai-papers#mamba#ssm#state-space-model#transformerGPT 系列论文完全解析:从 GPT-1 到 GPT-4,语言模型改变世界的历程
按代际完整解析 OpenAI 的 GPT 系列。从 GPT-1 的无监督预训练、GPT-2 的 Zero-shot 学习、GPT-3 的 In-context Learning 与 Scaling Law、InstructGPT 的 RLHF,到 GPT-4 的多模态 — 用公式梳理每篇论文的核心贡献与架构演进。
2026-03-01 · 54 分钟阅读 #gpt#openai#language-model#transformer#pre-trainingFlashAttention:利用 GPU 内存层级的注意力优化分析
梳理 FlashAttention 论文,详细分析利用 GPU HBM/SRAM 内存层级的 IO-aware 注意力优化原理。
2026-03-01 · 24 分钟阅读 #ai-papers#flash-attention#gpu#optimization#transformerAttention Is All You Need:Transformer 论文完全解析
对 Transformer 架构的核心论文「Attention Is All You Need」的深入解析,逐一拆解 Self-Attention、Multi-Head Attention、Positional Encoding 等核心机制。
2026-03-01 · 23 分钟阅读 #ai-papers#transformer#deep-learning#attentionVision Transformer(ViT)论文深度解析:一张图像相当于16x16个单词
深度解析Google的ViT论文:将图像转换为patch序列的创新方法、Patch Embedding与Position Embedding的原理、相较CNN的性能与数据效率权衡,以及DeiT、Swin Transformer、BEiT等后续研究的全面梳理。
2026-03-01 · 40 分钟阅读 #vit#vision-transformer#computer-vision#transformer#image-classificationBERT 论文完全解析:双向 Transformer 如何改变 NLP 格局
深入分析 Google 的 BERT 论文。通过公式与代码示例,梳理 Masked Language Model(MLM)与 Next Sentence Prediction(NSP)实现的双向预训练、微调策略,以及横扫 11 个 NLP 基准的架构核心原理。
2026-03-01 · 37 分钟阅读 #bert#nlp#transformer#pre-training#fine-tuning