标签: #linear-attention
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 3 篇
RWKV: Reinventing RNNs for the Transformer Era — 从 v4 到 v7 Goose
分析克服 Transformer O(N²) 局限的 RWKV 架构。从 Linear Attention 与 RNN 的融合、选择性状态空间机制,到 v7 Goose 的创新,结合代码逐一梳理。
2026-03-03 · 12 分钟阅读 #ai-papers#rwkv#rnn#linear-attention#state-space-modelRWKV-7 "Goose" 架构分析 — 超越 Transformer 的线性时间模型
基于论文分析 RWKV-7 Goose 的 Dynamic State Evolution 机制、TC0 限制的突破,以及与 Transformer 的性能对比。这是一种能实现常数内存 + 线性时间推理的下一代架构。
2026-03-03 · 10 分钟阅读 #ai-papers#rwkv#linear-attention#sequence-modeling#2026-03Mamba 论文精读:用 Selective State Space Models 超越 Transformer
深入解读 Mamba(Selective State Space Models)论文。梳理从 S4 到 Mamba 的发展脉络、Selective Scan 机制、Hardware-Aware 算法,以及 Mamba-2 的 State Space Duality,并配合代码逐一分析。
2026-03-02 · 10 分钟阅读 #mamba#state-space-model#ssm#transformer#linear-attention