标签: #deep-learning
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 35 篇
AI/ML 论文阅读必备数学 + LaTeX/KaTeX 全面整理
全面整理阅读 AI/ML 论文时必然会遇到的数学概念(线性代数、微积分、概率统计、最优化)与 LaTeX/KaTeX 公式语法,以实战示例为核心讲解。从符号速查表、公式模式解析,到 MDX 博客渲染技巧,一次讲清楚。
2026-03-08 · 24 分钟阅读 #ai-papers#math#latex#katex#linear-algebraKAN(Kolmogorov-Arnold Networks)论文解析:替代 MLP 的可学习激活函数架构
深入解析 Kolmogorov-Arnold Networks(KAN)论文,涵盖 Kolmogorov-Arnold 表示定理的数学背景、B 样条激活函数、与 MLP 相比的精度与可解释性对比,以及实战实现代码。
2026-03-08 · 33 分钟阅读 #ai-papers#kan#kolmogorov-arnold#neural-network#mlp打造属于自己的 GPT — 用 nanoGPT 从零开始训练语言模型
借助 Andrej Karpathy 的 nanoGPT,从零开始训练 GPT 语言模型。结合代码,完整解剖 Transformer 架构的核心原理、分词器、Self-Attention、训练循环。
2026-03-03 · 8 分钟阅读 #ai#llm#gpt#nanogpt#transformerAI 数学完全指南 — 从线性代数到信息论
用代码和直觉梳理 AI/深度学习所需的数学:线性代数(矩阵、特征值)、微积分(偏导数、反向传播)、概率/统计(贝叶斯、分布)、优化(梯度下降法)、信息论(熵、KL 散度)。
2026-03-02 · 17 分钟阅读 #ai#mathematics#linear-algebra#calculus#probabilityMamba 论文精读:用 Selective State Space Models 超越 Transformer
深入解读 Mamba(Selective State Space Models)论文。梳理从 S4 到 Mamba 的发展脉络、Selective Scan 机制、Hardware-Aware 算法,以及 Mamba-2 的 State Space Duality,并配合代码逐一分析。
2026-03-02 · 10 分钟阅读 #mamba#state-space-model#ssm#transformer#linear-attentionMamba: Linear-Time Sequence Modeling with Selective State Spaces 论文分析
深入分析作为 Transformer 替代方案而备受关注的 Mamba 架构。从 Selective State Space Model 的核心思想、硬件优化算法,到实验结果,结合代码梳理论文的主要内容。
2026-03-02 · 10 分钟阅读 #ai-papers#mamba#ssm#state-space-model#transformerGPT 系列论文完全解析:从 GPT-1 到 GPT-4,语言模型改变世界的历程
按代际完整解析 OpenAI 的 GPT 系列。从 GPT-1 的无监督预训练、GPT-2 的 Zero-shot 学习、GPT-3 的 In-context Learning 与 Scaling Law、InstructGPT 的 RLHF,到 GPT-4 的多模态 — 用公式梳理每篇论文的核心贡献与架构演进。
2026-03-01 · 54 分钟阅读 #gpt#openai#language-model#transformer#pre-trainingGAN 论文完全解析:生成对抗网络开创的 AI 生成模型时代
从 Ian Goodfellow 的 GAN 原始论文到 DCGAN、WGAN、Progressive GAN、StyleGAN —— 用公式分析生成对抗网络的核心理论:minimax 博弈、Nash 均衡、训练不稳定性的解决方法,并系统梳理 GAN 谱系的演化。
2026-03-01 · 49 分钟阅读 #gan#generative-model#adversarial-training#deep-learning#image-generation强化学习(Reinforcement Learning)完全指南:从理论基础到最新算法、实战实现
从强化学习的核心理论 MDP、Bellman 方程,到 Q-Learning、DQN、Policy Gradient、A3C、PPO、SAC 等主要算法逐一用公式推导,并系统整理 RLHF、AlphaGo、机器人应用案例与 PyTorch 实现示例。
2026-03-01 · 59 分钟阅读 #reinforcement-learning#deep-learning#dqn#ppo#rlhfAttention Is All You Need:Transformer 论文完全解析
对 Transformer 架构的核心论文「Attention Is All You Need」的深入解析,逐一拆解 Self-Attention、Multi-Head Attention、Positional Encoding 等核心机制。
2026-03-01 · 23 分钟阅读 #ai-papers#transformer#deep-learning#attentionSegment Anything Model 完全解析:从 SAM 1 到 SAM 2 再到 SAM 3 的论文解读与实战指南
全面梳理 Meta AI 的 Segment Anything Model(SAM)系列。从 SAM 1(图像可提示分割)、SAM 2(视频实时分割)到 SAM 3(概念感知分割),系统整理架构、数据集、核心创新、性能基准,以及安装与运行方法。
2026-03-01 · 27 分钟阅读 #sam#segment-anything#computer-vision#image-segmentation#video-segmentationVision Transformer(ViT)论文深度解析:一张图像相当于16x16个单词
深度解析Google的ViT论文:将图像转换为patch序列的创新方法、Patch Embedding与Position Embedding的原理、相较CNN的性能与数据效率权衡,以及DeiT、Swin Transformer、BEiT等后续研究的全面梳理。
2026-03-01 · 40 分钟阅读 #vit#vision-transformer#computer-vision#transformer#image-classificationResNet 论文全面解析:残差连接(Residual Connection)如何突破深度学习的深度极限
深入解析 Microsoft 的 ResNet 论文。用公式和代码梳理 Degradation 问题的发现、Skip Connection 的数学原理、Bottleneck 结构、ImageNet ILSVRC 2015 冠军架构,并纵览 ResNet 对现代深度学习产生的影响。
2026-03-01 · 36 分钟阅读 #resnet#residual-learning#cnn#computer-vision#image-classificationDDPM 论文完全解析:从噪声生成图像的扩散模型的数学与原理
深度解析 Ho 等人的 DDPM 论文。以公式推导 Forward/Reverse diffusion process、变分下界(ELBO)、噪声调度、简化训练目标(simplified objective),并全面梳理其向 DDIM、Latent Diffusion、Stable Diffusion 演进的脉络。
2026-03-01 · 40 分钟阅读 #ddpm#diffusion-model#generative-model#score-matching#stable-diffusionBERT 论文完全解析:双向 Transformer 如何改变 NLP 格局
深入分析 Google 的 BERT 论文。通过公式与代码示例,梳理 Masked Language Model(MLM)与 Next Sentence Prediction(NSP)实现的双向预训练、微调策略,以及横扫 11 个 NLP 基准的架构核心原理。
2026-03-01 · 37 分钟阅读 #bert#nlp#transformer#pre-training#fine-tuning