标签: #ai-papers
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 62 篇
Diffusion Policy 与 π0 — 平滑机器人行为背后的秘密
跨越离散动作 token 的局限,本文考察将动作生成为连续值的两条思路。Diffusion Policy 通过去噪生成动作,π0 则用 flow-matching 生成高频连续动作。我们梳理两种方法的思路、架构、控制频率、优势与局限。
2026-06-27 · 24 分钟阅读 #ai-papers#robotics#diffusion-policy#pi0#flow-matching多模态 AI 的训练方法 — 把多种感觉揉进一个模型
梳理让多模态 AI 在同一个模型里处理图像、文本、音频、视频的训练原理。依次讲解模态对齐与对比学习、融合方式、共享嵌入空间、预训练与微调、数据与评估,以及幻觉之类的局限,并配代码展示训练流水线。
2026-06-26 · 28 分钟阅读 #ai-papers#multimodal#clip#vision-language#contrastive-learning超越 OCR — OCR-free 文档理解与统一模型
传统 OCR 流水线把检测、识别、布局拆分成多个阶段,但误差会逐级累积。本文梳理文档 AI 的这场转变 — 从 Donut 系与基于 VLM 的 OCR-free 文档理解,到高分辨率与表格处理,再到统一模型的走向。
2026-06-26 · 34 分钟阅读 #ai-papers#ocr-free#document-understanding#multimodal#donutAI 硬件最新研究动向 2026 — 从论文看未来
按领域梳理 2026 年 AI 硬件研究的走向。从晶圆级与光子学、内存内计算(compute-in-memory)、FP4 低精度训练、稀疏性与 MoE 硬件、光互连、下一代内存,到神经形态计算与软硬件协同设计,整理各条脉络的核心思路、意义与局限。
2026-06-16 · 34 分钟阅读 #ai-papers#ai-hardware#photonics#compute-in-memory#low-precisionMixture of Experts (MoE) 架构论文深度解析:从 GShard 到 DeepSeek-MoE
分析 Mixture of Experts 架构的核心论文,比较 GShard、Switch Transformer、Mixtral、DeepSeek-MoE 的路由策略与训练稳定性技巧。
2026-03-14 · 28 分钟阅读 #ai-papers#moe#transformer#deepseek从 RLHF 到 DPO:LLM 对齐(Alignment)技术论文深度解析
深度解析 LLM 对齐技术的核心论文。系统梳理 InstructGPT 的 RLHF 流水线、Anthropic 的 Constitutional AI、DPO 的数学基础、PPO 训练稳定性,以及 KTO/IPO/ORPO 等最新研究,并整理实务应用方案。
2026-03-13 · 18 分钟阅读 #ai-papers#rlhf#dpo#alignment#ppoRAG 论文综述:Retrieval-Augmented Generation 的演进 — 从 RETRO 到 Self-RAG、Corrective-RAG
以论文为线索追溯 Retrieval-Augmented Generation(RAG)研究的演进。从早期 RAG(Lewis 等)出发,比较分析 RETRO 的大规模检索、Self-RAG 的自我反思、Corrective-RAG 的检索质量评估等核心架构与基准测试。
2026-03-12 · 28 分钟阅读 #ai-papers#rag#self-rag#corrective-rag#retroDiffusion Model 论文综述:从 DDPM 到 Stable Diffusion、DiT、SDXL,图像生成模型的演进
从 DDPM/DDIM 的扩散-逆扩散理论、Score-based 模型,到 Latent Diffusion(Stable Diffusion)的 VAE+U-Net 架构、Classifier-free Guidance、DiT(Diffusion Transformer)的 adaLN-Zero、SDXL 的双文本编码器与 Refiner 流水线、ControlNet 的条件控制、训练流水线、推理优化,全面综述图像生成模型的演进历
2026-03-12 · 22 分钟阅读 #ai-papers#diffusion-model#ddpm#stable-diffusion#ditMixture of Experts(MoE)架构深度解析:从 Switch Transformer 到 Mixtral 的演进与高效扩展策略
从 Mixture of Experts(MoE)架构的核心原理,到 Switch Transformer 的单专家路由、Mixtral 8x7B 的 Sparse MoE 实现、DeepSeek-MoE 的细粒度专家策略,逐层深度解析。涵盖路由机制、负载均衡损失、训练稳定化技巧、推理优化、故障案例与检查清单。
2026-03-11 · 24 分钟阅读 #ai-papers#moe#switch-transformer#mixtral#model-architectureKV Cache 优化深度解析:GQA、MLA、MHA 注意力机制与内存效率化策略
从 Transformer Self-Attention 的 KV Cache 基本原理出发,深入分析并比较 MHA、MQA、GQA(Llama 2/3)、MLA(DeepSeek-V2/V3)机制的内存占用,涵盖 KV Cache 压缩技术(量化、驱逐策略、滑动窗口)、PagedAttention(vLLM)实现、PyTorch 代码示例、OOM 故障案例与优化清单。
2026-03-11 · 22 分钟阅读 #ai-papers#kv-cache#attention-mechanism#gqa#mlaMixture of Experts(MoE)架构深度解析:从 Switch Transformer 到 Mixtral、DeepSeek
深度解析 Mixture of Experts(MoE)架构。从 Sparse MoE 的数学基础,到 Switch Transformer、Mixtral 8x7B、DeepSeek-V3 的路由策略、训练稳定性技巧、推理优化,基于论文进行详细梳理。
2026-03-10 · 19 分钟阅读 #ai-papers#moe#transformer#mixtral#deepseekDPO(Direct Preference Optimization)论文深度解析 — 无需 RLHF 对齐 LLM
从 DPO 的数学原理到实现、与 RLHF 的比较,以及 IPO/KTO/ORPO 变体 — 从实务角度深入分析 LLM 偏好优化的核心。
2026-03-09 · 26 分钟阅读 #ai-papers#dpo#rlhf#llm-alignment#preference-optimizationFlashAttention 论文解析:用 IO-Aware Exact Attention 革新 Transformer 训练与推理速度
深入解析 FlashAttention 系列(v1~v3)核心论文。涵盖 IO-Aware 算法的 tiling 策略、GPU SRAM/HBM 内存层级的利用、反向传播的 recomputation、FlashAttention-2 的并行化改进,以及 FlashAttention-3 的 FP8 支持与异步流水线,并配有实战基准测试。
2026-03-09 · 29 分钟阅读 #ai-papers#flash-attention#transformer#gpu-optimization#attention-mechanismAI/ML 论文阅读必备数学 + LaTeX/KaTeX 全面整理
全面整理阅读 AI/ML 论文时必然会遇到的数学概念(线性代数、微积分、概率统计、最优化)与 LaTeX/KaTeX 公式语法,以实战示例为核心讲解。从符号速查表、公式模式解析,到 MDX 博客渲染技巧,一次讲清楚。
2026-03-08 · 24 分钟阅读 #ai-papers#math#latex#katex#linear-algebraKAN(Kolmogorov-Arnold Networks)论文解析:替代 MLP 的可学习激活函数架构
深入解析 Kolmogorov-Arnold Networks(KAN)论文,涵盖 Kolmogorov-Arnold 表示定理的数学背景、B 样条激活函数、与 MLP 相比的精度与可解释性对比,以及实战实现代码。
2026-03-08 · 33 分钟阅读 #ai-papers#kan#kolmogorov-arnold#neural-network#mlpRing Attention 论文解析:在分布式环境中实现无限上下文窗口训练
解析 Ring Attention 论文,探讨在分布式环境中克服上下文长度限制的方法。涵盖与 Blockwise Parallel Transformer 的关联、实现细节、性能基准,以及生产环境应用时需要考虑的问题。
2026-03-08 · 46 分钟阅读 #ai-papers#ring-attention#distributed-training#long-context#transformerMamba 与 State Space Model 论文深度解析:从选择性 SSM 到 Mamba-2 的 Transformer 替代架构
涵盖 Mamba 论文的选择性 State Space Model 机制、从 S4 到 Mamba-2 的发展过程、相对于 Transformer 的线性时间复杂度的优缺点,以及视觉、音频、时间序列领域应用案例的 SSM 架构综合分析。
2026-03-07 · 38 分钟阅读 #ai-papers#mamba#state-space-model#ssm#transformerSparse Mixture of Experts(MoE)架构深度解析:从设计原理到 DeepSeek-V3、Qwen3
分析 Sparse MoE 架构的数学原理、路由策略与负载均衡技术,涵盖从 Switch Transformer 到 DeepSeek-V3、Qwen3-235B 等最新 MoE 模型的设计选择,以及训练与推理的实战优化策略。
2026-03-06 · 30 分钟阅读 #ai-papers#moe#sparse-model#deepseek#2026-03BitNet 论文解析:1-Bit LLM 的时代 — 从三值权重到 CPU 推理
Microsoft Research 的 BitNet 系列(v1、b1.58、a4.8、2B4T)论文解析,从三值权重训练原理到 bitnet.cpp 推理框架、实战基准测试的综合指南。
2026-03-06 · 33 分钟阅读 #ai-papers#bitnet#1-bit-llm#quantization#model-efficiency从 DPO 到 KTO:人类反馈对齐技术最新论文综述与实战实现
综述克服 RLHF 局限的 DPO、IPO、KTO 等最新人类反馈对齐技术论文,并提供基于 TRL 的实战实现指南。涵盖算法对比、超参数调优,直至失败案例。
2026-03-05 · 31 分钟阅读 #ai-papers#dpo#kto#alignment#2026-03