标签: #deepseek
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 5 篇
DeepSeek V4 Flash 真正改变的是什么 — 这是每单位能力成本的问题,不是排行榜的问题
2026 年 7 月 31 日,DeepSeek 把 V4-Flash API 转为公开测试版。架构和 4 月的预览版完全一样 — 284B 总参数、13B 激活的 MoE,1M 上下文 — 变的只有后训练。官方更新日志公布的分数是 Terminal Bench 2.1 上 82.7、Toolathlon verified 上 70.3,但首先要说清楚的是:这些数字是 DeepSeek 用自家 harness 测出来的厂商自测值。本文不
2026-07-31 · 16 分钟阅读 #ai#llm#deepseek#inference-cost#moeMixture of Experts (MoE) 架构论文深度解析:从 GShard 到 DeepSeek-MoE
分析 Mixture of Experts 架构的核心论文,比较 GShard、Switch Transformer、Mixtral、DeepSeek-MoE 的路由策略与训练稳定性技巧。
2026-03-14 · 28 分钟阅读 #ai-papers#moe#transformer#deepseekMixture of Experts(MoE)架构深度解析:从 Switch Transformer 到 Mixtral、DeepSeek
深度解析 Mixture of Experts(MoE)架构。从 Sparse MoE 的数学基础,到 Switch Transformer、Mixtral 8x7B、DeepSeek-V3 的路由策略、训练稳定性技巧、推理优化,基于论文进行详细梳理。
2026-03-10 · 19 分钟阅读 #ai-papers#moe#transformer#mixtral#deepseekSparse Mixture of Experts(MoE)架构深度解析:从设计原理到 DeepSeek-V3、Qwen3
分析 Sparse MoE 架构的数学原理、路由策略与负载均衡技术,涵盖从 Switch Transformer 到 DeepSeek-V3、Qwen3-235B 等最新 MoE 模型的设计选择,以及训练与推理的实战优化策略。
2026-03-06 · 30 分钟阅读 #ai-papers#moe#sparse-model#deepseek#2026-03Mixture of Experts(MoE)架构完全解析
从 Sparse MoE 的原理,到 Mixtral、DeepSeek-V3 的 MoE 实现、路由策略、负载均衡,完全解析 MoE 架构。
2026-03-03 · 6 分钟阅读 #ai-papers#moe#mixtral#deepseek#2026-03