标签: #moe
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 10 篇
这些模型到底是怎么造出来的 —— 剖析 2026 年开放权重流水线
通读截至 2026 年 8 月在 Hugging Face 排名靠前的一批开放权重模型的卡片和技术报告,本文按顺序梳理了从数据采集到量化部署的整条生产流水线。内容以真实模型为例,讲了 MoE 稀疏度为什么突破 20 倍、削减全局注意力的四种思路、预训练的 token 预算和稳定化技巧、SFT 之后的偏好优化与强化学习,以及蒸馏和低比特部署。先说清一个重要前提:绝大多数开放权重发布并不公开训练数据的构成。文中逐段区分了哪些是真正公开的信息
2026-08-02 · 26 分钟阅读 #llm#pretraining#moe#post-training#quantization26B 模型跑在 2GB 内存里的原理 — 常驻内存和工作集不是同一个数字
2026 年 7 月 29 日发到 Show HN 上的 TurboFieldfare 声称,能在 M 系列 Mac 上用约 2GB 内存跑 Gemma 4 26B-A4B。磁盘上装的是 14.3GB,常驻内存里的只有 1.35GB 的共享核心,每个 token 需要的专家权重从 SSD 读进来。本文不照搬这些数字,而是自己推导并核对 — 4 比特分组 64 量化为什么会变成每权重 4.5 比特、从而落到 14.2GB,路由专家与共享核
2026-07-31 · 16 分钟阅读 #ai#llm#quantization#apple-silicon#moeDeepSeek V4 Flash 真正改变的是什么 — 这是每单位能力成本的问题,不是排行榜的问题
2026 年 7 月 31 日,DeepSeek 把 V4-Flash API 转为公开测试版。架构和 4 月的预览版完全一样 — 284B 总参数、13B 激活的 MoE,1M 上下文 — 变的只有后训练。官方更新日志公布的分数是 Terminal Bench 2.1 上 82.7、Toolathlon verified 上 70.3,但首先要说清楚的是:这些数字是 DeepSeek 用自家 harness 测出来的厂商自测值。本文不
2026-07-31 · 16 分钟阅读 #ai#llm#deepseek#inference-cost#moeTencent Hy3:冷静解读 295B 开放权重 MoE
Tencent 于 2026 年 7 月 6 日以 Apache 2.0 许可证公开了 Hy3。这是一个总参数 295B、每次仅激活 21B 的 MoE 推理·智能体语言模型。本文梳理它到底有什么新意、在中国系开放权重浪潮中处于什么位置,以及厂商自行公布的基准测试数字应当相信到什么程度。
2026-07-11 · 8 分钟阅读 #hy3#tencent#hunyuan#open-weights#moe在慢速电脑上跑 GLM-5.2 — colibrì 如何从磁盘流式加载 744B 模型
colibrì 是一个用纯 C 写成、约 1,300 行的推理引擎,能在内存 25GB 的消费级 PC 上运行 744B(7,440 亿)参数的 MoE 模型 GLM-5.2。关键在于 MoE 稀疏性与磁盘流式加载 — 只把约 9.9GB 的密集层常驻内存,约 370GB 的路由专家放在 NVMe SSD 上,每个 token 只读取需要的部分。代价是诚实地慢:冷启动约 0.05–0.1 tok/s,实际上每段落要花几分钟。它靠学习缓存
2026-07-11 · 7 分钟阅读 #ai#llm#local-inference#moe#quantizationMixture of Experts (MoE) 架构论文深度解析:从 GShard 到 DeepSeek-MoE
分析 Mixture of Experts 架构的核心论文,比较 GShard、Switch Transformer、Mixtral、DeepSeek-MoE 的路由策略与训练稳定性技巧。
2026-03-14 · 28 分钟阅读 #ai-papers#moe#transformer#deepseekMixture of Experts(MoE)架构深度解析:从 Switch Transformer 到 Mixtral 的演进与高效扩展策略
从 Mixture of Experts(MoE)架构的核心原理,到 Switch Transformer 的单专家路由、Mixtral 8x7B 的 Sparse MoE 实现、DeepSeek-MoE 的细粒度专家策略,逐层深度解析。涵盖路由机制、负载均衡损失、训练稳定化技巧、推理优化、故障案例与检查清单。
2026-03-11 · 24 分钟阅读 #ai-papers#moe#switch-transformer#mixtral#model-architectureMixture of Experts(MoE)架构深度解析:从 Switch Transformer 到 Mixtral、DeepSeek
深度解析 Mixture of Experts(MoE)架构。从 Sparse MoE 的数学基础,到 Switch Transformer、Mixtral 8x7B、DeepSeek-V3 的路由策略、训练稳定性技巧、推理优化,基于论文进行详细梳理。
2026-03-10 · 19 分钟阅读 #ai-papers#moe#transformer#mixtral#deepseekSparse Mixture of Experts(MoE)架构深度解析:从设计原理到 DeepSeek-V3、Qwen3
分析 Sparse MoE 架构的数学原理、路由策略与负载均衡技术,涵盖从 Switch Transformer 到 DeepSeek-V3、Qwen3-235B 等最新 MoE 模型的设计选择,以及训练与推理的实战优化策略。
2026-03-06 · 30 分钟阅读 #ai-papers#moe#sparse-model#deepseek#2026-03Mixture of Experts(MoE)架构完全解析
从 Sparse MoE 的原理,到 Mixtral、DeepSeek-V3 的 MoE 实现、路由策略、负载均衡,完全解析 MoE 架构。
2026-03-03 · 6 分钟阅读 #ai-papers#moe#mixtral#deepseek#2026-03