标签: #pretraining
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 1 篇
这些模型到底是怎么造出来的 —— 剖析 2026 年开放权重流水线
通读截至 2026 年 8 月在 Hugging Face 排名靠前的一批开放权重模型的卡片和技术报告,本文按顺序梳理了从数据采集到量化部署的整条生产流水线。内容以真实模型为例,讲了 MoE 稀疏度为什么突破 20 倍、削减全局注意力的四种思路、预训练的 token 预算和稳定化技巧、SFT 之后的偏好优化与强化学习,以及蒸馏和低比特部署。先说清一个重要前提:绝大多数开放权重发布并不公开训练数据的构成。文中逐段区分了哪些是真正公开的信息
2026-08-02 · 26 分钟阅读 #llm#pretraining#moe#post-training#quantization