标签: #training-stability
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 1 篇
从公开的训练案例中学习 —— 试过什么,又是什么失败了
挑选了七份公开的大规模训练技术报告与日志本,只抽取失败与应对,而不是成绩单。从 Llama 3 405B 54 天内 419 次中断的统计里反推出检查点周期,比较 DeepSeek-V3 与 Kimi K2 分别在哪一层消灭了损失尖峰。也讨论了 Olmo 系列为什么把稳定性修复留在了架构里、OPT-175B 与 BLOOM 日志本留下的失败记录原型,以及 SmolLM3 与 Marin 公开的数据混合实验笔记。每个案例都附上出处链接,并
2026-08-02 · 20 分钟阅读 #mlops#llm-training#case-study#training-stability#scaling