标签: #llm-training
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
从公开的训练案例中学习 —— 试过什么,又是什么失败了
挑选了七份公开的大规模训练技术报告与日志本,只抽取失败与应对,而不是成绩单。从 Llama 3 405B 54 天内 419 次中断的统计里反推出检查点周期,比较 DeepSeek-V3 与 Kimi K2 分别在哪一层消灭了损失尖峰。也讨论了 Olmo 系列为什么把稳定性修复留在了架构里、OPT-175B 与 BLOOM 日志本留下的失败记录原型,以及 SmolLM3 与 Marin 公开的数据混合实验笔记。每个案例都附上出处链接,并
2026-08-02 · 20 分钟阅读 #mlops#llm-training#case-study#training-stability#scaling2026 年 LLM 训练技术栈地图 —— 每一层替你做了什么,又藏起了什么
把 LLM 训练框架分成三层来梳理谱系。最底层是 PyTorch 分布式、DeepSpeed、Megatron-Core 这类执行引擎;中间层是 torchtitan、Megatron-Bridge 这类训练循环;最上层是 TRL、Axolotl 这类靠一份配置文件就能跑起微调的工具。文中记录了每一层替你做了什么、又用这个换来了藏起什么,以及上层框架反而会碍事的那些地方。所有版本号与日期均于 2026 年 8 月 2 日直接在 PyPI
2026-08-02 · 19 分钟阅读 #mlops#llm-training#pytorch#trl#framework