标签: #training
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 5 篇
改变 LoRA 的 rank 就要跟着改学习率吗 — μA(2026) 划出的两种机制,以及这个测量结果的边界
LoRA 中改变 rank 就必须重新寻找最优学习率的说法,和「用 1/r 缩放,学习率就与 rank 无关」的说法,在实务中同时流传。2026 年 2 月挂上 arXiv 的 μA(Maximal-Update Adaptation) 论文说,这两种说法都对 — 只是取决于你用的是哪种 α 约定、哪种初始化。本文梳理 μA 推导出的两种机制(η 与 rank 的 -1/2 次方成正比的情形,vs 与 rank 无关的情形),以及论文主
2026-07-16 · 28 分钟阅读 #llm#lora#fine-tuning#peft#trainingLLM 训练数据预处理完全指南 — 从网页抓取到 Token 打包,附最新论文
好模型来自好数据,好数据来自预处理流水线。本文逐步讲解预训练数据要经过的全部工序 — 网页抓取采集 → 正文抽取 → 语言识别 → 启发式规则与分类器结合的质量过滤 → 精确去重与近似(MinHash)去重 → PII·毒性处理 → 基准测试污染清除 → 分词与序列打包,并介绍 SFT 数据整理的要点、datatrove、Dolma、NeMo Curator 等工具,以及从 The Pile 到 FineWeb、DCLM 这些改变了这一
2026-07-09 · 12 分钟阅读 #ai#llm#data-engineering#preprocessing#trainingAI 模型开发,从头到尾 — 从数据到部署的现实生命周期
模型开发不是从预训练开始,而是从决策阶梯开始 — 靠提示词能不能解决,靠 RAG 能不能解决,是否需要微调。先做评估集再做模型的 eval-first 原则、数据质量与合成数据的陷阱、缩放定律与分布式训练、从 LoRA 到 DPO 的微调光谱、量化与连续批处理的服务,以及部署后的数据飞轮 — 本文按实务顺序梳理 AI 模型开发的完整生命周期。
2026-07-07 · 14 分钟阅读 #ai#ml#llm#mlops#training深度学习训练方法完全指南:从优化到分布式训练
一份系统讲解深度学习模型高效训练全部技巧的完整指南。通过实战代码学习梯度下降法、优化器、学习率调度、正则化、批归一化、迁移学习、微调,直至分布式训练。
2026-03-17 · 38 分钟阅读 #deep-learning#training#optimization#regularization#distributed-training深度学习调试完全指南:从训练失败诊断到性能优化
系统性诊断和解决深度学习模型训练失败的完全指南。涵盖 Loss NaN、梯度消失/爆炸、过拟合、收敛缓慢、显存不足等所有常见问题的原因与解决方案,并配有实战代码。
2026-03-17 · 30 分钟阅读 #deep-learning#debugging#pytorch#training#optimization