タグ: #training-stability
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 2 件
正規化と活性化 — 学習を壊さないために
RMSNorm とプレノルム、SwiGLU がなぜ現在の標準になったのかを config の値で確認し、Qwen3 の QK-Norm や Kimi K2 の QK-Clip のようにアテンションロジットの暴走を止める新しい仕組みを、各レポートが記す数値とともに整理します。安定性のために何を足し、何を引き受けるのかを扱います。
2026-08-12 · 11 分で読めます #ai-papers#model-internals#rmsnorm#swiglu#training-stability公開された学習事例から学ぶ — 何を試し、何が失敗したか
公開された大規模学習の技術報告書とログブック七件を選び、成功指標ではなく失敗とその対応だけを抜き出して整理しました。Llama 3 405Bの54日間419件の中断統計からチェックポイント周期を逆算し、DeepSeek-V3とKimi K2が損失スパイクをそれぞれ異なる層でなくした方法を比較します。Olmo系列が安定性の修正をアーキテクチャに残した理由、OPT-175BとBLOOMのログブックが残した失敗記録の原型、SmolLM3とMa
2026-08-02 · 23 分で読めます #mlops#llm-training#case-study#training-stability#scaling