タグ: #training-recipe
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 1 件
学習レシピ — 事前学習から後学習まで、レポートは何を書くか
Llama 3 の三段階と六回の文脈拡張、Qwen3 の三段階事前学習、DeepSeek-V3 の学習率スケジュールと二段階 YaRN 拡張、Kimi K2 のデータ再記述実験を、レポートに書かれたとおりに比較し、学習段階の記述を読む方法を整理します。
2026-08-12 · 12 分で読めます #ai-papers#model-internals#pretraining#training-recipe#data-mixture