タグ: #llm-training
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 3 件
公開された学習事例から学ぶ — 何を試し、何が失敗したか
公開された大規模学習の技術報告書とログブック七件を選び、成功指標ではなく失敗とその対応だけを抜き出して整理しました。Llama 3 405Bの54日間419件の中断統計からチェックポイント周期を逆算し、DeepSeek-V3とKimi K2が損失スパイクをそれぞれ異なる層でなくした方法を比較します。Olmo系列が安定性の修正をアーキテクチャに残した理由、OPT-175BとBLOOMのログブックが残した失敗記録の原型、SmolLM3とMa
2026-08-02 · 23 分で読めます #mlops#llm-training#case-study#training-stability#scaling2026年のLLM学習スタック地図 — 各層が何を代わりにやってくれて、何を隠すか
LLM学習フレームワークを三つの層に分けて系譜を整理しました。下の層はPyTorch分散、DeepSpeed、Megatron-Coreのような実行エンジンで、真ん中はtorchtitanやMegatron-Bridgeのような学習ループ、上の層はTRLやAxolotlのように設定ファイルでファインチューニングを回してくれる道具です。各層が何を代わりにやってくれて、代わりに何を隠すのか、そして上位フレームワークがむしろ邪魔になる地点はど
2026-08-02 · 21 分で読めます #mlops#llm-training#pytorch#trl#framework分散学習 & GPUインフラ 2026 ディープダイブ — DeepSpeed、FSDP2、Megatron-LM、Ray Train、JAX、TorchTitan、Blackwell GB200、MI325X、TPU v5p 総まとめ
DeepSpeed/FSDP2/Megatron-LM/Ray Train/JAX/TorchTitan/Composerを比較し、NVIDIA Blackwell GB200 NVL72、AMD MI325X、Intel Gaudi 3、AWS Trainium 2、Google TPU v5p/v6e Trillimuまで。3D並列化、ZeRO-FSDP等価性、MoEのAll-to-All、fp8/mxfp4精度、NCCLチューニン
2026-05-16 · 20 分で読めます #distributed-training#deepspeed#fsdp#megatron-lm#ray