タグ: #scaling-laws
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 2 件
LLM ランドマーク論文ロードマップ 2026 - Transformer / Scaling Laws / Flash Attention / Mamba / DeepSeek-R1 / Titans 徹底解説
2017年の Attention Is All You Need から 2026年の Titans と DeepSeek-R1 まで、LLM 時代を作った 50 篇超のランドマーク論文をテーマ別に整理する。Transformer、BERT、GPT 1-3、Scaling Laws、Chinchilla、InstructGPT、PaLM、FlashAttention 1-3、LLaMA 1-4、GPT-4、Mistral と Mixtra
2026-05-16 · 31 分で読めます #llm-papers#transformer#scaling-laws#flash-attention#mamba大規模モデルトレーニング完全ガイド:1000億パラメータ超LLM事前学習の実践戦略
1000億パラメータ超LLMの事前学習を完全解説。スケーリング則(Chinchilla)、Megatron-LM、3D並列化、チェックポイント戦略、学習安定性、データ混合まで実践例とともに徹底解説。
2026-03-17 · 26 分で読めます #large-scale-training#llm#megatron-lm#distributed-training#scaling-laws