タグ: #mixture-of-experts
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 1 件
MoE ルーティング — 専門家はどう選ばれるか
専門家混合層の config フィールドを実際のモデルで読みます。Mixtral の 8 個中 2 個、Qwen3 の 128 個中 8 個、DeepSeek-V3 の 256 個のルーティング専門家と共有専門家、Kimi K2 の希薄度 48 を比較し、活性パラメータと全パラメータがなぜ異なるコストを生むのか、ロードバランシング損失と補助損失なしのバイアス方式が何を引き換えにするのかを整理します。
2026-08-12 · 11 分で読めます #ai-papers#model-internals#mixture-of-experts#moe#routing