タグ: #moe
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 16 件
テキストLLMの技術レポート、何を読むか — 順位ではなく設計判断を読む
テキストLLMの技術レポート9本を、arXivの原文アブストラクトで直接確認して整理しました。DeepSeek-V3とDeepSeek-R1、Qwen3、Gemma 3、Olmo 3、Kimi K2、MiniMax-01、Mellum2、s1がそれぞれ何を新しく行い、著者自身がどんな限界を述べているかを読みます。モデルの順位は扱いません。リーダーボードは動き続け、レポートの数値はほぼ自己申告だからです。領域別・最新技術レポートの読み方シ
2026-08-12 · 13 分で読めます #ai-papers#paper-review#technical-report#llm#moeMoE ルーティング — 専門家はどう選ばれるか
専門家混合層の config フィールドを実際のモデルで読みます。Mixtral の 8 個中 2 個、Qwen3 の 128 個中 8 個、DeepSeek-V3 の 256 個のルーティング専門家と共有専門家、Kimi K2 の希薄度 48 を比較し、活性パラメータと全パラメータがなぜ異なるコストを生むのか、ロードバランシング損失と補助損失なしのバイアス方式が何を引き換えにするのかを整理します。
2026-08-12 · 11 分で読めます #ai-papers#model-internals#mixture-of-experts#moe#routingこれらのモデルはどう作られたのか — 2026年オープンウェイトパイプライン解剖
2026年8月時点でHugging Faceの上位に並ぶオープンウェイトモデルのカードと技術レポートを読み、データ収集から量子化デプロイまでの制作パイプラインを順番に整理しました。MoEのスパース性が20倍を超えた理由、グローバルアテンションを減らす四つのアプローチ、事前学習のトークン予算と安定化技法、SFT後の選好最適化と強化学習、そして蒸留と低ビットデプロイまでを実際のモデルを例に扱います。重要な前提を先に明かすと、ほとんどのオープ
2026-08-02 · 31 分で読めます #llm#pretraining#moe#post-training#quantization26Bモデルを2GBのRAMで動かす原理 — 常駐メモリとワーキングセットは同じ数字ではない
2026年7月29日にShow HNへ上がったTurboFieldfareは、Gemma 4 26B-A4BをMシリーズのMacで約2GBのRAMで動かすと主張しています。ディスクには14.3GBが入り、RAMに常駐するのは1.35GBの共有コアだけで、トークンごとに必要なエキスパートの重みをSSDから読み込みます。この記事はその数字たちを自分で導出して検証します — 4ビットのグループ64量子化がなぜ重みあたり4.5ビットになって14
2026-07-31 · 20 分で読めます #ai#llm#quantization#apple-silicon#moeDeepSeek V4 Flashが実際に変えるもの — リーダーボードではなく能力あたり単価の問題
2026年7月31日、DeepSeekがV4-Flash APIを公開ベータに切り替えました。アーキテクチャは4月のプレビューと同じ284Bの総パラメータ・13BアクティブのMoEに1Mコンテキストで、変わったのはポストトレーニングだけです。公式チェンジログが公開したスコアはTerminal Bench 2.1で82.7、Toolathlon verifiedで70.3ですが、これらの数字はDeepSeekが自社ハーネスで測ったベンダー
2026-07-31 · 19 分で読めます #ai#llm#deepseek#inference-cost#moeTencent Hy3: 295B オープンウェイト MoE を冷静に読む
Tencent は2026年7月6日、Hy3 を Apache 2.0 で公開しました。総計295Bのうち21Bだけが活性化する MoE の推論・エージェント言語モデルです。何が実際に新しいのか、中国系オープンウェイトの流れの中でどこに位置するのか、そしてベンダーが自ら出したベンチマーク数値をどこまで信じるべきかを整理します。
2026-07-11 · 9 分で読めます #hy3#tencent#hunyuan#open-weights#moe遅いパソコンでGLM-5.2を動かす — colibrìが744Bモデルをディスクからストリーミングする仕組み
colibrìは純粋Cで約1,300行の推論エンジンで、744B(7,440億)パラメータのMoEモデルであるGLM-5.2を、RAM 25GBのコンシューマPCで動かします。鍵はMoEの疎性とディスクストリーミングです。約9.9GBの密なレイヤーだけをRAMに常駐させ、約370GBのルーテッドエキスパートはNVMe SSDに置いてトークンごとに必要な分だけ読み込みます。代償は正直に遅く、コールド状態で約0.05〜0.1 tok/s、実
2026-07-11 · 8 分で読めます #ai#llm#local-inference#moe#quantizationLLM論文キュレーション 2024-2026 - Llama・DeepSeek・Qwen・Mistral・Phi・RLHF・DPO・CoT・RAG・FlashAttention・vLLM 詳細ガイド
LLMを構築し運用するエンジニアのための2024-2026必読論文30+本キュレーション。基盤モデル(Llama 3/4、DeepSeek-V3/R1、Qwen3、Mistral、Phi-4、Gemma 3)、学習革新(MoE、MLA、GQA)、ポストトレーニング(RLHF、DPO、ORPO、KTO)、推論(CoT、ToT、GRPO)、エージェント(ReAct、SWE-Agent)、検索(RAG、GraphRAG、ColBERT)、効率
2026-05-16 · 25 分で読めます #llm#papers#llama#deepseek#qwen基盤モデルのアーキテクチャ 2026 — Transformer の次へ / Mamba 2 / Hyena / RWKV / RetNet / Griffin / Jamba / xLSTM / TTT / DiT / MoE / Flash Attention 3 徹底ガイド
2026 年の基盤モデル界隈はもはや Transformer 一色ではない。Vaswani 2017 「Attention is All You Need」は今も標準だが、その隣に Mamba/Mamba 2 のような状態空間モデル、RWKV/RetNet/Griffin の線形 RNN 復活組、AI21 Jamba と Falcon Mamba のハイブリッド、Sepp Hochreiter の xLSTM、Test-Time Tra
2026-05-16 · 30 分で読めます #foundation-models#transformer#attention-is-all-you-need#vaswani#mamba2025年オープンソースAIモデル完全比較:DeepSeek R1 vs Llama 4 vs Qwen 3 vs Mistral
DeepSeek R1(671B/37B)、Llama 4 Scout/Maverick、Qwen 3(235B MoE)、Mistral 8x22B — 2025年オープンソースAIモデル4強完全比較。ベンチマーク、ライセンス、デプロイ方法、コスト分析まで。
2026-03-22 · 59 分で読めます #open-source#ai#llm#deepseek#llama2025年AI研究トレンド総整理:HuggingFace人気論文からAI研究10大トレンドまで
HuggingFaceトレンディング論文TOP10と2025年AI研究10大トレンドを開発者視点でレビュー。DeepSeek-R1の純粋RL推論、Nemotron-Cascade 30B/3B MoE、GRPO、PagedAttention、100万トークンコンテキストの限界まで。
2026-03-21 · 28 分で読めます #ai-research#papers#huggingface#reasoning#moeMixture of Experts(MoE)アーキテクチャ論文深掘り分析:GShardからDeepSeek-MoEまで
Mixture of Expertsアーキテクチャの核心論文を分析し、GShard、Switch Transformer、Mixtral、DeepSeek-MoEのルーティング戦略と学習安定性手法を比較します。
2026-03-14 · 34 分で読めます #ai-papers#moe#transformer#deepseekMixture of Experts(MoE)アーキテクチャ深掘り分析:Switch TransformerからMixtralまでの発展と効率的スケーリング戦略
MoEアーキテクチャの核心原理からSwitch Transformerの単一エキスパートルーティング、Mixtral 8x7BのSparse MoE実装、DeepSeek-MoEの細分化戦略まで深掘り分析。ルーティングメカニズム、ロードバランシング損失、学習安定化手法、推論最適化、障害事例とチェックリストを扱います。
2026-03-11 · 26 分で読めます #ai-papers#moe#switch-transformer#mixtral#model-architectureMixture of Experts(MoE)アーキテクチャ徹底分析:Switch TransformerからMixtral・DeepSeekまで
Mixture of Experts(MoE)アーキテクチャを徹底分析します。Sparse MoEの数学的基礎からSwitch Transformer、Mixtral 8x7B、DeepSeek-V3のルーティング戦略、学習安定性手法、推論最適化まで論文ベースで詳細に解説します。
2026-03-10 · 21 分で読めます #ai-papers#moe#transformer#mixtral#deepseekSparse Mixture of Experts(MoE)アーキテクチャ深層分析:設計原理からDeepSeek-V3・Qwen3まで
Sparse MoEアーキテクチャの数学的原理、ルーティング戦略、ロードバランシング手法を分析し、Switch TransformerからDeepSeek-V3・Qwen3-235Bまでの最新MoEモデルの設計選択と実践的な学習・推論最適化を解説する。
2026-03-06 · 35 分で読めます #ai-papers#moe#sparse-model#deepseek#2026-03Mixture of Experts(MoE)アーキテクチャ完全分析
Sparse MoEの原理からMixtral、DeepSeek-V3のMoE実装、ルーティング戦略、ロードバランシングまで、MoEアーキテクチャを完全分析します。
2026-03-03 · 9 分で読めます #ai-papers#moe#mixtral#deepseek#2026-03