タグ: #deepseek
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 13 件
DeepSeek V4 Flashが実際に変えるもの — リーダーボードではなく能力あたり単価の問題
2026年7月31日、DeepSeekがV4-Flash APIを公開ベータに切り替えました。アーキテクチャは4月のプレビューと同じ284Bの総パラメータ・13BアクティブのMoEに1Mコンテキストで、変わったのはポストトレーニングだけです。公式チェンジログが公開したスコアはTerminal Bench 2.1で82.7、Toolathlon verifiedで70.3ですが、これらの数字はDeepSeekが自社ハーネスで測ったベンダー
2026-07-31 · 19 分で読めます #ai#llm#deepseek#inference-cost#moeオープンソースLLM 2026 完全ガイド - Llama 4 · DeepSeek V3 + R1 · Qwen 3 · Mistral Large 2 · Phi-4 · Gemma 3 · Falcon 3 徹底分析
2026年春、オープンソースLLMはもはやクローズドモデルの影ではない。Meta Llama 4 (Scout 109B、Maverick 400B MoE、Behemoth 2T)、Llama 3.3 70Bの最後のデンスベースライン、DeepSeek V3 671B MoEとR1推論モデル、Alibaba Qwen 3とQwen 2.5 Coder、Mistral Large 2 123BとPixtral・Codestral・Min
2026-05-16 · 44 分で読めます #open-source-llm#llama-4#deepseek#qwen#mistralLLM論文キュレーション 2024-2026 - Llama・DeepSeek・Qwen・Mistral・Phi・RLHF・DPO・CoT・RAG・FlashAttention・vLLM 詳細ガイド
LLMを構築し運用するエンジニアのための2024-2026必読論文30+本キュレーション。基盤モデル(Llama 3/4、DeepSeek-V3/R1、Qwen3、Mistral、Phi-4、Gemma 3)、学習革新(MoE、MLA、GQA)、ポストトレーニング(RLHF、DPO、ORPO、KTO)、推論(CoT、ToT、GRPO)、エージェント(ReAct、SWE-Agent)、検索(RAG、GraphRAG、ColBERT)、効率
2026-05-16 · 25 分で読めます #llm#papers#llama#deepseek#qwen中国AIラボ 2026 — DeepSeek・Qwen・Kimi・GLM・Yi・Doubao・Hunyuan 徹底ガイド(オープンウェイトの新しい重心)
2024年12月、DeepSeek-V3が671B MoEを公開し、2025年1月にR1がreasoningまでオープンウェイトで放った瞬間、世界は一瞬止まった。その間にアリババのQwen 3は235B-A22Bで事実上オープンウェイトの新基準となり、MoonshotのKimi K2は1T MoEとロングコンテキストでlong-form王者となり、ZhipuのGLM-4.5はagentic・multimodalへ舵を切り、01.AIのY
2026-05-15 · 34 分で読めます #ai#china#deepseek#qwen#alibabaLLM ランドマーク論文ガイド — Attention から GPT・LLaMA・DeepSeek・o1・Claude まで (参考文献付き、2026)
LLM 分野の本当の変化は、どの論文から始まったのか。2017 年の Attention is All You Need から 2026 年の推論モデルまで、必ず知っておくべきランドマーク論文 20 編余りを時期・テーマ別に整理する。各論文は『なぜ重要か・一言要約・後続の影響』で凝縮し、arXiv・ブログのリンクを末尾にまとめた。時間の足りないエンジニアのための LLM 論文地図。
2026-05-14 · 22 分で読めます #llm#research-papers#transformer#gpt#llama2025年オープンソースAIモデル完全比較:DeepSeek R1 vs Llama 4 vs Qwen 3 vs Mistral
DeepSeek R1(671B/37B)、Llama 4 Scout/Maverick、Qwen 3(235B MoE)、Mistral 8x22B — 2025年オープンソースAIモデル4強完全比較。ベンチマーク、ライセンス、デプロイ方法、コスト分析まで。
2026-03-22 · 59 分で読めます #open-source#ai#llm#deepseek#llama2025年3月テック・AI・K-POPウィークリーダイジェスト:GTCからBTSカムバックまで
NVIDIA GTC 2025 Blackwell Ultra発表、Gemini 2.5 Proのベンチマーク制覇、MCPの業界標準化、DeepSeek-R1オープンソースの衝撃、BTS 5年ぶりの完全体カムバック、JENNIEソロアルバムのミリオンセラー達成など、2025年3月のテック・AI・K-POPの核心トレンドを一挙に整理します。
2026-03-21 · 19 分で読めます #culture#ai#kpop#nvidia#gtcオープンソースLLM完全ガイド:Llama 3、Mistral、DeepSeek、Qwen、Gemma総まとめ
Llama 3、Mistral、DeepSeek、Qwen、GemmaをカバーするオープンソースLLMの包括的ガイド。
2026-03-17 · 19 分で読めます #llm#llama#mistral#deepseek#qwenLLM事前学習とスケーリング則:Chinchillaからフラッシュアテンション・MoEまで
Chinchillaスケーリング則、Common Crawlデータパイプライン、Flash Attention 2、GQA、MoEアーキテクチャから DeepSeek-V3・Llama 3.1の最新事前学習レシピまでを網羅したLLM事前学習完全ガイドです。
2026-03-17 · 20 分で読めます #LLM事前学習#スケーリング則#chinchilla#flash-attention#mixtralmoeMixture of Experts(MoE)アーキテクチャ論文深掘り分析:GShardからDeepSeek-MoEまで
Mixture of Expertsアーキテクチャの核心論文を分析し、GShard、Switch Transformer、Mixtral、DeepSeek-MoEのルーティング戦略と学習安定性手法を比較します。
2026-03-14 · 34 分で読めます #ai-papers#moe#transformer#deepseekMixture of Experts(MoE)アーキテクチャ徹底分析:Switch TransformerからMixtral・DeepSeekまで
Mixture of Experts(MoE)アーキテクチャを徹底分析します。Sparse MoEの数学的基礎からSwitch Transformer、Mixtral 8x7B、DeepSeek-V3のルーティング戦略、学習安定性手法、推論最適化まで論文ベースで詳細に解説します。
2026-03-10 · 21 分で読めます #ai-papers#moe#transformer#mixtral#deepseekSparse Mixture of Experts(MoE)アーキテクチャ深層分析:設計原理からDeepSeek-V3・Qwen3まで
Sparse MoEアーキテクチャの数学的原理、ルーティング戦略、ロードバランシング手法を分析し、Switch TransformerからDeepSeek-V3・Qwen3-235Bまでの最新MoEモデルの設計選択と実践的な学習・推論最適化を解説する。
2026-03-06 · 35 分で読めます #ai-papers#moe#sparse-model#deepseek#2026-03Mixture of Experts(MoE)アーキテクチャ完全分析
Sparse MoEの原理からMixtral、DeepSeek-V3のMoE実装、ルーティング戦略、ロードバランシングまで、MoEアーキテクチャを完全分析します。
2026-03-03 · 9 分で読めます #ai-papers#moe#mixtral#deepseek#2026-03