タグ: #model-internals
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 8 件
トークナイザの内部 — 日本語がトークンを多く食う理由とその代価
バイトレベル BPE の仕組みを説明し、Qwen3、DeepSeek-V3、Mixtral の実際のトークナイザファイルをダウンロードして同じ意味の英語と韓国語の文章を直接トークン化して比較します。語彙サイズのトレードオフ、config の vocabsize と実際の語彙数が異なる理由、トークン数がコストと文脈窓に与える影響を整理します。
2026-08-12 · 11 分で読めます #ai-papers#model-internals#tokenizer#bpe#korean-nlp正規化と活性化 — 学習を壊さないために
RMSNorm とプレノルム、SwiGLU がなぜ現在の標準になったのかを config の値で確認し、Qwen3 の QK-Norm や Kimi K2 の QK-Clip のようにアテンションロジットの暴走を止める新しい仕組みを、各レポートが記す数値とともに整理します。安定性のために何を足し、何を引き受けるのかを扱います。
2026-08-12 · 11 分で読めます #ai-papers#model-internals#rmsnorm#swiglu#training-stabilityアテンションの変種 — MHA から MLA まで、KV キャッシュはどう縮むか
MHA、MQA、GQA、MLA を実際の config 値で比較します。Qwen3、Mixtral、GLM-4.5 のグループクエリアテンションと、DeepSeek-V3、Kimi K2 の潜在アテンションがトークンあたりの KV キャッシュを何倍縮めるのかを式と数字で計算し、その代償に何を差し出すのかを整理します。
2026-08-12 · 10 分で読めます #ai-papers#model-internals#attention#gqa#mla学習レシピ — 事前学習から後学習まで、レポートは何を書くか
Llama 3 の三段階と六回の文脈拡張、Qwen3 の三段階事前学習、DeepSeek-V3 の学習率スケジュールと二段階 YaRN 拡張、Kimi K2 のデータ再記述実験を、レポートに書かれたとおりに比較し、学習段階の記述を読む方法を整理します。
2026-08-12 · 12 分で読めます #ai-papers#model-internals#pretraining#training-recipe#data-mixture位置エンコーディング — RoPE と文脈拡張の代償
ropetheta 一つが文脈長にどう作用するかを波長の計算で示し、Llama 3 の 500000、Qwen3 の ABF、DeepSeek-V3 と Kimi K2 の YaRN 設定、GLM-4.5 の部分回転を実際の config で比較します。長い文脈がなぜ無料でないのかを、プリフィルの演算量とキャッシュのコストから整理します。
2026-08-12 · 11 分で読めます #ai-papers#model-internals#rope#positional-encoding#long-contextconfig.json 完全解剖 — 設定ファイル一枚でモデル構造を読む
hiddensize、numhiddenlayers、numattentionheads と numkeyvalueheads、headdim、intermediatesize、ropetheta、vocabsize、tiewordembeddings まで、config.json の各フィールドがメモリと速度にどう現れるかを説明し、Qwen3-8B と Mixtral-8x7B のパラメータ数を手で数えて公開されたテンソル数と正確に一
2026-08-12 · 10 分で読めます #ai-papers#model-internals#config-json#transformer#llm-architecture技術レポートを批判的に読む — 何が書かれ、何が抜けるか
モデル技術レポートで検証可能な項目と検証不可能な項目を区別する方法を整理します。自己申告ベンチマークの限界、config とレポートが食い違う箇所、ゲートされたリポジトリで確認できなかった値、そしてシリーズ全体で用いた確認手順を実例とともに示します。
2026-08-12 · 13 分で読めます #ai-papers#model-internals#tech-report#benchmarks#evaluationMoE ルーティング — 専門家はどう選ばれるか
専門家混合層の config フィールドを実際のモデルで読みます。Mixtral の 8 個中 2 個、Qwen3 の 128 個中 8 個、DeepSeek-V3 の 256 個のルーティング専門家と共有専門家、Kimi K2 の希薄度 48 を比較し、活性パラメータと全パラメータがなぜ異なるコストを生むのか、ロードバランシング損失と補助損失なしのバイアス方式が何を引き換えにするのかを整理します。
2026-08-12 · 11 分で読めます #ai-papers#model-internals#mixture-of-experts#moe#routing