タグ: #vocab-size
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 1 件
トークナイザの内部 — 日本語がトークンを多く食う理由とその代価
バイトレベル BPE の仕組みを説明し、Qwen3、DeepSeek-V3、Mixtral の実際のトークナイザファイルをダウンロードして同じ意味の英語と韓国語の文章を直接トークン化して比較します。語彙サイズのトレードオフ、config の vocabsize と実際の語彙数が異なる理由、トークン数がコストと文脈窓に与える影響を整理します。
2026-08-12 · 11 分で読めます #ai-papers#model-internals#tokenizer#bpe#korean-nlp