タグ: #tokenizer
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 4 件
韓国語に対応するオープンモデルとトークナイザのコスト
韓国語対応という表記は、その言語を処理するという意味であって上手だという保証ではありません。この記事は2026-08-12に確認した韓国語特化・バイリンガル・多言語のオープンモデルのカード値を整理し、トークナイザが韓国語をどう分割するかがなぜそのままコストとコンテキスト消費になるのか、そしてそれを自分で測る方法を説明します。韓国語モデルで特に分かれるライセンス類型も扱います。オープンモデルガイドシリーズ第4回です。
2026-08-12 · 11 分で読めます #ai#llm#huggingface#open-source-llm#korean-nlpトークナイザの内部 — 日本語がトークンを多く食う理由とその代価
バイトレベル BPE の仕組みを説明し、Qwen3、DeepSeek-V3、Mixtral の実際のトークナイザファイルをダウンロードして同じ意味の英語と韓国語の文章を直接トークン化して比較します。語彙サイズのトレードオフ、config の vocabsize と実際の語彙数が異なる理由、トークン数がコストと文脈窓に与える影響を整理します。
2026-08-12 · 11 分で読めます #ai-papers#model-internals#tokenizer#bpe#korean-nlpモデルカードを正しく読む方法 — 5分で必要なものだけ抜き出す
モデルカードは上から下へ読むと必要な情報にたどり着けないように書かれています。ベンチマーク表が画面の半分を占める一方で、ライセンスとチャットテンプレートは一行で通り過ぎます。この記事はカードを読む順序を逆転させ、配備判断に実際に必要な七つを5分で抜き出す方法を整理しました。重みの公開とオープンソースがどう違うか、カードの点数をそのまま信じてはいけない理由、コンテキスト長の表記が何を隠しているか、そしてトークナイザとチャットテンプレートで
2026-08-02 · 33 分で読めます #llm#huggingface#model-card#license#tokenizerLLMをゼロから作ってみる — スタンフォードCS336流の学習ロードマップ
スタンフォードのCS336(Language Modeling from Scratch)がHacker Newsの上位に登場し続け、ゼロからのLLM構築が再び話題になっています。トークナイザーからアテンション、分散学習、スケーリング則、アライメント、推論最適化までカリキュラム全体を解剖し、20週間の学習プランとミニプロジェクトのアイデアをまとめました。
2026-06-12 · 24 分で読めます #llm#transformer#cs336#deep-learning#tokenizer