タグ: #korean-nlp
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 4 件
韓国語に対応するオープンモデルとトークナイザのコスト
韓国語対応という表記は、その言語を処理するという意味であって上手だという保証ではありません。この記事は2026-08-12に確認した韓国語特化・バイリンガル・多言語のオープンモデルのカード値を整理し、トークナイザが韓国語をどう分割するかがなぜそのままコストとコンテキスト消費になるのか、そしてそれを自分で測る方法を説明します。韓国語モデルで特に分かれるライセンス類型も扱います。オープンモデルガイドシリーズ第4回です。
2026-08-12 · 11 分で読めます #ai#llm#huggingface#open-source-llm#korean-nlpトークナイザの内部 — 日本語がトークンを多く食う理由とその代価
バイトレベル BPE の仕組みを説明し、Qwen3、DeepSeek-V3、Mixtral の実際のトークナイザファイルをダウンロードして同じ意味の英語と韓国語の文章を直接トークン化して比較します。語彙サイズのトレードオフ、config の vocabsize と実際の語彙数が異なる理由、トークン数がコストと文脈窓に与える影響を整理します。
2026-08-12 · 11 分で読めます #ai-papers#model-internals#tokenizer#bpe#korean-nlp韓国語LLM学習データ制作完全ガイド:Hugging Faceデータセット、前処理、品質管理まで
LLM学習データ制作の全て!Hugging Faceデータセット(種類/ローディング/変換)、韓国語データ収集(クローリング/合成/翻訳)、前処理(トークン化/クリーニング/重複除去)、Instruction Tuningフォーマット(Alpaca/ShareGPT/OpenAI)、品質管理、RLHF/DPOデータセット。
2026-03-25 · 28 分で読めます #llm#training-data#huggingface#dataset#korean-nlp韓国語NLPとLLM完全ガイド:KoBERT、KLUE、HyperCLOVA、EXAONEマスター
韓国語NLPとLLMの包括的ガイド。KoBERT、KLUE、HyperCLOVA、EXAONEをカバー。
2026-03-17 · 28 分で読めます #korean-nlp#kobert#klue#hyperclova#exaone