태그: #korean-nlp
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 5 편
한국어를 지원하는 오픈 모델과 토크나이저 비용
한국어 지원이라는 표기는 그 언어를 처리한다는 뜻이지 잘한다는 보장이 아닙니다. 이 글은 2026-08-12에 확인한 한국어 전용·이중언어 오픈 모델과 다국어 모델의 카드 값을 정리하고, 토크나이저가 한국어를 어떻게 쪼개는지가 왜 그대로 비용과 컨텍스트 소모로 이어지는지, 그리고 그것을 직접 재는 방법을 설명합니다. 한국어 모델에서 특히 갈리는 라이선스 유형도 함께 다룹니다. 오픈 모델 가이
2026-08-12 · 12 분 읽기 #ai#llm#huggingface#open-source-llm#korean-nlp토크나이저 내부 — 한국어가 토큰을 더 먹는 이유와 그 비용
바이트 수준 BPE가 어떻게 동작하는지 설명하고, Qwen3와 DeepSeek-V3, Mixtral의 실제 토크나이저 파일을 내려받아 같은 뜻의 영어와 한국어 문장을 직접 토큰화해 비교합니다. 어휘 크기의 트레이드오프, config의 vocabsize와 실제 어휘 수가 다른 이유, 그리고 토큰 수가 비용과 문맥 창에 미치는 영향을 정리합니다.
2026-08-12 · 11 분 읽기 #ai-papers#model-internals#tokenizer#bpe#korean-nlp한국어 LLM 학습 데이터 제작 완전 가이드: Hugging Face 데이터셋, 전처리, 품질 관리까지
LLM 학습 데이터 제작의 모든 것! Hugging Face 데이터셋(종류/로딩/변환), 한국어 데이터 수집(크롤링/합성/번역), 전처리(토크나이징/정제/중복제거), Instruction Tuning 포맷(Alpaca/ShareGPT/OpenAI), 품질 관리, RLHF/DPO 데이터셋.
2026-03-25 · 35 분 읽기 #llm#training-data#huggingface#dataset#korean-nlp한국어 NLP와 LLM 완전 가이드: KoBERT, KLUE, HyperCLOVA, EXAONE 마스터하기
한국어 NLP와 LLM의 모든 것을 다루는 완전 가이드. KoBERT, KoELECTRA, KLUE 벤치마크, HyperCLOVA X, EXAONE, Llama 한국어 파인튜닝까지 실전 코드와 함께 한국어 AI 개발을 완벽히 마스터합니다.
2026-03-17 · 28 분 읽기 #korean-nlp#kobert#klue#hyperclova#exaoneNLP & 텍스트 처리 완전 정복: BERT fine-tuning부터 RAG 시스템, 다국어 처리까지
BPE 토큰화, Word2Vec, BERT fine-tuning, RAG 파이프라인, 한국어 형태소 분석까지 NLP & 텍스트 처리 완전 가이드입니다.
2026-03-17 · 26 분 읽기 #nlp#bert#임베딩#rag#korean-nlp