태그: #tokenizer
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 4 편
한국어를 지원하는 오픈 모델과 토크나이저 비용
한국어 지원이라는 표기는 그 언어를 처리한다는 뜻이지 잘한다는 보장이 아닙니다. 이 글은 2026-08-12에 확인한 한국어 전용·이중언어 오픈 모델과 다국어 모델의 카드 값을 정리하고, 토크나이저가 한국어를 어떻게 쪼개는지가 왜 그대로 비용과 컨텍스트 소모로 이어지는지, 그리고 그것을 직접 재는 방법을 설명합니다. 한국어 모델에서 특히 갈리는 라이선스 유형도 함께 다룹니다. 오픈 모델 가이
2026-08-12 · 12 분 읽기 #ai#llm#huggingface#open-source-llm#korean-nlp토크나이저 내부 — 한국어가 토큰을 더 먹는 이유와 그 비용
바이트 수준 BPE가 어떻게 동작하는지 설명하고, Qwen3와 DeepSeek-V3, Mixtral의 실제 토크나이저 파일을 내려받아 같은 뜻의 영어와 한국어 문장을 직접 토큰화해 비교합니다. 어휘 크기의 트레이드오프, config의 vocabsize와 실제 어휘 수가 다른 이유, 그리고 토큰 수가 비용과 문맥 창에 미치는 영향을 정리합니다.
2026-08-12 · 11 분 읽기 #ai-papers#model-internals#tokenizer#bpe#korean-nlp모델 카드를 제대로 읽는 법 — 5분 안에 필요한 것만 뽑아내기
모델 카드는 위에서 아래로 읽으면 필요한 정보를 못 찾도록 쓰여 있습니다. 벤치마크 표가 화면의 절반을 차지하는 동안 라이선스와 채팅 템플릿은 한 줄로 지나갑니다. 이 글은 카드를 읽는 순서를 뒤집어, 배포 판단에 실제로 필요한 일곱 가지를 5분 안에 뽑아내는 방법을 정리했습니다. 가중치 공개와 오픈소스가 어떻게 다른지, 카드의 점수를 왜 그대로 믿으면 안 되는지, 컨텍스트 길이 표기가 무엇
2026-08-02 · 33 분 읽기 #llm#huggingface#model-card#license#tokenizerLLM을 바닥부터 만들어보기 — 스탠퍼드 CS336 스타일 학습 로드맵
스탠퍼드 CS336(Language Modeling from Scratch)이 해커뉴스 상위권에 오르며 from-scratch LLM 학습이 다시 화제입니다. 토크나이저부터 어텐션, 분산 학습, 스케일링 법칙, 정렬, 추론 최적화까지 전체 커리큘럼을 해부하고 20주 학습 플랜과 미니 프로젝트 아이디어를 정리했습니다.
2026-06-12 · 27 분 읽기 #llm#transformer#cs336#deep-learning#tokenizer