태그: #model-internals
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 8 편
토크나이저 내부 — 한국어가 토큰을 더 먹는 이유와 그 비용
바이트 수준 BPE가 어떻게 동작하는지 설명하고, Qwen3와 DeepSeek-V3, Mixtral의 실제 토크나이저 파일을 내려받아 같은 뜻의 영어와 한국어 문장을 직접 토큰화해 비교합니다. 어휘 크기의 트레이드오프, config의 vocabsize와 실제 어휘 수가 다른 이유, 그리고 토큰 수가 비용과 문맥 창에 미치는 영향을 정리합니다.
2026-08-12 · 11 분 읽기 #ai-papers#model-internals#tokenizer#bpe#korean-nlp정규화와 활성화 — 학습을 무너뜨리지 않는 법
RMSNorm과 프리노름, SwiGLU가 왜 지금의 표준이 되었는지 config 값으로 확인하고, Qwen3의 QK-Norm과 Kimi K2의 QK-Clip처럼 어텐션 로짓 폭주를 막는 최신 장치를 실제 리포트의 수치와 함께 정리합니다. 안정성을 위해 무엇을 추가하고 무엇을 감수하는지 다룹니다.
2026-08-12 · 11 분 읽기 #ai-papers#model-internals#rmsnorm#swiglu#training-stability어텐션 변형 — MHA에서 MLA까지, KV 캐시는 어떻게 줄어드는가
MHA, MQA, GQA, MLA를 실제 config 값으로 비교합니다. Qwen3, Mixtral, GLM-4.5의 그룹 쿼리 어텐션과 DeepSeek-V3, Kimi K2의 잠재 어텐션이 토큰당 KV 캐시를 몇 배 줄이는지 공식과 숫자로 계산하고, 그 대가로 무엇을 내주는지 정리합니다.
2026-08-12 · 10 분 읽기 #ai-papers#model-internals#attention#gqa#mla기술 리포트 비판적으로 읽기 — 무엇이 적히고 무엇이 빠지는가
모델 기술 리포트에서 검증 가능한 항목과 검증 불가능한 항목을 구분하는 법을 정리합니다. 자체 보고 벤치마크의 한계, config와 리포트가 어긋나는 지점, 게이트된 저장소에서 확인할 수 없는 값, 그리고 시리즈 전체에서 쓴 확인 절차를 실제 사례로 보여 줍니다.
2026-08-12 · 13 분 읽기 #ai-papers#model-internals#tech-report#benchmarks#evaluationMoE 라우팅 — 전문가는 어떻게 뽑히는가
전문가 혼합 계층의 config 필드를 실제 모델로 읽습니다. Mixtral의 8개 중 2개, Qwen3의 128개 중 8개, DeepSeek-V3의 256개 라우팅 전문가와 공유 전문가, Kimi K2의 희소도 48을 비교하고, 활성 파라미터와 전체 파라미터가 왜 다른 비용을 만드는지, 로드 밸런싱 손실과 보조 손실 없는 편향 방식이 무엇을 맞바꾸는지 정리합니다.
2026-08-12 · 11 분 읽기 #ai-papers#model-internals#mixture-of-experts#moe#routing학습 레시피 — 사전학습에서 후학습까지, 리포트는 무엇을 적는가
Llama 3의 세 단계와 여섯 번의 컨텍스트 확장, Qwen3의 세 단계 사전학습, DeepSeek-V3의 학습률 스케줄과 두 단계 YaRN 확장, Kimi K2의 데이터 재작성 실험을 리포트에 적힌 그대로 비교하고, 학습 단계 기술을 읽는 법을 정리합니다.
2026-08-12 · 12 분 읽기 #ai-papers#model-internals#pretraining#training-recipe#data-mixture위치 인코딩 — RoPE와 컨텍스트 확장의 대가
ropetheta 하나가 문맥 길이에 어떻게 작용하는지 파장 계산으로 보여 주고, Llama 3의 500000, Qwen3의 ABF, DeepSeek-V3와 Kimi K2의 YaRN 설정, GLM-4.5의 부분 회전을 실제 config로 비교합니다. 긴 컨텍스트가 왜 공짜가 아닌지 프리필 연산량과 캐시 비용으로 정리합니다.
2026-08-12 · 11 분 읽기 #ai-papers#model-internals#rope#positional-encoding#long-contextconfig.json 완전 해부 — 설정 파일 한 장으로 모델 구조 읽기
hiddensize, numhiddenlayers, numattentionheads와 numkeyvalueheads, headdim, intermediatesize, ropetheta, vocabsize, tiewordembeddings까지 config.json의 모든 필드가 메모리와 속도에 어떻게 나타나는지 설명하고, Qwen3-8B와 Mixtral-8x7B의 파라미터 수를 손으로 세어 공
2026-08-12 · 10 분 읽기 #ai-papers#model-internals#config-json#transformer#llm-architecture