태그: #pretraining
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 2 편
학습 레시피 — 사전학습에서 후학습까지, 리포트는 무엇을 적는가
Llama 3의 세 단계와 여섯 번의 컨텍스트 확장, Qwen3의 세 단계 사전학습, DeepSeek-V3의 학습률 스케줄과 두 단계 YaRN 확장, Kimi K2의 데이터 재작성 실험을 리포트에 적힌 그대로 비교하고, 학습 단계 기술을 읽는 법을 정리합니다.
2026-08-12 · 12 분 읽기 #ai-papers#model-internals#pretraining#training-recipe#data-mixture이 모델들은 어떻게 만들어졌나 — 2026년 오픈 웨이트 파이프라인 해부
2026년 8월 기준 허깅페이스 상위권에 올라 있는 오픈 웨이트 모델들의 카드와 기술 보고서를 읽고, 데이터 수집부터 양자화 배포까지 제작 파이프라인을 순서대로 정리했습니다. MoE 희소성이 20배를 넘어선 이유, 전역 어텐션을 줄이는 네 가지 접근, 사전학습 토큰 예산과 안정화 기법, SFT 이후의 선호 최적화와 강화학습, 그리고 증류와 저비트 배포까지 실제 모델을 예시로 다룹니다. 중요한
2026-08-02 · 32 분 읽기 #llm#pretraining#moe#post-training#quantization