태그: #mixtralmoe
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 1 편
LLM 사전 학습 & 스케일링 법칙: Chinchilla, Flash Attention, MoE까지
Chinchilla 스케일링 법칙, Common Crawl 데이터 준비, Flash Attention 2, GQA, MoE 아키텍처부터 DeepSeek-V3, Llama 3.1 사전 학습 레시피까지 LLM 사전 학습 완전 가이드입니다.
2026-03-17 · 22 분 읽기 #llm-pretraining#scaling-laws#chinchilla#flash-attention#mixtralmoe