태그: #training-stability
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 2 편
정규화와 활성화 — 학습을 무너뜨리지 않는 법
RMSNorm과 프리노름, SwiGLU가 왜 지금의 표준이 되었는지 config 값으로 확인하고, Qwen3의 QK-Norm과 Kimi K2의 QK-Clip처럼 어텐션 로짓 폭주를 막는 최신 장치를 실제 리포트의 수치와 함께 정리합니다. 안정성을 위해 무엇을 추가하고 무엇을 감수하는지 다룹니다.
2026-08-12 · 11 분 읽기 #ai-papers#model-internals#rmsnorm#swiglu#training-stability공개된 학습 사례에서 배우기 — 무엇을 시도했고 무엇이 실패했나
공개된 대규모 학습 기술 보고서와 로그북 일곱 건을 골라 성공 지표가 아니라 실패와 대응만 뽑아 정리했습니다. Llama 3 405B의 54일간 419건 중단 통계에서 체크포인트 주기를 역산하고, DeepSeek-V3와 Kimi K2가 손실 스파이크를 각각 다른 층위에서 없앤 방식을 비교합니다. Olmo 계열이 안정성 수정을 아키텍처에 남긴 이유, OPT-175B와 BLOOM 로그북이 남긴
2026-08-02 · 24 분 읽기 #mlops#llm-training#case-study#training-stability#scaling