태그: #llm-training
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3 편
LLM 학습 스택 지도 2026 — 무엇이 무엇을 대신해 주고 무엇을 숨기는가
LLM 학습 프레임워크를 세 개 층으로 나눠 계보를 정리했습니다. 아래층은 PyTorch 분산, DeepSpeed, Megatron-Core 같은 실행 엔진이고, 가운데는 torchtitan과 Megatron-Bridge 같은 학습 루프이며, 위층은 TRL과 Axolotl처럼 설정 파일로 파인튜닝을 돌려 주는 도구입니다. 각 층이 무엇을 대신해 주고 대신 무엇을 감추는지, 그리고 상위 프레임
2026-08-02 · 23 분 읽기 #mlops#llm-training#pytorch#trl#framework공개된 학습 사례에서 배우기 — 무엇을 시도했고 무엇이 실패했나
공개된 대규모 학습 기술 보고서와 로그북 일곱 건을 골라 성공 지표가 아니라 실패와 대응만 뽑아 정리했습니다. Llama 3 405B의 54일간 419건 중단 통계에서 체크포인트 주기를 역산하고, DeepSeek-V3와 Kimi K2가 손실 스파이크를 각각 다른 층위에서 없앤 방식을 비교합니다. Olmo 계열이 안정성 수정을 아키텍처에 남긴 이유, OPT-175B와 BLOOM 로그북이 남긴
2026-08-02 · 24 분 읽기 #mlops#llm-training#case-study#training-stability#scaling분산 학습 & GPU 인프라 2026 딥다이브 — DeepSpeed, FSDP2, Megatron-LM, Ray Train, JAX, TorchTitan, Blackwell GB200, MI325X, TPU v5p 총정리
DeepSpeed/FSDP2/Megatron-LM/Ray Train/JAX/TorchTitan/Composer를 비교하고, NVIDIA Blackwell GB200 NVL72, AMD MI325X, Intel Gaudi 3, AWS Trainium 2, Google TPU v5p/v6e Trillium까지. 3D 병렬화, ZeRO-FSDP 등가성, MoE All-to-All, fp8/mxfp
2026-05-16 · 23 분 읽기 #distributed-training#deepspeed#fsdp#megatron-lm#ray