태그: #ml
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3 편
멀티 GPU·멀티노드 학습 플랫폼 총정리 — 프레임워크 지도부터 Slurm·Kubeflow 실전 가이드까지
GPU 여러 장, 노드 여러 대로 모델을 학습시키는 전체 지형을 한 장에 정리합니다. AI 라이브러리·프레임워크 생태계 지도(PyTorch·JAX·HuggingFace·DeepSpeed·Ray), 병렬화 전략(DDP·FSDP·ZeRO·TP·PP)을 언제 무엇으로 고르는지, torchrun 단일노드→멀티노드 확장, HPC의 표준 Slurm 사용 가이드(sbatch 스크립트와 멀티노드 torch
2026-07-09 · 13 분 읽기 #ai#ml#distributed-training#slurm#kubeflowAI 모델 개발, 처음부터 끝까지 — 데이터에서 배포까지의 현실적인 생애주기
모델 개발은 사전학습이 아니라 결정 사다리에서 시작합니다 — 프롬프트로 되는가, RAG로 되는가, 파인튜닝이 필요한가. 평가 셋을 먼저 만드는 eval-first 원칙, 데이터 품질과 합성 데이터의 함정, 스케일링 법칙과 분산 학습, LoRA·DPO로 이어지는 파인튜닝 스펙트럼, 양자화·연속 배칭 서빙, 그리고 배포 후의 데이터 플라이휠까지 — AI 모델 개발의 전체 생애주기를 실무 순서로
2026-07-07 · 16 분 읽기 #ai#ml#llm#mlops#training부동소수점과 IEEE 754 완벽 해부 — 왜 0.1 + 0.2 ≠ 0.3 인가, NaN, 서브노멀, 통화 연산, bfloat16까지 (2025)
"0.1 + 0.2 = 0.30000000000000004"를 검색해본 적 없는 개발자는 없다. 하지만 그 뒤의 IEEE 754 표준을 제대로 아는 사람은 드물다. 부호/지수/가수의 비트 배치, NaN과 Infinity의 비트 레벨, 서브노멀이 느린 이유, 은행 잠깐 멈추게 만든 Intel FDIV 버그, 우주선을 폭발시킨 Ariane 5 사고, 그리고 현대 LLM을 움직이는 bfloat16
2026-04-15 · 32 분 읽기 #floating-point#ieee-754#numerics#precision#ml