태그: #ray
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 4 편
Ray 2.56의 레이블 로컬리티 스케줄링 — 배치 그룹이 노드가 아니라 NVLink 랙을 보기 시작했다
2026년 6월 29일 나온 Ray 2.56.0은 배치 그룹에 도메인 레벨 스케줄링 레이어를 알파로 추가했습니다. 지금까지 PACK·STRICTPACK 같은 배치 전략은 전부 노드 단위로만 동작해서, GB200·GB300 NVL72처럼 NVLink 도메인이 노드 여러 개에 걸치는 랙에서는 "이 배치 그룹을 한 랙 안에 다 넣어 달라"를 표현할 방법이 없었습니다. 새 레이블 로컬리티 스케줄링은
2026-07-17 · 21 분 읽기 #ray#gpu#scheduling#distributed-systemsMLOps 플랫폼 2026 완전판 - MLflow · Kubeflow · W&B · Vertex AI · SageMaker · Databricks · BentoML · Ray · Modal · Hugging Face 심층 가이드
2026년 5월 기준 MLOps 30여 개 플랫폼을 한 번에 비교한다. MLflow 3, Kubeflow 1.10, Weights & Biases, Comet, Neptune.ai, ClearML, Vertex AI, SageMaker, Azure ML, Databricks ML + Mosaic AI, Hugging Face Inference Endpoints, Determined, Anys
2026-05-16 · 26 분 읽기 #mlops#mlflow#kubeflow#weights-and-biases#vertex-ai분산 학습 & GPU 인프라 2026 딥다이브 — DeepSpeed, FSDP2, Megatron-LM, Ray Train, JAX, TorchTitan, Blackwell GB200, MI325X, TPU v5p 총정리
DeepSpeed/FSDP2/Megatron-LM/Ray Train/JAX/TorchTitan/Composer를 비교하고, NVIDIA Blackwell GB200 NVL72, AMD MI325X, Intel Gaudi 3, AWS Trainium 2, Google TPU v5p/v6e Trillium까지. 3D 병렬화, ZeRO-FSDP 등가성, MoE All-to-All, fp8/mxfp
2026-05-16 · 23 분 읽기 #distributed-training#deepspeed#fsdp#megatron-lm#rayMLOps 완전 가이드 — 모델 서빙·Feature Store·Drift·A/B 테스트·GPU 경제학 (Season 2 Ep 7, 2025)
모델을 학습하는 것과 프로덕션에서 운영하는 것은 완전히 다른 게임이다. Serving(TorchServe·Triton·vLLM·TGI), Feature Store(Feast·Tecton), Training Infra(Ray·Determined), Experiment Tracking(MLflow·W&B), Data/Concept Drift 감지, Model A/B 테스트와 Shadow Depl
2026-04-15 · 17 분 읽기 #mlops#model-serving#feature-store#drift-detection#ab-testing