タグ: #ray
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 4 件
Ray 2.56のラベルロカリティスケジューリング — 配置グループがノードではなくNVLinkラックを見始めた
2026年6月29日に出たRay 2.56.0は、配置グループにドメインレベルのスケジューリング層をアルファとして追加しました。これまでPACKやSTRICTPACKといった配置戦略はすべてノード単位でしか動かず、GB200・GB300 NVL72のようにNVLinkドメインが複数ノードにまたがるラックでは「この配置グループを1つのラックの中に全部入れてくれ」を表現する方法がありませんでした。新しいラベルロカリティスケジューリングは、r
2026-07-17 · 19 分で読めます #ray#gpu#scheduling#distributed-systemsMLOpsプラットフォーム 2026 完全版 - MLflow · Kubeflow · W&B · Vertex AI · SageMaker · Databricks · BentoML · Ray · Modal · Hugging Face 徹底ガイド
2026年5月時点のMLOpsプラットフォーム30種を一気に比較する。MLflow 3、Kubeflow 1.10、Weights & Biases、Comet、Neptune.ai、ClearML、Vertex AI、SageMaker、Azure ML、Databricks ML + Mosaic AI、Hugging Face Inference Endpoints、Determined、Anyscale + Ray Train、
2026-05-16 · 21 分で読めます #mlops#mlflow#kubeflow#weights-and-biases#vertex-ai分散学習 & GPUインフラ 2026 ディープダイブ — DeepSpeed、FSDP2、Megatron-LM、Ray Train、JAX、TorchTitan、Blackwell GB200、MI325X、TPU v5p 総まとめ
DeepSpeed/FSDP2/Megatron-LM/Ray Train/JAX/TorchTitan/Composerを比較し、NVIDIA Blackwell GB200 NVL72、AMD MI325X、Intel Gaudi 3、AWS Trainium 2、Google TPU v5p/v6e Trillimuまで。3D並列化、ZeRO-FSDP等価性、MoEのAll-to-All、fp8/mxfp4精度、NCCLチューニン
2026-05-16 · 20 分で読めます #distributed-training#deepspeed#fsdp#megatron-lm#rayMLOps 完全ガイド — Model Serving・Feature Store・Drift・A/B Test・GPU Economics (Season 2 Ep 7, 2025)
モデルを学習することと本番で運用することは全く別のゲームである。Serving (TorchServe・Triton・vLLM・TGI)、Feature Store (Feast・Tecton)、Training Infra (Ray・Determined)、Experiment Tracking (MLflow・W&B)、Data/Concept Drift 検知、Model A/B Test と Shadow Deployment、
2026-04-15 · 15 分で読めます #mlops#model-serving#feature-store#drift-detection#ab-testing