标签: #scheduling
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
Ray 2.56 的标签局部性调度 — 放置组开始看见 NVLink 机架,而不是节点
2026 年 6 月 29 日发布的 Ray 2.56.0,给放置组加上了一层 alpha 阶段的域级调度层。此前 PACK、STRICTPACK 这些放置策略全都只按节点粒度工作,于是在 GB200、GB300 NVL72 这类 NVLink 域横跨多个节点的机架上,根本没有办法表达「把这个放置组整个塞进同一个机架里」。新的标签局部性调度,把 ray.io/gpu-domain 标签值相同的一组节点视作一个域,并把整个放置组 STRI
2026-07-17 · 17 分钟阅读 #ray#gpu#scheduling#distributed-systemsKubernetes v1.36 的 Workload/PodGroup API — Gang Scheduling 正走进 kube-scheduler
AI 训练与批处理工作负载的 gang scheduling,迄今为止一直是 Volcano、Kueue 这类外部调度器的活儿,但 Kubernetes 已经开始把这项能力搬进核心。v1.35 以 alpha 形式发布了 Workload API 和第一版 gang scheduling 实现,而 2026 年 4 月 22 日发布的 v1.36 则对结构做了大改 — 把 Workload 拆分成静态模板,把新的 PodGroup 拆分
2026-07-16 · 29 分钟阅读 #kubernetes#scheduling#gang-scheduling#distributed-training#dra