标签: #scheduler
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 3 篇
把 vLLM 调快 —— 配置、内部结构,以及真正值得动代码的地方
按顺序梳理提升 vLLM 性能的做法,从完全不改代码就能做到的事情开始。先讲批处理相关参数、前缀缓存、chunked prefill、量化选择,再基于真实源码解释 PagedAttention 与连续批处理调度器内部到底在决定什么。同时给出真正值得动代码的三个位置——自定义 logits processor、自定义 attention backend、调度器策略——以及各自的代价。也必然包含该固定什么、该测量什么,以及如何权衡 TTFT
2026-08-02 · 29 分钟阅读 #vllm#llm-inference#paged-attention#benchmark#schedulerKubernetes Pod Pending 状态排查 — 读懂调度器留下的拒绝理由
当 Pod 停在 Pending 好几分钟都不往前走时,调度器其实已经把拒绝理由写进了事件里。本文先从如何准确解读那句以 0/5 nodes are available 开头的话讲起,再逐一排除九类原因。内容涵盖资源不足是按 requests 总和而非实际用量判定这一点、taint 与容忍度、节点选择器与亲和性不匹配、PVC 未绑定与 WaitForFirstConsumer 的正常等待、Pod 反亲和性导致的自我排除、topology
2026-07-26 · 17 分钟阅读 #kubernetes#scheduler#pending#troubleshooting#autoscalingsched_ext 子调度器 — 内核 7.1 中只到了一半的 per-cgroup 调度器
Linux 7.1(2026年6月14日发布)引入了 schedext 的 cgroup 子调度器支持。目标很清楚 — 可以在 cgroup 树的任意位置挂载 BPF 调度器,父调度器动态地把 CPU 分配给子级,让每个容器或应用域都能跑一套适合自己工作负载的调度策略。动机是 cpuset 硬分区给不了的那种灵活性,对运行多租户机器的人来说是等了很久的东西。不过 7.1 里真正落地的,只是以 dispatch 路径为核心的骨架,照搬 L
2026-07-16 · 20 分钟阅读 #linux#kernel#scheduler#cgroups#bpf