标签: #vllm
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 4 篇
把 vLLM 调快 —— 配置、内部结构,以及真正值得动代码的地方
按顺序梳理提升 vLLM 性能的做法,从完全不改代码就能做到的事情开始。先讲批处理相关参数、前缀缓存、chunked prefill、量化选择,再基于真实源码解释 PagedAttention 与连续批处理调度器内部到底在决定什么。同时给出真正值得动代码的三个位置——自定义 logits processor、自定义 attention backend、调度器策略——以及各自的代价。也必然包含该固定什么、该测量什么,以及如何权衡 TTFT
2026-08-02 · 29 分钟阅读 #vllm#llm-inference#paged-attention#benchmark#schedulerPD 分离并不会提升吞吐量 — 预填充/解码分离实际买到的是什么
把预填充和解码拆到不同 GPU 上的 PD 分离,是 2026 年 vLLM、SGLang、TensorRT-LLM 都已经引入的设计,但无论从哪里看,流传的都只是"2 倍到 7 倍"这样的数字。然而 vLLM 官方文档却用大写字母把同一个功能钉死为"分离式预填充并不会提升吞吐量"。两者其实都对 — 因为那些厂商数字测的从来都不是吞吐量,而是 goodput(满足 SLO 的处理量),或者是在固定延迟目标条件下的吞吐量。本文梳理 PD
2026-07-16 · 25 分钟阅读 #llm#ai#inference#kv-cache#vllm开源 LLM 生态完全指南:2026 年的模型、工具与部署策略
全面梳理 2026 年开源 LLM 生态的实战指南。涵盖主要模型家族(Llama、Mistral、Gemma、Qwen、DeepSeek)、本地推理工具(Ollama、llama.cpp、vLLM)、微调技术(LoRA、QLoRA),以及运营自有 LLM 所需的实战部署策略。
2026-03-17 · 28 分钟阅读 #open-source#llm#llama#mistral#gemmaLLM 推理优化完全指南:KV Cache、Speculative Decoding、Continuous Batching
将 LLM 推理优化推向极致的完全指南。深入剖析 KV Cache、Speculative Decoding、Continuous Batching、PagedAttention、FlashInfer、多 GPU 推理,以及 DeepSeek MLA。
2026-03-17 · 39 分钟阅读 #llm#inference#optimization#kv-cache#speculative-decoding