标签: #llm-inference
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
把 vLLM 调快 —— 配置、内部结构,以及真正值得动代码的地方
按顺序梳理提升 vLLM 性能的做法,从完全不改代码就能做到的事情开始。先讲批处理相关参数、前缀缓存、chunked prefill、量化选择,再基于真实源码解释 PagedAttention 与连续批处理调度器内部到底在决定什么。同时给出真正值得动代码的三个位置——自定义 logits processor、自定义 attention backend、调度器策略——以及各自的代价。也必然包含该固定什么、该测量什么,以及如何权衡 TTFT
2026-08-02 · 29 分钟阅读 #vllm#llm-inference#paged-attention#benchmark#schedulerllama.cpp 走进浏览器 — WebGPU 后端在 16 台设备上测出的天花板
UC Santa Cruz 团队于 2026 年 5 月发布的 LlamaWeb 是 llama.cpp 的 WebGPU 后端,在 8 家厂商的 16 台设备上实测了浏览器端 LLM 推理,留下了迄今为止最广的数据集。结果是双面的。它比现有浏览器框架(WebLLM、Transformers.js)少用 29%~33% 的内存,解码吞吐量高出 45%~69%,但 prefill 仍只有 WebLLM 的 49% 水平,相比原生 CUDA
2026-07-16 · 25 分钟阅读 #webgpu#llm-inference#llama-cpp#on-device-ai#browser