标签: #model-routing
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 1 篇
LLM API 成本优化 — 输出 token、prompt caching 与路由的盈亏平衡计算
把 LLM API 账单砍掉一半靠的是算术,不是感觉。由于输出 token 的单价是输入的数倍,最大的杠杆几乎总是控制输出长度,其次才是 prompt caching。本文整理了缓存只命中前缀这一约束如何强制决定提示的排列顺序、RAG 与全文塞入的盈亏平衡点在哪里、模型路由的节省公式以及随之而来的精度损失该如何用同一把尺子衡量,并给出模拟月度成本的代码,以及 token 估算与实际账单对不上的五个原因。
2026-07-26 · 17 分钟阅读 #llm#cost-optimization#prompt-caching#rag#model-routing