标签: #cost-optimization
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 3 篇
LLM API 成本优化 — 输出 token、prompt caching 与路由的盈亏平衡计算
把 LLM API 账单砍掉一半靠的是算术,不是感觉。由于输出 token 的单价是输入的数倍,最大的杠杆几乎总是控制输出长度,其次才是 prompt caching。本文整理了缓存只命中前缀这一约束如何强制决定提示的排列顺序、RAG 与全文塞入的盈亏平衡点在哪里、模型路由的节省公式以及随之而来的精度损失该如何用同一把尺子衡量,并给出模拟月度成本的代码,以及 token 估算与实际账单对不上的五个原因。
2026-07-26 · 17 分钟阅读 #llm#cost-optimization#prompt-caching#rag#model-routingLLM API 成本如何真正降下来 — 「缓存 90% 折扣」到了账单上为什么只有 25%
提示词缓存的缓存读取只有输入价格的十分之一。但这并不会把账单砍掉 90%。照着 Anthropic 放在自家文档里的计算示例走一遍:即便缓存完全命中,总额也只是从 0.705 美元降到 0.525 美元,减少 25.5%。原因很简单 — 折扣只按该项目在账单中的花钱比例缩减账单,而输出 token 已经吃掉了成本的 60%。所以本文不罗列折扣率,而是直接把账单算出来。缓存的盈亏平衡点(要读几次才回本)、缓存完全不生效的最小 token
2026-07-17 · 32 分钟阅读 #llm#cost-optimization#prompt-caching#api#ai提示词缓存实战指南:让 Agent 应用的成本与延迟一起降下来
梳理为什么提示词缓存在 Agent 应用里很重要、OpenAI 与 Anthropic 的差异、提示词结构化模式、ROI 判断方法、常见错误,以及迁移清单,全部从实务角度整理。
2026-04-12 · 13 分钟阅读 #prompt-caching#latency#cost-optimization#ai-agent#llmops