标签: #caching
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 5 篇
发布本身就是压测 —— 不为「把缓存填满」设计成本会发生什么
拆解 Canva 把网关的内存态会话吊销缓存从 MySQL 迁到 S3 的过程。问题不在稳态的查询成本,而在每次发布时几百个 Pod 同时填缓存、把数据库砸穿的启动成本;解法也不是再叠一层缓存,而是换掉数据的表示方式。把 12 小时的滑动窗口切成 30 分钟的片段,再把一条吊销压进 16 字节做成有序数组,网关就能对下载下来的字节不做任何转换直接做二分查找。文中还理清了条件式 PUT 与领导者选举里,哪一个是正确性、哪一个是优化。
2026-08-09 · 12 分钟阅读 #architecture#caching#s3#scalability#deploymentLLM 缓存的原理 — 提示词缓存与 Prefix Cache 为什么能省钱
为什么提示词的前半部分相同,成本就会降到十分之一?答案就在 Transformer 内部的 KV 缓存里。由于注意力是因果的(causal),前面 token 的 Key/Value 向量无论后面出现什么都不会改变,因此可以先存下来再复用。从 prefill 与 decode 的区分、KV 缓存的内存数字、vLLM/SGLang 的 prefix cache 实现,一直到 Anthropic/OpenAI 提示词缓存的定价结构与实战设计
2026-07-08 · 12 分钟阅读 #ai#llm#caching#inference#performance缓存失效全解析
"计算机科学中有两件难事:缓存失效和命名。"本文梳理缓存为何如此之难、TTL·write-through·write-behind·cache-aside 等策略、缓存踩踏(dogpile)问题及其缓解手段(锁·抖动·stale-while-revalidate)、基于事件与版本键的失效方式,以及从 CPU 到浏览器贯穿始终的缓存层级。
2026-06-19 · 24 分钟阅读 #performance#caching#systemsCloudflare AI Gateway 实战指南: 观测和控制 AI 流量最快的方法
以 2026 年 4 月为基准,从实务角度梳理为什么要用 Cloudflare AI Gateway、能做哪些控制、以及应该如何搭配使用 Dynamic Routing 与自动重试。
2026-04-12 · 9 分钟阅读 #ai-platform#cloudflare#ai-gateway#observability#cachingnginx 配置完全指南:从架构到生产优化的 15 个核心主题
从 nginx 的事件驱动架构和配置结构,到反向代理、负载均衡、SSL/TLS、缓存、Rate Limiting、安全响应头、性能调优、健康检查 —— 用实战示例完整梳理可在生产环境立即落地的 15 项核心配置。
2026-03-01 · 41 分钟阅读 #nginx#reverse-proxy#load-balancing#ssl#tls