标签: #scalability
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
发布本身就是压测 —— 不为「把缓存填满」设计成本会发生什么
拆解 Canva 把网关的内存态会话吊销缓存从 MySQL 迁到 S3 的过程。问题不在稳态的查询成本,而在每次发布时几百个 Pod 同时填缓存、把数据库砸穿的启动成本;解法也不是再叠一层缓存,而是换掉数据的表示方式。把 12 小时的滑动窗口切成 30 分钟的片段,再把一条吊销压进 16 字节做成有序数组,网关就能对下载下来的字节不做任何转换直接做二分查找。文中还理清了条件式 PUT 与领导者选举里,哪一个是正确性、哪一个是优化。
2026-08-09 · 12 分钟阅读 #architecture#caching#s3#scalability#deploymentWebSocket、SSE 与轮询 — 实时通信方式怎么选,以及为什么多数情况用不上 WebSocket
被叫作「实时」的需求,大多数其实是从服务器到客户端的单向推送,而这种情况下 SSE 比 WebSocket 简单得多,还能原样沿用现有的 HTTP 基础设施。自动重连和基于 Last-Event-ID 的续传都写进了规范里,认证、日志、压缩也都还是平时那一套。本文用表格比较包含轮询与长轮询在内的四种方式的延迟与成本,并划出 WebSocket 真正必要的边界。还整理了代理的空闲超时与缓冲、HTTP/1.1 的连接数上限、水平扩展所需的发
2026-07-26 · 19 分钟阅读 #web#websocket#server-sent-events#realtime#scalability