标签: #distributed-systems
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 16 篇
当两个通过了类型检查的服务互相等着对方停住时 —— 编排式编程这条另辟蹊径的路
就算用了保证内存安全的语言,也挡不住两个服务互相等着对方的消息而停住 —— 因为类型检查器的视野到一个进程就到头了。编排式编程(choreographic programming)把整个系统写成一个程序,再让编译器把各节点的代码抽取出来,从而把这条边界本身消掉。本文以最近公开的 Wyzer 为线索,只用能确认到的事实,梳理端点投影是什么、死锁为什么在设计层面就消失了,以及这门语言目前处在哪个阶段。
2026-08-09 · 11 分钟阅读 #programming-languages#compiler#distributed-systems#type-systems#concurrencyTemporal Worker Versioning GA — 回放模型制造的部署难题,抛弃两代之后拿出的第三个答案
像 Temporal 这样的持久执行引擎靠回放事件历史来扛住故障,而恰恰是这份回放,让「在有工作流正在运行时部署新代码」成了这套模型里最棘手的问题。Temporal 在 2026 年 3 月 30 日宣布了 Worker Versioning 的 GA,OSS 服务端则在 v1.31.0(4 月 29 日)里写明 — 距 2023 年 6 月首次预览已两年九个月,其间把两代版本化 API(版本集、版本化规则)整个抛弃后拿出的第三套设计。
2026-07-17 · 20 分钟阅读 #distributed-systems#durable-execution#temporal#workflow-engine#reliabilityNATS Server 2.14 — 快速批量发布、服务器内置调度,以及 2.15 之前要做完的功课
2026 年 4 月 30 日发布的 NATS Server 2.14,为 JetStream 新增了内置流控的快速批量发布(fast batch publish)、cron 式重复调度与主题采样、WorkQueue·Interest 流溯源(sourcing)转为持久(durable)消费者、以及消费者重置 API。2.13 被跳过了,官方没有说明原因。本文直接查阅发布说明、升级指南、ADR 与服务器源码,梳理各项功能的实际设计与限制
2026-07-17 · 22 分钟阅读 #messaging#nats#distributed-systems#release-notesCassandra 6.0-alpha1 与 Accord 事务 — 五年之约的「通用事务」,现在走到哪一步了
Accord 是 Cassandra 的通用事务协议,2021 年以 CEP-15 的形式提出,终于在 2026 年 3-4 月,随 6.0-alpha1 这个可运行的发布版本一起问世。这个协议的承诺是,通过无 leader 的共识,在正常条件下用一次 WAN 往返完成多分区的 strict-serializable 事务,而且这个发布版本里确实带上了 BEGIN TRANSACTION 语法和按表设置的 transactionalmo
2026-07-17 · 20 分钟阅读 #database#cassandra#distributed-systems#transactionsRay 2.56 的标签局部性调度 — 放置组开始看见 NVLink 机架,而不是节点
2026 年 6 月 29 日发布的 Ray 2.56.0,给放置组加上了一层 alpha 阶段的域级调度层。此前 PACK、STRICTPACK 这些放置策略全都只按节点粒度工作,于是在 GB200、GB300 NVL72 这类 NVLink 域横跨多个节点的机架上,根本没有办法表达「把这个放置组整个塞进同一个机架里」。新的标签局部性调度,把 ray.io/gpu-domain 标签值相同的一组节点视作一个域,并把整个放置组 STRI
2026-07-17 · 17 分钟阅读 #ray#gpu#scheduling#distributed-systemsKafka Diskless Topics(KIP-1150)是什么 — 用延迟换取的跨 AZ 成本,以及一个尚未交付的功能
2026 年 3 月 2 日,Apache Kafka 社区批准了 KIP-1150 Diskless Topics。这是一项提议:用对象存储取代broker磁盘作为数据的真源,从而消除跨 AZ 复制流量 — 这正是超大规模云厂商环境下 Kafka 成本中最大的一块。但被批准的只是方向,不是实现 — KIP 正文自己写明「本 KIP 一旦被接受,不要求对代码库做任何改动」— 真正的设计文档 KIP-1163 与 KIP-1164 仍处于
2026-07-16 · 26 分钟阅读 #kafka#streaming#distributed-systems#cloud-native确定性模拟测试找到的那个 bug — KAFKA-19880,以及该怎么读「零 bug」
确定性模拟测试(DST)把时钟、线程交错、随机数这些非确定性会渗入的来源,全部关进模拟器里,让那些原本无法复现的 heisenbug 可以靠一个种子重新召唤出来。2026 年 3 月,Aiven 把 Kafka 的 Diskless Topics 实现放进 Antithesis 里,跑了大约 2,200 个逻辑小时,结果是零 bug。真正的 bug 却出自对照组 — 他们为了验证而跑的上游 Apache Kafka 原版代码,跑出了 K
2026-07-16 · 26 分钟阅读 #testing#deterministic-simulation-testing#distributed-systems#kafka#antithesis5 节点 Raft 集群中 3 个节点为何同时死亡 — 解读 Coinbase 2026 年 5 月 7 日故障
2026 年 5 月 7 日晚间,AWS us-east-1 可用区 use1-az4 内的一处数据机房(data hall)冷却设备同时发生故障,Coinbase 由此经历了一场故障:交易、出入金在内的大部分服务中断或降级约 8 小时。Coinbase 于 6 月 1 日公开的事后复盘(postmortem)一并说明了两件事的经过 — 5 节点 Raft 撮合引擎中的 3 个节点同时死亡、导致集群失去法定人数(quorum)的过程,以
2026-07-16 · 29 分钟阅读 #distributed-systems#postmortem#consensus#aws#resilience2026年依然没有闰秒 — 以及无人经历过的负闰秒
2026年7月6日,IERS 通过 Bulletin C 72 宣布"2026年12月底没有闰秒"。表面上看是条平静的消息,但地球自转从2016年起反而开始加快,史上第一次需要插入负闰秒的可能性变成了现实。本文梳理闰秒是什么、为什么 POSIX 时间无法表达它、2012年和2017年的真实故障给了我们什么教训,以及在这条从未被执行过的负闰秒处理路径面前,工程师现在应该确认些什么。
2026-07-11 · 9 分钟阅读 #leap-second#utc#ntp#distributed-systems#posix-time分布式事务:2PC vs Saga 模式
在单一数据库里轻而易举的 ACID,为什么一跨多个服务就会崩溃 — 两阶段提交(协调者、阻塞、失败模式)的原理与局限,Saga 模式(编排 vs 编舞、补偿事务),解决双写问题的发件箱模式,以及最终一致性在实务中到底意味着什么。为微服务时代梳理事务这件事。
2026-06-29 · 21 分钟阅读 #distributed-systems#transactions#sagaExactly-once 是幻觉吗:支付与消息传递的正确性
投递保证的三个等级(at-most-once、at-least-once、exactly-once)究竟意味着什么,为什么 exactly-once「投递」原理上不可能,而 exactly-once「处理」却可以通过幂等性、去重、事务性发件箱来达成,两个将军问题告诉我们的道理,以及 Kafka 的 exactly-once 到底保证了什么。冷静地梳理支付与消息传递的正确性。
2026-06-28 · 22 分钟阅读 #distributed-systems#messaging#reliability分布式系统教会我的恋爱技巧
重试与退避、超时、心跳、一致性模型、背压、优雅降级、幂等性、两将军问题,以及作为带 TTL 缓存的信任。让分布式系统变得困难的那些问题,和让人与人靠近变得困难的问题惊人地一致。本文尝试用工程师的眼光,重新解读恋爱。
2026-06-25 · 20 分钟阅读 #engineering#relationships#fun#distributed-systemsCAP 定理,不打马虎眼地讲清楚
"三选二"这个流行的说法是错的。本文不打马虎眼地讲清楚:CAP 三个字母各自到底指什么、为什么实际上只有在发生分区时才需要在 C 和 A 之间做选择、为什么 PACELC 是更完整的图景,以及 Dynamo、Spanner 这类真实系统各自站在哪一边。
2026-06-23 · 18 分钟阅读 #distributed-systems#databases#theory幂等性与重试:构建可靠的 API
网络迟早会失败,失败了就得重试。棘手的情形是「已经处理完了,只是响应没送到」。本文梳理幂等性是什么、哪些 HTTP 方法安全、哪些不安全,POST 的幂等性键,「恰好一次」这个神话,以及指数退避加抖动如何避免惊群效应。
2026-06-21 · 20 分钟阅读 #api#reliability#distributed-systems分布式系统完全指南 — 时钟、Consensus、Event Sourcing、Saga、CRDT、故障模式 (Season 2 Ep 12, 2025)
分布式系统看上去像“多台计算机协作的事”,实际上却是“一群时钟各不相同的计算机,在一部分已经损坏的状态下,通过会丢包、会延迟的网络达成共识的事”。从 Lamport/向量时钟、HLC 到 Raft、Paxos、PBFT,再到 Event Sourcing、CQRS、Saga 模式、CRDT,以及 8 Fallacies 与实战故障模式。一篇写尽分布式真实面貌(含 Byzantine Fault)的文章。Season 2 的第十二篇。
2026-04-15 · 17 分钟阅读 #distributed-systems#consensus#raft#paxos#lamport-clock分布式系统完全指南: 从 CAP theorem 到分布式 ML 训练、Kafka
从 CAP theorem、Raft 共识算法、Kafka 消息队列,到 Ring-AllReduce 分布式 ML 训练与 NCCL,一份写给 AI 工程师的分布式系统完全指南。
2026-03-17 · 21 分钟阅读 #distributed-systems#kafka#raft#pytorchdistributed#nccl