脑裂:脑子裂成两半,谁也不认谁

Posted on 一 06 7月 2026 in Tech • Tagged with distributed systems, split-brain, network partition, consensus, quorum, raft, high availability

分区(partition)是网络把集群切成了几块,谁也看不见谁;脑裂(split-brain)是切开之后,每一块都以为"就剩我了,我来当家"。于是两个主节点同时写数据,等网络恢复,数据对不上,谁都不认谁。这篇讲清楚脑裂的根因(网络分区 + 各自选主),以及业界公认的解法:多数派仲裁(quorum)、fencing、见证节点,配一份可抄的排查与设计清单。


Continue reading

如何做一个接近零停机的 HTTP 服务

Posted on 五 08 5月 2026 in Tech • Tagged with zero-downtime, high-availability, active-active, retry, idempotency, sre, architecture

零停机服务不是一句“部署两套集群”就能实现的口号。真正可用的方案,是 active-active 流量、快速超时、跨集群重试、熔断摘除、共享幂等状态和无状态应用设计一起配合,让一次集群故障尽量止步于一次请求内部。


Continue reading