1. 双主热备这个词,被误解得有点多
1.1 主备、主从、双主热备、双活:一张表看清区别
做高可用改造这么多年,我发现团队里对“双主热备”的理解五花八门。有人觉得这是两台机器都开放写,随便写哪台都行;有人觉得这就是主从复制的高配版;还有人把双主热备和双活画等号。这些理解不能说全错,但放到生产环境里,很容易把架构设计带到沟里去。
先做点最基础的辨析。数据库高可用方案里,“主备”“主从”“双主热备”“双活”这四个词经常被混着用,但含义差别非常大。
- 主备:一台主库对外服务,一台备库只做数据同步、不对外提供服务。主库挂了,备库顶上,业务中断时间取决于切换速度和人工介入程度。
- 主从:一台主库负责写,多台从库负责读,这是读写分离的典型形态。从库默认只读,不能接受外部写入。
- 双主热备:两台节点都配置成主角色,数据通过双向复制保持同步。对外写入通常只走一台,另一台随时可以接替,业务无感知。
- 双活:两台节点同时对外提供服务,读写都分担,这是比双主热备更激进的形态。
表格整理出来会更直观:
| 方案 | 对外写入 | 对外读取 | 故障切换 | 典型风险 |
|---|---|---|---|---|
| 主备 | 仅主库 | 仅主库 | 切换期间有中断 | 备库数据延迟 |
| 主从 | 仅主库 | 主库+从库均可 | 只读不受影响,写需切换 | 主从延迟导致读陈旧 |
| 双主热备 | 一台为主,另一台待命 | 视配置而定 | VIP漂移,业务几乎无感 | 双写冲突、脑裂 |
| 双活 | 两台均可写 | 两台均可读 | 无需切换 | 分布式一致性问题 |
双主热备和双活最大的区别在于:双主热备不一定双写,双活一定是双写。我这么说可能有人不服——名字里都带“双主”了,为什么不双写?因为多数业务系统根本没有为分布式写入的冲突做好设计。两台同时写同一张表,自增键、唯一索引、同一行数据的更新,很快就会出现一致性问题。很多实际项目里所谓的双主热备,就是一台主节点负责写和读,另一台节点同步数据后处于待命状态,一旦主节点异常就切换过去。这种架构对外看起来是双主,本质上是一套带写能力的热备。
1.2 双主热备的典型拓扑:一主对外、一主待命
用文字描述一下我常用的双主热备拓扑:应用通过VIP(虚拟IP)访问数据库,VIP正常情况下绑定在A节点上。A和B之间建立双向复制链路,A的binlog同步到B,B的binlog也同步到A。B节点平时不直接对外提供服务,但数据保持实时同步,并且具备完整的写入能力。
这套拓扑下,双主的意义体现在两个地方。第一,备节点不是冷备,它一直在接收主节点的binlog,数据尽量实时;同时它本身具备完整写能力,不是只读从库,所以接管时没有任何“从只读切到读写”的额外门槛。第二,两台机器配置完全对称,平时可以轮流重启、滚动升级,不用停业务。这比传统主备方案舒服得多,传统主备里备库通常是只读的,想验证备库能不能正常写入,还得先改配置重启,麻烦。
但这套拓扑里有一个必须讲清楚的约定:写入流量默认只走一台节点,另一台节点在绝大多数时间里扮演的是“热备”角色,只在主节点宕机、维护、切换演练时才会变成写入节点。这个约定必须在架构评审时就跟业务方讲明白,否则很容易演变成“两台机器都开放写”的失控局面。
1.3 什么场景下不该选双主热备
双主热备不是银弹。如果业务是强一致、写密集型的,双向同步会引入额外延迟甚至冲突;如果两台节点部署在不同机房,网络抖动会让同步频繁失败,脑裂风险也会被放大。另外,如果业务本身没有做好幂等写入,双主热备切换后的重复投递、重复扣费这类问题会很难收场。更极端的场景,直接上分布式数据库或者多副本强一致方案可能更合适。
所以选不选双主热备,先看两件事:一是业务对“双写冲突”的容忍度,二是对RPO和RTO的具体要求。RPO要求必须为零的场景,MySQL的异步复制和半同步复制都不满足,那得考虑Paxos/Raft协议这类方案,像MySQL Group Replication或者Percona XtraDB Cluster,这已经是另一个话题了。双主热备能覆盖的场景,通常是RPO在秒级以内、RTO在几十秒以内、业务能容忍极少数极端情况下丢最后一批日志的高可用需求。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 双主同步的底层逻辑:binlog、relay log和循环复制防线
2.1 一条SQL在主库和备库之间如何流转
双主热备的复制本质,就是搭建了两条方向相反的主从复制链路。以MySQL为例说明。主节点A上发生的所有写操作,会按顺序写进A的binlog(二进制日志)。A的dump线程把binlog新事件推送给B的IO线程,B的IO线程把这些事件写到B的relay log(中继日志),B的SQL线程再按顺序回放relay log里的SQL,最终把数据变更应用到B的数据文件里。反向链路B到A的原理完全一样。
这条链路里最关键的一个参数是 log_slave_updates=ON。它的含义是:B在执行A传来的binlog事件、产生数据变更的同时,也要把这次变更写入B自己的binlog。否则B无法把“来自A的写操作”继续转发出去,反向复制就断了。很多第一次搭双主的人,把server-id改了、复制账号建了,但漏了这个参数,结果A到B是通的,B到A却始终没有数据。排查半天,最后发现是这一行的锅。
顺带说一句,MySQL 8.0默认的复制通道已经比老版本完善很多,但原理没变。理解binlog、relay log、dump线程、IO线程、SQL线程这条链路,是排查一切复制问题的地基。
2.2 避免循环复制:server-id 和 log_slave_updates 的作用
双向复制天然有个问题:如果A的一条binlog通过B回放后,又被B写进自己的binlog,然后再传回A,A再传回B,这条日志会无限循环。MySQL怎么避免?靠的是server-id过滤机制。
每个binlog事件都带着产生它的服务器server-id。A产生的binlog事件,server-id等于A;B的SQL线程回放时虽然把事件写入了B的binlog,但事件里的server-id仍然是A,不会变成B。MySQL在接收binlog时会做过滤:如果事件里的server-id等于本机server-id,就跳过。所以循环复制被拦住了。
这件事要求两个前提必须做对:A和B的server-id不同,且都不能为0;log_slave_updates必须开启。缺一条,双主要么不工作,要么循环风暴把你整个数据库实例拖垮。
生产环境里我还见过一种情况,配置了 replicate-same-server-id=0,这个参数默认就是0,用来防止从库回放和自己server-id相同的事件。如果某天排查发现复制中断,报错信息里有server-id相关的字眼,优先检查是不是有人把两台机器的server-id配成一样的了。
2.3 数据冲突并不会消失,只是被转移了
很多团队选双主热备,是想着“两台都能写,挂了哪台都不怕”。这个想法在单机写入场景下没问题,但只要两台节点同时接受外部写入,冲突就是必然的。
最常见的冲突是自增主键冲突。A库写入id=1的数据,B库同时写入id=1的数据,两边各自写成功,双向同步一跑,B把id=1同步到A时发现主键冲突,SQL线程停止,复制中断。第二类常见冲突是同一行数据被两边更新。A把库存改成100,B把库存改成80,同步过去就会出现“后同步的覆盖先同步的”现象,数据变成最后同步的那个节点的值,但不一定是业务想要的结果。第三类是唯一索引冲突,比如用户手机号、订单号,两边各自插入相同唯一键的数据。
所以双主热备一定要立规矩:绝大多数写入只走一台节点,另一台节点主要是热备和应急写入。如果业务确实需要双写,那要认真做冲突合并、幂等控制、时间戳比对,复杂度会指数级上升。别看网上有些文章把双主双写吹得天花乱坠,真落到生产环境,谁踩谁知道。
2.4 脑裂风险与仲裁机制
双主热备里最需要提前防备的,是脑裂。假设A和B之间网络断开了,但两台机器的数据库进程本身都活着。如果此时A的Keepalived还认为自己是VIP持有者,B的Keepalived也认为A已经死了,自动把VIP绑到自己身上,那么就会出现两台机器同时持有VIP的情况。应用连接可能一会打到A、一会打到B,两边都在接受写入,网络恢复后数据冲突不可收拾。
预防脑裂的核心是“仲裁”和“fencing”。仲裁就是引入第三方视角来判断谁才是真正的存活主节点。Keepalived可以配上VRRP组播和脚本健康检查,但不能只依赖互相ping,因为网络分区时A和B之间互相ping不通,可两个节点都能ping通网关,这时候靠互相探测就失效了。比较稳妥的机制是借助外部仲裁节点,比如独立的仲裁服务器、etcd或者Consul,来确认对方状态,再决定是否抢VIP。fencing则是把有问题的节点直接隔离掉,比如远程关机、禁用网卡,确保它不再接受写入。
说实话,生产事故里最可怕的往往不是服务器彻底宕机,而是网络坏了之后两边同时在写。这个尺度一定要提前设计好,否则双主热备带来的不是高可用,而是高混乱。我见过好几个项目上线前不做脑裂演练,直到出了事故才开始补仲裁机制。
3. 搭建一套MySQL双主热备的完整记录
3.1 环境规划:从版本、端口到参数清单
以MySQL 8.0为例,我给出自己搭双主用的核心参数清单。两台节点建议版本一致,小版本尽量相同,避免binlog格式解析差异。
my.cnf中关键配置(A和B,server-id不同):
ini复制[mysqld]
server-id = 1 # B上是2
log-bin = mysql-bin
binlog-format = ROW # 8.0默认就是ROW,业务兼容性更好
log_slave_updates = ON
gtid_mode = ON
enforce_gtid_consistency = ON
binlog_rows_query_log_events = ON
binlog_expire_logs_seconds = 604800 # 7天
auto_increment_offset = 1
auto_increment_increment = 2
binlog_format为什么用ROW格式,这里多说两句。STATEMENT格式记录的是SQL语句本身,但同一句SQL在两边执行结果可能不同,比如用到SYSDATE()、LIMIT子句、不确定函数时,回放结果可能不一致。ROW格式记录的是每行数据变更,能最大限度保证双主数据一致。代价是binlog体积大,但对数据一致性来说是值得的。
GTID模式强烈建议开启,它让复制链路的定位、恢复、failover都变得简单。后面讲到切换和恢复旧节点时,你就知道GTID带来的好处了。auto_increment_offset和auto_increment_increment这里先埋个伏笔,第五章详细展开。
3.2 初始化复制账号并建立双向通道
两台节点初始化数据一致后,就可以建复制账号了。
在A和B上都执行:
sql复制CREATE USER 'repl'@'%' IDENTIFIED BY '你的强密码';
GRANT REPLICATION SLAVE, REPLICATION CLIENT ON *.* TO 'repl'@'%';
然后在两边分别执行复制配置:
sql复制-- 在A上执行,指向B
CHANGE MASTER TO
MASTER_HOST='B的IP',
MASTER_USER='repl',
MASTER_PASSWORD='你的强密码',
MASTER_AUTO_POSITION=1;
START SLAVE;
-- 在B上执行,指向A
CHANGE MASTER TO
MASTER_HOST='A的IP',
MASTER_USER='repl',
MASTER_PASSWORD='你的强密码',
MASTER_AUTO_POSITION=1;
START SLAVE;
A指向B,B指向A,双向链路就建立了。用SHOW SLAVE STATUS\G查看两个关键状态:Slave_IO_Running: Yes、Slave_SQL_Running: Yes。同时看Seconds_Behind_Master,刚搭完应该为0或者接近0。
正式上生产前,要保证两边数据基准一致。我的习惯是先用mysqldump --single-transaction --master-data=2导出一份,导入到B,再配置复制;或者用xtrabackup做物理备份恢复,速度快且能保留GTID信息。初始化这一步做得越规范,后面越省心。如果直接把一个跑了一年、数据差异很大的库配成双主,那复制中断几乎是必然的。
3.3 开启半同步复制,把故障切换的丢数据窗口压到最小
异步复制下,主库提交事务不等备库确认,如果主库宕机,备库可能缺少最后一批binlog,RPO不为零。半同步复制就是主库在提交事务时等待至少一个备库(这里就是另一台主节点)收到并写入relay log后才返回提交成功。这样主库宕机时,已提交的事务大概率已经到了备库。
MySQL 8.0里开启半同步插件:
sql复制INSTALL PLUGIN rpl_semi_sync_master SONAME 'semisync_master.so';
INSTALL PLUGIN rpl_semi_sync_slave SONAME 'semisync_slave.so';
SET GLOBAL rpl_semi_sync_master_enabled = 1;
SET GLOBAL rpl_semi_sync_slave_enabled = 1;
SET GLOBAL rpl_semi_sync_master_timeout = 1000;
两个节点都要装,master和slave插件都要装,因为双主里每个节点既是master又是slave。注意,半同步在超时后会自动退化成异步,这是MySQL的保护机制,但也会静默产生数据丢失窗口,后面第五章会专门讲怎么监控和处理退化。
3.4 用Keepalived让VIP自动漂移
数据库层面的双主配好了,但应用不能自己去判断该连哪台,除非你有一套连接管理中间件。最轻量的做法是用Keepalived提供VIP漂移。两个节点都装Keepalived,配置一个实例:
ini复制vrrp_instance VI_1 {
state BACKUP
interface eth0
virtual_router_id 51
priority 100 # B上配90,正常情况下A胜出
advert_int 1
authentication {
auth_type PASS
auth_pass xxxx
}
virtual_ipaddress {
192.168.1.100/24 dev eth0 label eth0:vip
}
track_script {
chk_mysql
}
}
这里有个细节:state建议都用BACKUP,不要一个MASTER一个BACKUP,用priority决定谁是主。这样避免A恢复后立刻抢占VIP导致抖动,让优先级高的节点在健康检查通过后自然接管。track_script里放一个chk_mysql脚本,脚本要检查MySQL的进程、端口、复制状态,而不是只检查ping。
脚本的核心逻辑是:mysqladmin ping能通,并且show slave status里IO线程和SQL线程都在跑,返回0;否则返回非0,Keepalived就把本机优先级降低或者释放VIP。只有数据库真正健康、复制链路正常的节点,才有资格持有VIP。
4. 故障切换的完整链路与验证方法
4.1 切换前必须想清楚的问题
做双主热备之前,要先问自己几个问题:RPO能接受多少,RTO能接受多少;故障检测由谁来做,是Keepalived脚本还是中间件;切换是自动还是半自动;切换后怎么防止老主恢复后抢写;两边数据不一致时以谁为准。这些问题想不清楚,后面出问题就是一场事故。
我见过最惨的案例是自动切换太灵敏。MySQL主库只是慢了一下,比如一个大查询把CPU吃满,Keepalived脚本超时就把VIP切走了,结果应用连接大量重连,反而引起雪崩。所以检测脚本的阈值和时间窗口要仔细调,通常要避免单次检测失败立刻切换,建议连续失败3次再切。切换这件事,宁可慢一点,也不要误切。
4.2 一次典型的主备切换过程
假设主节点A宕机,整个过程是这样的:
- Keepalived的健康检查脚本发现MySQL不可用,连续检查失败后,A上的Keepalived进入FAULT状态,释放VIP。
- B上的Keepalived收到A的VRRP通告消失,经过
MASTER_DOWN_INTERVAL后升为MASTER,将VIP绑定到自己的网卡。 - 应用连接池里的旧连接断开,重连时通过VIP找到B,数据继续读写。
- DBA介入:确认A是彻底宕机还是网络隔离;如果A恢复,先检查复制状态,再决定是否把A重新加入。
第3步是重点,应用连接池必须有断线重连机制。很多系统数据库挂了之后要重启应用才能恢复,就是因为连接池把旧连接缓存得太死。Java的HikariCP、Druid,Go的database/sql连接池,都要配合理的连接超时和探活机制,确保连接断了能自动重建。
验证这套机制有个好办法:直接拔掉A的网卡,不要kill进程,模拟真实的网络故障。看VIP会不会在几秒内漂到B,应用是否无感。这种演练要定期做,不要只在上线前做一次。
4.3 切换后的检查项
切换完成后需要立刻检查的清单:
- VIP是否只在一台机器上:用
ip addr show确认 - 新主B的复制线程是否正常:
SHOW SLAVE STATUS确认 - 半同步是否退化:在performance_schema里看
rpl_semi_sync_master_status - 应用日志有无大量连接错误:看是否有持续的
connection refused - B的数据是否完整:抽查关键表记录数,对比切换前的快照
- 是否开启只读保护:防止旧主返回后双写,必要时在A恢复时先
SET GLOBAL read_only=ON,确认追上增量再放开
4.4 切换演练的节奏建议
双主热备能不能在关键时刻顶上去,靠的是平时演练。我建议至少每个季度做一次切换演练,每次演练要有明确的场景目标:主节点宕机、网络分区、主节点进程假死、磁盘写满、机房断电。每个场景的切换时间、丢数据情况、业务影响都要记录下来,形成一份切换演练报告。
演练过程中最容易暴露的问题往往是脚本里的边角情况:比如A假死但进程还在,mysqladmin ping还能返回,但实际已经无法写入;比如VIP虽然漂移了,但应用连接池没有及时重建连接;比如B的数据落后A,切过去之后业务报数据缺失。这些坑只有真正练过一次才能发现。
5. 生产环境里踩过的坑:从自增键到半同步退化
5.1 自增键冲突的经典解法
双主环境下,如果两台都开放写入,自增主键冲突是必然的。标准解法是让两台机器生成的主键奇偶错开:A上auto_increment_offset=1,B上auto_increment_offset=2,两台都设置auto_increment_increment=2。这样A生成1、3、5、7……B生成2、4、6、8……理论上不冲突。
但这套方案在水位不齐时会有问题。如果A当前自增到了101,B当前自增到了102,B重启回放日志后可能先分配104,然后A又分配103,还是可能撞。所以更稳妥的做法是:写流量永远只走一台节点,另一台只在接管时才会变成写节点。这样自增冲突的概率会大幅降低。
如果业务确实需要双写,建议主键直接改用雪花ID或者UUID的变体,别再用自增整型。自增整型在分布式写场景下几乎是必踩的雷,早换早安心。
5.2 半同步复制静默退化的发现过程
有一次巡检,我发现一台主节点的rpl_semi_sync_master_status变成了OFF,但业务完全无感。查日志才知道,半同步因为等待ACK超时自动退化成了异步复制。从那一刻起,这台“热备”其实已经悄悄变成了异步复制模式,如果主库在退化的窗口期宕机,备库会少一批数据。
这个问题可怕在静默。业务无感知,监控如果不看这个指标也发现不了。后来我加了一套监控:定期执行SHOW STATUS LIKE 'Rpl_semi_sync_master_status';,把状态推送到监控系统,一旦发现OFF就告警。同时把rpl_semi_sync_master_timeout设置得合理一些,既不能太长导致主库被备库拖死,也不能太短导致动不动就退化。1到3秒是我个人比较常用的区间,具体要看网络延迟和业务容忍度。
5.3 恢复旧节点时最容易犯的错
故障主库A恢复后,如果你直接START SLAVE,有一个坑:A的relay log里可能还堆积着故障前没有回放完的日志。如果A在宕机期间停在了某个事务中间,直接启动复制线程,SQL线程会尝试继续应用relay log,如果这些日志和新的数据冲突,复制会报错。
稳妥的做法是先把A的relay log清掉(RESET SLAVE),然后用当前主B作为MASTER重新拉取数据。注意,RESET SLAVE之前要备份A上还没同步到B的本地数据,防止丢失故障前已经提交的事务。如果开了GTID,整个过程会简单很多:只要A上的GTID还包含在B的GTID集合里,CHANGE MASTER TO ... MASTER_AUTO_POSITION=1就能自动从断点续传,不需要手工找binlog位置。这也是我在3.1里强烈建议开GTID的原因。
5.4 复制延迟:热备的“热”是有代价的
双主热备看起来是“热”的,但实际上复制链路有延迟。不管是异步还是半同步,备库回放总需要时间。延迟来源通常是大事务(几千万行的批量更新)、DDL、备库上的其他查询竞争、磁盘慢、binlog落到慢盘。
复制延迟一旦积累,另一台节点的数据就落后于主节点,这时候如果强制切换,业务可能出现数据回滚。我见过一个例子:某团队在主库跑了一个半小时的大事务,复制延迟飙到几十分钟,他们没看监控直接切主,结果备库还差一大截数据,线上业务查不到刚创建的订单,客服电话被用户打爆。
所以延迟监控必须接入告警,而且切换前一定要看复制延迟或者GTID落后量。超过可接受范围就不要强制切,先等延迟追平,或者想清楚业务影响再做决定。为了减小大事务带来的延迟,可以考虑把大事务拆分成小批量,或者调整并行复制参数。MySQL 8.0的MTS(多线程复制)配置得当,能明显缓解回放延迟。
5.5 误操作与人为事故的防护
双主热备还有一个容易被忽略的隐患:运维误操作。因为两台机器都是可写的,不小心在备节点上执行了一条UPDATE或者DROP,这条操作会通过复制同步到主节点,直接污染整个环境。普通主从架构里,备库是只读的,误操作会被拦下来;双主里没有这层保护。
我后来给双主环境加了一些硬约束:平时在备节点上设置SET GLOBAL read_only=ON和SET GLOBAL super_read_only=ON,把它当成一个只读节点来保护。只有真正需要切换或者演练的时候,才由自动化脚本解除只读。这样一来,既保留了双主随时可接管的能力,又避免了日常运维误操作把生产数据改坏。
6. 双主热备的运维日常与进阶建议
6.1 日常巡检清单
双主热备不是搭完就一劳永逸了,日常巡检要持续做。结合实操经验,巡检至少覆盖这些点:
- 复制线程状态:
Slave_IO_Running、Slave_SQL_Running是否都是Yes - 复制延迟:GTID落后量或
Seconds_Behind_Master,超过阈值就要告警 - 半同步状态:
Rpl_semi_sync_master_status是否为ON,捕获静默退化 - VIP归属:确保同一时刻VIP只在一台机器上,防止双VIP脑裂
- 数据一致性:定期用
pt-table-checksum对比两张表数据,发现差异用pt-table-sync修复 - binlog保留时长:确保故障恢复时binlog没有过期
- 备份可用性:双主热备不代表可以不做备份,依然要定期全备和binlog备份
- 硬件层:磁盘空间、inode、CPU、内存要有基础监控
这套巡检不一定要每天人工看,应该全部脚本化、平台化,但至少每个月做一次人工复盘。尤其是数据一致性检查,很多人搭完双主就再也不管数据对不对,直到某天切换了才发现备库数据早就和主库对不上了。
6.2 和读写分离、中间件的组合玩法
双主热备落地到业务侧,通常要配合读写分离中间件或者应用层连接管理。常见组合是:VIP只负责故障切换时的IP漂移;如果业务要拆分读写,可以在入口加ProxySQL或者MyCat,上游配置两个后端节点,通过监控脚本自动标记存活状态。这样“双主热备”就更像一个数据层的底座,上层由中间件负责路由。
也可以两条链路都启用:A负责写和部分读,B负责读,中间做一个只读代理。但要注意,这种“双主+读写分离”和单主读写分离不同:A和B都是可写的,如果中间件误把写请求路由到B,B理论上也能接收写入,只是要承担冲突风险。所以路由规则要写清楚:读可以走两边,写默认只走一台,另一台仅在切换期间接管写。把双主热备当稳定的热备底座用,比把它当双写方案用要可靠得多。
最后说一点个人经验。我搭过不少双主热备,最深的体会是:这个架构的成功与否,一半取决于复制参数和切换脚本,另一半取决于业务侧对“写入必须收敛到单点”的理解。团队里如果没人讲得清“为什么不能同时写”,那就算架构搭好了,迟早也会被某个临时需求打破。先把写入收敛、冲突容忍、切换演练这三件事定死,双主热备才能像一台安静的备用引擎那样,平时不吭声,关键时刻一打就着。
