Binlog复制与主从架构
MySQL 复制通过 binlog 把主库变更传到从库,是读写分离、备份卸载、故障切换和数据订阅的基础。理解复制延迟和一致性边界,是设计数据库架构的必修课。
# 1. 学习定位
| 维度 | 内容 |
|---|---|
| 难度层级 | 高可用基础 |
| 核心目标 | 先会用,再理解机制,最后能做工程取舍和故障分析 |
| 学习方法 | 带着业务场景看命令、SQL、数据结构、日志和运行时指标 |
# 2. 核心地图
Binlog复制与主从架构
├─ binlog dump
├─ IO Thread
├─ Relay Log
├─ SQL Thread
├─ GTID
├─ 半同步复制
├─ 复制延迟
└─ 读写分离
# 3. 小章节深度讲解
下面把核心地图中的每个点拆开讲。每个小节都同时面向开发和运维:开发侧关注怎么设计、怎么写代码、怎么避免错误;运维侧关注怎么监控、怎么定位、怎么恢复。
# 3.1. binlog dump
# 是什么
binlog dump 是 MySQL 可靠性和复制链路中的关键日志或日志阶段。不同日志服务不同目标:崩溃恢复、逻辑复制、慢 SQL 分析、错误诊断或审计。
# 开发人员怎么用
开发人员要控制事务大小和写入频率,避免一次提交产生过大日志。涉及消息、缓存和外部系统时,要理解提交成功和外部可见之间的边界。
# 运维人员怎么看
运维人员要监控日志刷盘、磁盘空间、binlog 保留、复制 relay log、慢日志体积和错误日志。日志策略必须服务恢复目标,而不是只看默认配置。
# 常见风险
常见风险是日志占满磁盘导致实例不可写,或者误删 binlog 后无法做时间点恢复。
# 3.2. IO Thread
# 是什么
IO Thread 关注的是事务版本可见性。InnoDB 通过事务 ID、undo 链和 Read View 判断某个历史版本对当前语句或事务是否可见。
# 开发人员怎么用
开发人员要区分快照读和当前读。只展示数据可以依赖快照读,读后要更新就要使用当前读、条件更新或唯一约束保护业务不变量。
# 运维人员怎么看
运维人员要观察长事务、undo 表空间、history list length 和 purge 速度。版本链积压会让查询变慢,也会推迟空间回收。
# 常见风险
常见风险是长时间打开事务做分页导出或人工审核,导致旧版本长期不能清理,最终拖累整个实例。
# 3.3. Relay Log
# 是什么
Relay Log 是 MySQL 可靠性和复制链路中的关键日志或日志阶段。不同日志服务不同目标:崩溃恢复、逻辑复制、慢 SQL 分析、错误诊断或审计。
# 开发人员怎么用
开发人员要控制事务大小和写入频率,避免一次提交产生过大日志。涉及消息、缓存和外部系统时,要理解提交成功和外部可见之间的边界。
# 运维人员怎么看
运维人员要监控日志刷盘、磁盘空间、binlog 保留、复制 relay log、慢日志体积和错误日志。日志策略必须服务恢复目标,而不是只看默认配置。
# 常见风险
常见风险是日志占满磁盘导致实例不可写,或者误删 binlog 后无法做时间点恢复。
# 3.4. SQL Thread
# 是什么
SQL Thread 关注的是事务版本可见性。InnoDB 通过事务 ID、undo 链和 Read View 判断某个历史版本对当前语句或事务是否可见。
# 开发人员怎么用
开发人员要区分快照读和当前读。只展示数据可以依赖快照读,读后要更新就要使用当前读、条件更新或唯一约束保护业务不变量。
# 运维人员怎么看
运维人员要观察长事务、undo 表空间、history list length 和 purge 速度。版本链积压会让查询变慢,也会推迟空间回收。
# 常见风险
常见风险是长时间打开事务做分页导出或人工审核,导致旧版本长期不能清理,最终拖累整个实例。
# 3.5. GTID
# 是什么
GTID 属于 MySQL 高可用与复制拓扑。它决定写入如何传播到副本、故障时谁提升为新主、应用如何重新找到写入口。
# 开发人员怎么用
开发人员要区分强一致读和可延迟读。写后立即读、支付结果、权限变更等场景通常不能随意读从库。
# 运维人员怎么看
运维人员要监控复制延迟、GTID 集合、线程状态、旧主隔离、切换耗时和客户端重连。高可用必须通过演练验证 RTO/RPO。
# 常见风险
常见风险是自动切换后旧主没有隔离,网络恢复后出现双写,造成数据分叉。
# 3.6. 半同步复制
# 是什么
半同步复制 属于 MySQL 高可用与复制拓扑。它决定写入如何传播到副本、故障时谁提升为新主、应用如何重新找到写入口。
# 开发人员怎么用
开发人员要区分强一致读和可延迟读。写后立即读、支付结果、权限变更等场景通常不能随意读从库。
# 运维人员怎么看
运维人员要监控复制延迟、GTID 集合、线程状态、旧主隔离、切换耗时和客户端重连。高可用必须通过演练验证 RTO/RPO。
# 常见风险
常见风险是自动切换后旧主没有隔离,网络恢复后出现双写,造成数据分叉。
# 3.7. 复制延迟
# 是什么
复制延迟 属于 MySQL 高可用与复制拓扑。它决定写入如何传播到副本、故障时谁提升为新主、应用如何重新找到写入口。
# 开发人员怎么用
开发人员要区分强一致读和可延迟读。写后立即读、支付结果、权限变更等场景通常不能随意读从库。
# 运维人员怎么看
运维人员要监控复制延迟、GTID 集合、线程状态、旧主隔离、切换耗时和客户端重连。高可用必须通过演练验证 RTO/RPO。
# 常见风险
常见风险是自动切换后旧主没有隔离,网络恢复后出现双写,造成数据分叉。
# 3.8. 读写分离
# 是什么
读写分离 属于 MySQL 高可用与复制拓扑。它决定写入如何传播到副本、故障时谁提升为新主、应用如何重新找到写入口。
# 开发人员怎么用
开发人员要区分强一致读和可延迟读。写后立即读、支付结果、权限变更等场景通常不能随意读从库。
# 运维人员怎么看
运维人员要监控复制延迟、GTID 集合、线程状态、旧主隔离、切换耗时和客户端重连。高可用必须通过演练验证 RTO/RPO。
# 常见风险
常见风险是自动切换后旧主没有隔离,网络恢复后出现双写,造成数据分叉。
# 3.9. 本篇学习实验
建议准备一个至少百万行级别的测试表,分别观察正常查询、缺失索引、错误索引、长事务、锁等待和慢查询日志。每次实验都记录 SQL、执行计划、耗时、扫描行数和 MySQL 状态变量变化。
开发侧实验重点是理解 SQL 与事务边界,运维侧实验重点是理解指标如何变化。真正掌握本篇内容,应该能从现象反推 SQL、索引、锁、日志或存储引擎问题。
# 4. 核心机制
- 主库提交后写 binlog,从库 IO 线程拉取 binlog 写入 relay log,SQL 线程或 worker 再重放。
- GTID 为事务提供全局编号,简化主从切换、补齐和故障恢复。
- 异步复制不能保证主库提交后从库立刻可见,读写分离必须处理延迟。
- 半同步复制要求至少一个从库确认收到事务事件,但不等于从库已经执行完成。
# 5. 工程实践
- 读写分离场景中,强一致读走主库或使用读己之写方案。
- 监控复制延迟、relay log 积压、线程状态和从库错误。
- 主从切换前确认 GTID 集合、只读状态、应用连接和数据一致性。
- 不要把从库当作永远无延迟的数据副本。
# 6. 常见坑
- 用户刚写完订单,立刻查从库查不到。
- 从库执行慢 SQL 或大事务,造成复制延迟不断扩大。
- 主从表结构不一致,复制中断。
- 切换时没有禁止旧主写入,产生双主数据分叉。
# 7. 专家视角
- 复制架构的关键不是“有几个从库”,而是延迟、切换和一致性策略。
- 专家会为每类读请求定义一致性等级,而不是简单把所有读都打到从库。
- GTID、半同步和监控只能降低风险,不能替代切换流程演练。
# 8. Tips 快问快答
Q:主从复制是强一致吗?
A:默认异步复制不是强一致,从库可能延迟。
Q:半同步是否保证从库可读到数据?
A:不保证。它通常只保证事件被至少一个从库收到,不代表已经执行完成。
Q:读写分离最大风险是什么?
A:复制延迟导致读到旧数据。
# 9. 阶段小结
Binlog复制与主从架构 的学习重点不是记住零散概念,而是把它放回真实系统:数据如何进入、如何存储、如何被查询、如何在并发下保持正确、如何在故障后恢复。掌握这些连接关系,才能从“会用”走向“能设计、能优化、能排障”。