分库分表与分区表
分区表、分库分表和分布式数据库都在解决数据量、吞吐和治理问题,但边界完全不同。过早拆分会显著增加事务、查询、扩容和运维复杂度。
# 1. 学习定位
| 维度 | 内容 |
|---|---|
| 难度层级 | 架构专家 |
| 核心目标 | 先会用,再理解机制,最后能做工程取舍和故障分析 |
| 学习方法 | 带着业务场景看命令、SQL、数据结构、日志和运行时指标 |
# 2. 核心地图
分库分表与分区表
├─ 分区表
├─ 水平分表
├─ 垂直分库
├─ 分片键
├─ 路由
├─ 全局 ID
├─ 跨分片查询
└─ 扩容迁移
# 3. 小章节深度讲解
下面把核心地图中的每个点拆开讲。每个小节都同时面向开发和运维:开发侧关注怎么设计、怎么写代码、怎么避免错误;运维侧关注怎么监控、怎么定位、怎么恢复。
# 3.1. 分区表
# 是什么
分区表 处理的是单机容量和吞吐边界。它能扩展系统,但会改变事务、唯一约束、JOIN、排序、分页和运维方式。
# 开发人员怎么用
开发人员要围绕核心查询选择分片键,并尽量让高频查询单分片完成。全局 ID、跨分片聚合和扩容迁移要在设计阶段确定。
# 运维人员怎么看
运维人员要关注分片均衡、热点分片、路由配置、扩容迁移进度和数据校验。分库分表后,故障定位也会从单实例变成拓扑问题。
# 常见风险
常见风险是过早拆分,单机优化、归档和读写分离还没做完,系统复杂度已经不可逆上升。
# 3.2. 水平分表
# 是什么
水平分表 处理的是单机容量和吞吐边界。它能扩展系统,但会改变事务、唯一约束、JOIN、排序、分页和运维方式。
# 开发人员怎么用
开发人员要围绕核心查询选择分片键,并尽量让高频查询单分片完成。全局 ID、跨分片聚合和扩容迁移要在设计阶段确定。
# 运维人员怎么看
运维人员要关注分片均衡、热点分片、路由配置、扩容迁移进度和数据校验。分库分表后,故障定位也会从单实例变成拓扑问题。
# 常见风险
常见风险是过早拆分,单机优化、归档和读写分离还没做完,系统复杂度已经不可逆上升。
# 3.3. 垂直分库
# 是什么
垂直分库 处理的是单机容量和吞吐边界。它能扩展系统,但会改变事务、唯一约束、JOIN、排序、分页和运维方式。
# 开发人员怎么用
开发人员要围绕核心查询选择分片键,并尽量让高频查询单分片完成。全局 ID、跨分片聚合和扩容迁移要在设计阶段确定。
# 运维人员怎么看
运维人员要关注分片均衡、热点分片、路由配置、扩容迁移进度和数据校验。分库分表后,故障定位也会从单实例变成拓扑问题。
# 常见风险
常见风险是过早拆分,单机优化、归档和读写分离还没做完,系统复杂度已经不可逆上升。
# 3.4. 分片键
# 是什么
分片键 处理的是单机容量和吞吐边界。它能扩展系统,但会改变事务、唯一约束、JOIN、排序、分页和运维方式。
# 开发人员怎么用
开发人员要围绕核心查询选择分片键,并尽量让高频查询单分片完成。全局 ID、跨分片聚合和扩容迁移要在设计阶段确定。
# 运维人员怎么看
运维人员要关注分片均衡、热点分片、路由配置、扩容迁移进度和数据校验。分库分表后,故障定位也会从单实例变成拓扑问题。
# 常见风险
常见风险是过早拆分,单机优化、归档和读写分离还没做完,系统复杂度已经不可逆上升。
# 3.5. 路由
# 是什么
路由 处理的是单机容量和吞吐边界。它能扩展系统,但会改变事务、唯一约束、JOIN、排序、分页和运维方式。
# 开发人员怎么用
开发人员要围绕核心查询选择分片键,并尽量让高频查询单分片完成。全局 ID、跨分片聚合和扩容迁移要在设计阶段确定。
# 运维人员怎么看
运维人员要关注分片均衡、热点分片、路由配置、扩容迁移进度和数据校验。分库分表后,故障定位也会从单实例变成拓扑问题。
# 常见风险
常见风险是过早拆分,单机优化、归档和读写分离还没做完,系统复杂度已经不可逆上升。
# 3.6. 全局 ID
# 是什么
全局 ID 处理的是单机容量和吞吐边界。它能扩展系统,但会改变事务、唯一约束、JOIN、排序、分页和运维方式。
# 开发人员怎么用
开发人员要围绕核心查询选择分片键,并尽量让高频查询单分片完成。全局 ID、跨分片聚合和扩容迁移要在设计阶段确定。
# 运维人员怎么看
运维人员要关注分片均衡、热点分片、路由配置、扩容迁移进度和数据校验。分库分表后,故障定位也会从单实例变成拓扑问题。
# 常见风险
常见风险是过早拆分,单机优化、归档和读写分离还没做完,系统复杂度已经不可逆上升。
# 3.7. 跨分片查询
# 是什么
跨分片查询 处理的是单机容量和吞吐边界。它能扩展系统,但会改变事务、唯一约束、JOIN、排序、分页和运维方式。
# 开发人员怎么用
开发人员要围绕核心查询选择分片键,并尽量让高频查询单分片完成。全局 ID、跨分片聚合和扩容迁移要在设计阶段确定。
# 运维人员怎么看
运维人员要关注分片均衡、热点分片、路由配置、扩容迁移进度和数据校验。分库分表后,故障定位也会从单实例变成拓扑问题。
# 常见风险
常见风险是过早拆分,单机优化、归档和读写分离还没做完,系统复杂度已经不可逆上升。
# 3.8. 扩容迁移
# 是什么
扩容迁移 服务于数据可恢复性。备份不是文件存在就成功,而是要能在目标时间内恢复到指定一致点。
# 开发人员怎么用
开发人员要让数据模型可校验、可重放、可补偿,例如保留业务流水号、更新时间和状态流转记录。
# 运维人员怎么看
运维人员要定期恢复演练,校验全量备份、binlog、权限、参数、表结构和业务样本。迁移还要验证增量追平和回滚入口。
# 常见风险
常见风险是只校验行数不校验内容,或备份和主库处在同一故障域,真正故障时一起丢失。
# 3.9. 本篇学习实验
建议准备一个至少百万行级别的测试表,分别观察正常查询、缺失索引、错误索引、长事务、锁等待和慢查询日志。每次实验都记录 SQL、执行计划、耗时、扫描行数和 MySQL 状态变量变化。
开发侧实验重点是理解 SQL 与事务边界,运维侧实验重点是理解指标如何变化。真正掌握本篇内容,应该能从现象反推 SQL、索引、锁、日志或存储引擎问题。
# 4. 核心机制
- 分区表仍属于同一个 MySQL 实例,优化目标多是管理大表和分区裁剪,不解决单机写入上限。
- 分库分表把数据分散到多个实例,需要应用或中间件负责路由和聚合。
- 分片键决定数据分布、查询路由和扩容难度,是整个方案最关键决策。
- 跨分片事务、跨分片排序、全局唯一约束和二级索引都是分库分表后的复杂点。
# 5. 工程实践
- 拆分前先确认单表数据量、增长速度、热点、SQL 模式和归档策略。
- 优先治理索引、冷热分离、归档和读写分离,再考虑分片。
- 选择分片键时优先让核心查询单分片命中。
- 设计全局 ID、扩容迁移、数据校验和灰度路由。
# 6. 常见坑
- 为了“高大上”提前分库分表,业务还没大,复杂度先爆炸。
- 分片键选择错误,核心查询大量跨分片。
- 忽略唯一约束和事务语义变化。
- 扩容方案只写在 PPT,没有工具和演练。
# 7. 专家视角
- 分片是一条很难回头的路,真正的专家会先穷尽单机和架构治理空间。
- 分库分表方案要以查询模型为中心,而不是只按数据量切。
- 研究方向包括在线重分片、全局二级索引、分布式事务和 HTAP 替代方案。
# 8. Tips 快问快答
Q:分区表等于分库分表吗?
A:不是。分区表仍在同一实例内,分库分表跨实例。
Q:什么时候考虑分库分表?
A:当单机容量、写入、运维窗口或隔离需求确实成为瓶颈,且其他手段不足时。
Q:分片键怎么选?
A:让最高频、最关键的查询尽量单分片命中,同时兼顾数据均匀和扩容。
# 9. 阶段小结
分库分表与分区表 的学习重点不是记住零散概念,而是把它放回真实系统:数据如何进入、如何存储、如何被查询、如何在并发下保持正确、如何在故障后恢复。掌握这些连接关系,才能从“会用”走向“能设计、能优化、能排障”。