SQL查询与函数
MySQL 查询能力不仅包括基础过滤和连接,还包括聚合、窗口函数、CTE、JSON 函数、日期函数和条件表达式。掌握这些能力可以减少应用层搬运数据,但也要避免把数据库变成不可控的计算引擎。
# 1. 学习定位
| 维度 | 内容 |
|---|---|
| 难度层级 | SQL 进阶 |
| 核心目标 | 先会用,再理解机制,最后能做工程取舍和故障分析 |
| 学习方法 | 带着业务场景看命令、SQL、数据结构、日志和运行时指标 |
# 2. 核心地图
SQL查询与函数
├─ JOIN
├─ GROUP BY
├─ 窗口函数
├─ CTE
├─ 子查询
├─ 日期函数
├─ JSON 函数
└─ 条件表达式
# 3. 小章节深度讲解
下面把核心地图中的每个点拆开讲。每个小节都同时面向开发和运维:开发侧关注怎么设计、怎么写代码、怎么避免错误;运维侧关注怎么监控、怎么定位、怎么恢复。
# 3.1. JOIN
# 是什么
JOIN 是 SQL 语言和优化器执行模型的一部分。SQL 是声明式语言,写法会影响优化器能否下推过滤、利用索引、减少排序和临时表。
# 开发人员怎么用
开发人员要写可优化的 SQL:字段类型匹配,避免在索引列上包函数,JOIN 条件完整,分页和排序有索引支撑。复杂 SQL 要先拆解数据流。
# 运维人员怎么看
运维人员要通过慢日志、执行计划、临时表指标、排序指标和 CPU/IO 观察 SQL 成本。报表查询应与在线交易隔离。
# 常见风险
常见风险是把所有计算塞进一条 SQL,测试数据没问题,生产数据一大就拖垮主库。
# 3.2. GROUP BY
# 是什么
GROUP BY 是 SQL 语言和优化器执行模型的一部分。SQL 是声明式语言,写法会影响优化器能否下推过滤、利用索引、减少排序和临时表。
# 开发人员怎么用
开发人员要写可优化的 SQL:字段类型匹配,避免在索引列上包函数,JOIN 条件完整,分页和排序有索引支撑。复杂 SQL 要先拆解数据流。
# 运维人员怎么看
运维人员要通过慢日志、执行计划、临时表指标、排序指标和 CPU/IO 观察 SQL 成本。报表查询应与在线交易隔离。
# 常见风险
常见风险是把所有计算塞进一条 SQL,测试数据没问题,生产数据一大就拖垮主库。
# 3.3. 窗口函数
# 是什么
窗口函数 是 SQL 语言和优化器执行模型的一部分。SQL 是声明式语言,写法会影响优化器能否下推过滤、利用索引、减少排序和临时表。
# 开发人员怎么用
开发人员要写可优化的 SQL:字段类型匹配,避免在索引列上包函数,JOIN 条件完整,分页和排序有索引支撑。复杂 SQL 要先拆解数据流。
# 运维人员怎么看
运维人员要通过慢日志、执行计划、临时表指标、排序指标和 CPU/IO 观察 SQL 成本。报表查询应与在线交易隔离。
# 常见风险
常见风险是把所有计算塞进一条 SQL,测试数据没问题,生产数据一大就拖垮主库。
# 3.4. CTE
# 是什么
CTE 是 SQL 语言和优化器执行模型的一部分。SQL 是声明式语言,写法会影响优化器能否下推过滤、利用索引、减少排序和临时表。
# 开发人员怎么用
开发人员要写可优化的 SQL:字段类型匹配,避免在索引列上包函数,JOIN 条件完整,分页和排序有索引支撑。复杂 SQL 要先拆解数据流。
# 运维人员怎么看
运维人员要通过慢日志、执行计划、临时表指标、排序指标和 CPU/IO 观察 SQL 成本。报表查询应与在线交易隔离。
# 常见风险
常见风险是把所有计算塞进一条 SQL,测试数据没问题,生产数据一大就拖垮主库。
# 3.5. 子查询
# 是什么
子查询 是 SQL 语言和优化器执行模型的一部分。SQL 是声明式语言,写法会影响优化器能否下推过滤、利用索引、减少排序和临时表。
# 开发人员怎么用
开发人员要写可优化的 SQL:字段类型匹配,避免在索引列上包函数,JOIN 条件完整,分页和排序有索引支撑。复杂 SQL 要先拆解数据流。
# 运维人员怎么看
运维人员要通过慢日志、执行计划、临时表指标、排序指标和 CPU/IO 观察 SQL 成本。报表查询应与在线交易隔离。
# 常见风险
常见风险是把所有计算塞进一条 SQL,测试数据没问题,生产数据一大就拖垮主库。
# 3.6. 日期函数
# 是什么
日期函数 是 SQL 语言和优化器执行模型的一部分。SQL 是声明式语言,写法会影响优化器能否下推过滤、利用索引、减少排序和临时表。
# 开发人员怎么用
开发人员要写可优化的 SQL:字段类型匹配,避免在索引列上包函数,JOIN 条件完整,分页和排序有索引支撑。复杂 SQL 要先拆解数据流。
# 运维人员怎么看
运维人员要通过慢日志、执行计划、临时表指标、排序指标和 CPU/IO 观察 SQL 成本。报表查询应与在线交易隔离。
# 常见风险
常见风险是把所有计算塞进一条 SQL,测试数据没问题,生产数据一大就拖垮主库。
# 3.7. JSON 函数
# 是什么
JSON 函数 是 SQL 语言和优化器执行模型的一部分。SQL 是声明式语言,写法会影响优化器能否下推过滤、利用索引、减少排序和临时表。
# 开发人员怎么用
开发人员要写可优化的 SQL:字段类型匹配,避免在索引列上包函数,JOIN 条件完整,分页和排序有索引支撑。复杂 SQL 要先拆解数据流。
# 运维人员怎么看
运维人员要通过慢日志、执行计划、临时表指标、排序指标和 CPU/IO 观察 SQL 成本。报表查询应与在线交易隔离。
# 常见风险
常见风险是把所有计算塞进一条 SQL,测试数据没问题,生产数据一大就拖垮主库。
# 3.8. 条件表达式
# 是什么
条件表达式 是 SQL 语言和优化器执行模型的一部分。SQL 是声明式语言,写法会影响优化器能否下推过滤、利用索引、减少排序和临时表。
# 开发人员怎么用
开发人员要写可优化的 SQL:字段类型匹配,避免在索引列上包函数,JOIN 条件完整,分页和排序有索引支撑。复杂 SQL 要先拆解数据流。
# 运维人员怎么看
运维人员要通过慢日志、执行计划、临时表指标、排序指标和 CPU/IO 观察 SQL 成本。报表查询应与在线交易隔离。
# 常见风险
常见风险是把所有计算塞进一条 SQL,测试数据没问题,生产数据一大就拖垮主库。
# 3.9. 本篇学习实验
建议准备一个至少百万行级别的测试表,分别观察正常查询、缺失索引、错误索引、长事务、锁等待和慢查询日志。每次实验都记录 SQL、执行计划、耗时、扫描行数和 MySQL 状态变量变化。
开发侧实验重点是理解 SQL 与事务边界,运维侧实验重点是理解指标如何变化。真正掌握本篇内容,应该能从现象反推 SQL、索引、锁、日志或存储引擎问题。
# 4. 核心机制
- 窗口函数在不压缩行数的情况下进行分组内排序、排名和累计计算,适合 TopN、分组排名和滚动统计。
- CTE 可以提升复杂 SQL 可读性,但是否物化、是否合并要看优化器策略和版本行为。
- JSON 函数适合半结构化扩展字段,但频繁按 JSON 内部字段过滤时要考虑生成列或函数索引。
- 函数计算如果作用在索引列上,常常会破坏索引有序性,导致无法走范围扫描。
# 5. 工程实践
- 用窗口函数替代部分自连接排名查询,提高可读性。
- 复杂查询先验证数据量级,再决定放在 MySQL、应用层还是离线平台。
- 日期范围查询写成半开区间,例如
created_at >= ? AND created_at < ?。 - JSON 字段只存扩展属性,不存核心可检索关系。
# 6. 常见坑
- 在
WHERE DATE(created_at)中包函数,导致时间索引难以利用。 - 把大量复杂报表放到主库执行,影响在线交易。
- 滥用子查询导致优化器无法有效改写。
- JSON 字段无约束、无索引、无治理,最终变成不可维护的大文本。
# 7. 专家视角
- SQL 表达力越强,越要建立边界:哪些计算属于 OLTP,哪些应该进入数仓或搜索系统。
- 专家会用函数和窗口能力减少不必要的数据往返,但不会牺牲可观测性和执行计划可控性。
- 复杂查询上线前要准备数据倾斜样本,而不是只在少量测试数据上验证。
# 8. Tips 快问快答
Q:窗口函数会减少行数吗?
A:不会。它在原始行上追加分组内计算结果,聚合函数才会压缩行数。
Q:CTE 一定更快吗?
A:不一定。CTE 首先提升可读性,性能要看优化器改写和执行计划。
Q:JSON 能代替关系模型吗?
A:不能。JSON 适合扩展属性,核心关系和高频查询字段仍应结构化。
# 9. 阶段小结
SQL查询与函数 的学习重点不是记住零散概念,而是把它放回真实系统:数据如何进入、如何存储、如何被查询、如何在并发下保持正确、如何在故障后恢复。掌握这些连接关系,才能从“会用”走向“能设计、能优化、能排障”。