第22章 并行与分布式查询处理
依据原书第7版完整目录覆盖10个节点:把排序、连接和算子流水线拆到多节点并控制重分区、倾斜与网络成本
第22章 并行与分布式查询处理
本课程对应Abraham Silberschatz、Henry F. Korth、S. 在“第22章 并行与分布式查询处理”的证据链中,Sudarshan著,杨冬青、李红燕、张金波等译《数据库系统概念(原书第7版)》,机械工业出版社2021年6月出版,820页,ISBN 9787111681816。原版第7版由McGraw-Hill于2019年发布。课程按原书11部分、32章与附录A逐项重构,不复制原文。
中文版第7版纸书正文收录第1-23章;第24-26章由中文版提供中文在线内容;第27-32章是原版官网英文在线章节;附录A在纸书中。本页媒介为“纸书正文”。 全课程另设学习地图与总复习,共35页;正式知识分母仍是32章与附录A。本页属于“第八部分 并行与分布式数据库”,依据正式目录覆盖10个节点。
“第22章 并行与分布式查询处理”没有使用未获授权的中文纸书正文;以 作者官网第 7 版完整目录 界定 32 章与附录 A,以 作者公开在线章节、大学模式实验 和 McGraw-Hill 第 7 版变更说明 核对可公开内容。中文解释、SQL、图示、实验与练习均为独立教学重写;实现行为再以 PostgreSQL 官方文档 等一手规范复核。
学习目标
- 能解释“第22章 并行与分布式查询处理”的10个正式节点,并把它们连接到“把排序、连接和算子流水线拆到多节点并控制重分区、倾斜与网络成本”主线。
- 能复现并行计划图、交换算子轨迹、倾斜注入和加速比报告,记录输入版本、配置、预期、实际结果与失败边界。
- 能比较至少两种实现或故障条件,证明“并行结果与串行语义一致,分区边界不漏不重,最慢任务与网络字节可观测”。
- 能设计反例推翻“只看总CPU不看关键路径,或让大表重分区造成网络爆炸与长尾任务”,并给出修复、回退和独立验收条件。
从一次可观察状态变化开始
先预测:给定一份固定的大学数据库、一个操作和一个故障时刻,哪些逻辑行、物理页、锁、版本或日志记录应该变化,哪些绝不能变化?不要先运行再解释。把预测写成状态表,然后用独立查询、执行统计、页或日志轨迹核对。若预测与观察不一致,先检查模型和实验边界,而不是立即改配置。
本页主问题是“把排序、连接和算子流水线拆到多节点并控制重分区、倾斜与网络成本”。交付不以读完为准,而以另一位学习者能从并行计划图、交换算子轨迹、倾斜注入和加速比报告复现同一结论为准。最小正确性合同是:并行结果与串行语义一致,分区边界不漏不重,最慢任务与网络字节可观测。
核心词汇与系统边界
↡交换算子是“把排序、连接和算子流水线拆到多节点并控制重分区、倾斜与网络成本”中的第1个核心概念;必须由状态、机制、反例和证据共同定义、↡并行排序是“把排序、连接和算子流水线拆到多节点并控制重分区、倾斜与网络成本”中的第2个核心概念;必须由状态、机制、反例和证据共同定义、↡分区连接是“把排序、连接和算子流水线拆到多节点并控制重分区、倾斜与网络成本”中的第3个核心概念;必须由状态、机制、反例和证据共同定义、↡数据倾斜是“把排序、连接和算子流水线拆到多节点并控制重分区、倾斜与网络成本”中的第4个核心概念;必须由状态、机制、反例和证据共同定义、↡分布式查询是“把排序、连接和算子流水线拆到多节点并控制重分区、倾斜与网络成本”中的第5个核心概念;必须由状态、机制、反例和证据共同定义 构成本页词汇表。每个词都要回答四个问题:它约束什么状态,由哪个模块执行,在哪个故障或并发边界会失效,用什么证据发现失效。只给一句名词解释不构成掌握。
扫描、连接、聚集拆到多节点并行执行,理想加速比受倾斜限制。
第七版机制逐项深读
22.1 概述
在“第22章 并行与分布式查询处理”中,“22.1 概述”组织“依据原书第7版完整目录覆盖10个节点:把排序、连接和算子流水线拆到多节点并控制重分区、倾斜与网络成本”的语义、结构、执行和证据;若不能给出一个状态变化与独立对账,本节点仍未完成。
22.2 并行排序
在“第22章 并行与分布式查询处理”中,“22.2 并行排序”的物理算法可以变化,但逻辑语义不可漂移;证据应同时保存手算结果和数据库返回结果。
22.3 并行连接
在“第22章 并行与分布式查询处理”中,验证“22.3 并行连接”使用含重复键、空结果和不匹配行的最小关系,分别核对输出模式、元组数与边界行。
22.4 其他运算
在“第22章 并行与分布式查询处理”中,“22.4 其他运算”若依赖具体数据库实现,应把标准语义、作者教材语境和 PostgreSQL 实测分层标注。
22.5 查询计划的并行求值
在“第22章 并行与分布式查询处理”中,分析“22.5 查询计划的并行求值”时画出算子树,标明每条边的模式与估计基数;等价改写必须保持结果集合而非只让 SQL 能运行。
22.6 共享内存体系结构上的查询处理
在“第22章 并行与分布式查询处理”中,分析“22.6 共享内存体系结构上的查询处理”区分 CPU、内存、顺序 I/O、随机 I/O 与网络代价,不能把抽象 cost 直接当毫秒。
22.7 并行执行的查询优化
在“第22章 并行与分布式查询处理”中,“22.7 并行执行的查询优化”的物理算法可以变化,但逻辑语义不可漂移;证据应同时保存手算结果和数据库返回结果。
22.8 流数据的并行处理
在“第22章 并行与分布式查询处理”中,分析“22.8 流数据的并行处理”时画出算子树,标明每条边的模式与估计基数;等价改写必须保持结果集合而非只让 SQL 能运行。
22.9 分布式查询处理
在“第22章 并行与分布式查询处理”中,“22.9 分布式查询处理”把逻辑算子落实为扫描、排序、连接与流水线;结果正确之外还要核对估计行数、实际行数和缓冲访问。
22.10 小结
在“第22章 并行与分布式查询处理”中,“22.10 小结”组织“依据原书第7版完整目录覆盖10个节点:把排序、连接和算子流水线拆到多节点并控制重分区、倾斜与网络成本”的语义、结构、执行和证据;若不能给出一个状态变化与独立对账,本节点仍未完成。
机制推演:从语义到物理证据
并行计划通过交换算子重新分发元组。排序先局部排序再按范围合并,连接可广播小表或按连接键重分区;加速上限受串行段、网络、倾斜和启动开销共同限制。
推演时始终区分五层。在“第22章 并行与分布式查询处理”的证据链中,第一层是业务不变量,说明哪些数据库状态合法;第二层是逻辑模型与查询语义,说明结果应该是什么;第三层是物理计划和数据结构,说明系统怎样得到结果;第四层是并发、日志与复制协议,说明交错和故障后仍保留哪些承诺;第五层是观测证据,说明我们怎样知道前四层真的成立。性能优化只能改变第三层和部分第四层的实现,不能悄悄改变前两层。
对每个节点建立因果链:输入版本与配置 → 操作或调度 → 中间状态 → 可观察输出 → 独立对账。在“第22章 并行与分布式查询处理”的证据链中,若结论涉及性能,报告中位数、尾延迟、吞吐、I/O和等待,而不是只截一条最快记录;若涉及正确性,至少准备一个应成功样本和一个应失败样本,并记录错误类别或恢复终点。
证据解释与交接
语义证据证明结果定义没有漂移。保存关系模式、约束、查询文本、参数、隔离级别和预期行集;涉及NULL、重复、顺序或聚集时,单独列出处理规则。任何实现比较都必须共享同一语义合同。
执行证据证明机制判断可以复核。保存计划、实际行数、缓冲命中、I/O、锁或版本、日志位置和错误状态中与本章相关的部分。计划估计与实际偏差本身就是结果,不应通过只截取计划名称隐藏。
失败证据证明边界真实存在。每次只注入一个变量:空输入、重复键、倾斜、并发冲突、进程崩溃、存储丢失或网络分区。明确失败前最后一个持久状态、恢复后第一个可用状态,以及是否需要人工介入。
交接证据让另一位学习者无需口头补充就能复现。最少包括版本卡、大学模式加载与重置脚本、预测表、并行计划图、交换算子轨迹、倾斜注入和加速比报告、正常与失败轨迹、独立对账、已知限制和回退条件。若更换DBMS或版本,先重跑基线再比较。
本章回顾
重新完成“把排序、连接和算子流水线拆到多节点并控制重分区、倾斜与网络成本”:先声明不变量和输入版本,按10个目录节点建立模型,手算正常路径,注入一个边界或故障,收集语义与执行证据,最后由独立查询对账。最终交付并行计划图、交换算子轨迹、倾斜注入和加速比报告,并能证明“并行结果与串行语义一致,分区边界不漏不重,最慢任务与网络字节可观测”。
小结
- 算子拆到多节点并行执行
- 重分区是网络成本大头
- 倾斜会让并行退化为串行
- 流水线与物化各有取舍
- 分布式计划要算网络账
复习与独立验收
练习
问题 1:为什么“第22章 并行与分布式查询处理”必须覆盖10个目录节点?
问题 2:本页最小正确性合同是什么?
问题 3:怎样构造能推翻常见错误的最小反例?
问题 4:为什么执行成功不能证明数据库设计正确?
问题 5:性能结论至少需要哪些数据?
问题 6:独立交接至少包含什么?
名词解释
本章出现的专业名词,用大白话再讲一遍。
- 交换算子
交换算子在本页中以“并行结果与串行语义一致,分区边界不漏不重,最慢任务与网络字节可观测”为正确性边界,并由可重放实验验证。
- 并行排序
并行排序在本页中以“并行结果与串行语义一致,分区边界不漏不重,最慢任务与网络字节可观测”为正确性边界,并由可重放实验验证。
- 分区连接
分区连接在本页中以“并行结果与串行语义一致,分区边界不漏不重,最慢任务与网络字节可观测”为正确性边界,并由可重放实验验证。
- 数据倾斜
数据倾斜在本页中以“并行结果与串行语义一致,分区边界不漏不重,最慢任务与网络字节可观测”为正确性边界,并由可重放实验验证。
- 分布式查询
分布式查询在本页中以“并行结果与串行语义一致,分区边界不漏不重,最慢任务与网络字节可观测”为正确性边界,并由可重放实验验证。