第13章 并行计算
从并行梯度、MapReduce、同步/异步与A3C分析吞吐、陈旧度和策略一致性;用环境合同、更新轨迹和独立评估门交付工作器时间线、梯度版本、冲突率与样本效率报告
学习目标
- 能说明“第13章 并行计算”如何从并行梯度、MapReduce、同步/异步与A3C分析吞吐、陈旧度和策略一致性,并区分原版目录、作者代码映射、独立技术来源和本站重写
- 能先预测“并行工作器计算的梯度对应哪个参数与策略版本?”会改变哪一个环境、轨迹、回报、目标、策略或评估状态,再操作三类交互证据
- 能只注入“无版本记录地应用陈旧梯度并把吞吐提升等同于学习提升”,定位首个偏离“参数版本、梯度版本、聚合顺序、随机流与更新计数可追溯”的状态,并从同一快照完成恢复
为什么从这个问题开始
“第13章 并行计算”围绕“并行工作器计算的梯度对应哪个参数与策略版本?”建立贯穿任务:重放多个工作器对共享参数的更新队列。先写下哪个环境、轨迹、回报、目标、策略或评估状态会最先变化,再运行参考、故障和恢复路径;运行后补理由不算预测。只有守住“参数版本、梯度版本、聚合顺序、随机流与更新计数可追溯”并交付工作器时间线、梯度版本、冲突率与样本效率报告,训练回报、策略价值、搜索统计或应用收益才构成机制证据。
原版书目、272个正式坐标与访问边界
“第13章 并行计算”以作者官方代码仓库核对王树森、黎彧君、张志华著《深度强化学习》的第1至19章及主要算法—实现映射,以馆藏书目核对人民邮电出版社、2022年11月、294页和ISBN 9787115600691,再以发行数字版完整目录核对5个部分、19章、233个编号节/小节、附录A、附录B与B.1至B.13,合计272个正式目录层级。
作者仓库验证章节和算法实现确实对应,但仓库页面未提供可据以复用代码、图表或书稿的明确许可;发行数字版用于核对目录范围,不作为复制正文的授权。“第13章 并行计算”不翻译、摘编或改写原书正文,也不复制仓库代码;中文讲解、状态轨迹、反例、交互、练习与答案均为独立教学重写。
本页独立核对 1只用于独立核对本页算法、环境接口或实验边界,不能反向证明原书使用本站表述。Gymnasium、PyTorch、PettingZoo等当前API行为按2026-07-30核对并显式视为当前实现,不倒填为2022年原书内容。
原版目录层级与可验证机制
第四部分 多智能体强化学习
↡多智能体强化学习对应正式目录坐标“第四部分 多智能体强化学习”,在“第13章 并行计算”中用于声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 1/14。 原版目录键 第四部分 多智能体强化学习。在“第13章 并行计算”的第1个正式坐标中,「第四部分 多智能体强化学习」通过声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构推进并行更新、同步与陈旧梯度;复核者保存身份表、联合动作、奖励归属、可见性矩阵、对战矩阵与掩码,出现智能体顺序、全局信息、对手版本或padding掩码泄漏就撤回结论。
第13章 并行计算
↡并行计算对应正式目录坐标“第13章 并行计算”,在“第13章 并行计算”中用于跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 2/14。 原版目录键 第13章 并行计算。围绕“并行工作器计算的梯度对应哪个参数与策略版本?”,“第13章 并行计算”在坐标2把「第13章 并行计算」落实为跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价;只有工作器时间线、梯度版本、冲突率、吞吐和样本效率可重放且反例排除只看墙钟速度,不记录陈旧策略与更新冲突,本节点才算掌握。
13·1 并行计算基础
↡并行计算基础对应正式目录坐标“13.1 并行计算基础”,在“第13章 并行计算”中用于跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 3/14。 原版目录键 13.1 并行计算基础。“第13章 并行计算”的目录节点3「13·1 并行计算基础」不能停在术语复述:它要跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价,交付工作器时间线、梯度版本、冲突率、吞吐和样本效率,并把只看墙钟速度,不记录陈旧策略与更新冲突设为单一反事实。
13·1·1 并行梯度下降
↡并行梯度下降对应正式目录坐标“13.1.1 并行梯度下降”,在“第13章 并行计算”中用于明确输入/输出shape、损失、局部导数和参数更新,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 4/14。 原版目录键 13.1.1 并行梯度下降。对“第13章 并行计算”而言,「13·1·1 并行梯度下降」在第4次检查中改变可观察状态,因为它负责明确输入/输出shape、损失、局部导数和参数更新;shape、前向值、损失分量、梯度与有限差分必须与“参数版本、梯度版本、聚合顺序、随机流与更新计数可追溯”对齐,不能接受数值可运行却混淆样本轴、动作轴、类别轴或梯度缩放。
13·1·2 MapReduce
↡MapReduce对应正式目录坐标“13.1.2 MapReduce”,在“第13章 并行计算”中用于跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 5/14。 原版目录键 13.1.2 MapReduce。在“第13章 并行计算”的第5个正式坐标中,「13·1·2 MapReduce」通过跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价推进并行更新、同步与陈旧梯度;复核者保存工作器时间线、梯度版本、冲突率、吞吐和样本效率,出现只看墙钟速度,不记录陈旧策略与更新冲突就撤回结论。
13·1·3 用MapReduce实现并行梯度下降
↡用MapReduce实现并行梯度下降对应正式目录坐标“13.1.3 用MapReduce实现并行梯度下降”,在“第13章 并行计算”中用于明确输入/输出shape、损失、局部导数和参数更新,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 6/14。 原版目录键 13.1.3 用MapReduce实现并行梯度下降。围绕“并行工作器计算的梯度对应哪个参数与策略版本?”,“第13章 并行计算”在坐标6把「13·1·3 用MapReduce实现并行梯度下降」落实为明确输入/输出shape、损失、局部导数和参数更新;只有shape、前向值、损失分量、梯度与有限差分可重放且反例排除数值可运行却混淆样本轴、动作轴、类别轴或梯度缩放,本节点才算掌握。
13·1·4 并行计算的代价
↡并行计算的代价对应正式目录坐标“13.1.4 并行计算的代价”,在“第13章 并行计算”中用于跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 7/14。 原版目录键 13.1.4 并行计算的代价。“第13章 并行计算”的目录节点7「13·1·4 并行计算的代价」不能停在术语复述:它要跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价,交付工作器时间线、梯度版本、冲突率、吞吐和样本效率,并把只看墙钟速度,不记录陈旧策略与更新冲突设为单一反事实。
13·2 同步与异步
↡同步与异步对应正式目录坐标“13.2 同步与异步”,在“第13章 并行计算”中用于跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 8/14。 原版目录键 13.2 同步与异步。对“第13章 并行计算”而言,「13·2 同步与异步」在第8次检查中改变可观察状态,因为它负责跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价;工作器时间线、梯度版本、冲突率、吞吐和样本效率必须与“参数版本、梯度版本、聚合顺序、随机流与更新计数可追溯”对齐,不能接受只看墙钟速度,不记录陈旧策略与更新冲突。
13·2·1 同步算法
↡同步算法对应正式目录坐标“13.2.1 同步算法”,在“第13章 并行计算”中用于跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 9/14。 原版目录键 13.2.1 同步算法。在“第13章 并行计算”的第9个正式坐标中,「13·2·1 同步算法」通过跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价推进并行更新、同步与陈旧梯度;复核者保存工作器时间线、梯度版本、冲突率、吞吐和样本效率,出现只看墙钟速度,不记录陈旧策略与更新冲突就撤回结论。
13·2·2 异步算法
↡异步算法对应正式目录坐标“13.2.2 异步算法”,在“第13章 并行计算”中用于跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 10/14。 原版目录键 13.2.2 异步算法。围绕“并行工作器计算的梯度对应哪个参数与策略版本?”,“第13章 并行计算”在坐标10把「13·2·2 异步算法」落实为跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价;只有工作器时间线、梯度版本、冲突率、吞吐和样本效率可重放且反例排除只看墙钟速度,不记录陈旧策略与更新冲突,本节点才算掌握。
13·2·3 同步梯度下降与异步梯度下降的对比
↡同步梯度下降与异步梯度下降的对比对应正式目录坐标“13.2.3 同步梯度下降与异步梯度下降的对比”,在“第13章 并行计算”中用于明确输入/输出shape、损失、局部导数和参数更新,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 11/14。 原版目录键 13.2.3 同步梯度下降与异步梯度下降的对比。“第13章 并行计算”的目录节点11「13·2·3 同步梯度下降与异步梯度下降的对比」不能停在术语复述:它要明确输入/输出shape、损失、局部导数和参数更新,交付shape、前向值、损失分量、梯度与有限差分,并把数值可运行却混淆样本轴、动作轴、类别轴或梯度缩放设为单一反事实。
13·3 并行强化学习
↡并行强化学习对应正式目录坐标“13.3 并行强化学习”,在“第13章 并行计算”中用于跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 12/14。 原版目录键 13.3 并行强化学习。对“第13章 并行计算”而言,「13·3 并行强化学习」在第12次检查中改变可观察状态,因为它负责跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价;工作器时间线、梯度版本、冲突率、吞吐和样本效率必须与“参数版本、梯度版本、聚合顺序、随机流与更新计数可追溯”对齐,不能接受只看墙钟速度,不记录陈旧策略与更新冲突。
13·3·1 异步并行双Q学习
↡异步并行双Q学习对应正式目录坐标“13.3.1 异步并行双Q学习”,在“第13章 并行计算”中用于构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 13/14。 原版目录键 13.3.1 异步并行双Q学习。在“第13章 并行计算”的第13个正式坐标中,「13·3·1 异步并行双Q学习」通过构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色推进并行更新、同步与陈旧梯度;复核者保存回放索引、下一动作、TD目标、误差、优先级和参数快照,出现目标网络泄漏、策略角色错位或多技巧同时变化就撤回结论。
13·3·2 A3C:异步并行A2C
↡A3C对应正式目录坐标“13.3.2 A3C:异步并行A2C”,在“第13章 并行计算”中用于跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 14/14。 原版目录键 13.3.2 A3C:异步并行A2C。围绕“并行工作器计算的梯度对应哪个参数与策略版本?”,“第13章 并行计算”在坐标14把「13·3·2 A3C:异步并行A2C」落实为跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价;只有工作器时间线、梯度版本、冲突率、吞吐和样本效率可重放且反例排除只看墙钟速度,不记录陈旧策略与更新冲突,本节点才算掌握。
先预测,再操作三个章专属实验
1. 环境与轨迹合同
为“第13章 并行计算”选择正式目录坐标,在参考合同与单一反事实间切换,逐角色核对输入、状态变化、证据与即时裁决。
环境—轨迹合同
第13章 并行计算
选择正式目录坐标,冻结环境角色,再定位参考轨迹与单一反事实的首个分岔。
合同 1/4
第13章 并行计算 · 环境与角色
- 输入角色
- 重放多个工作器对共享参数的更新队列
- 状态变化
- 冻结并行更新、同步与陈旧梯度所需的环境版本、观测/状态、动作、奖励和数据角色
- 应留证据
- 第13章 并行计算的环境合同、策略快照与基线轨迹
- 即时裁决
- 第13章 并行计算的角色、时间索引、shape、终止和可见性没有错位
第13章 并行计算的可重放协议
| 阶段 | 允许动作 | 必留证据 | 拒绝条件 |
|---|---|---|---|
| 第13章 并行计算 · 环境与角色 | 冻结并行更新、同步与陈旧梯度所需的环境版本、观测/状态、动作、奖励和数据角色 | 第13章 并行计算的环境合同、策略快照与基线轨迹 | 未满足“第13章 并行计算的角色、时间索引、shape、终止和可见性没有错位” |
| 第13章 并行计算 · 回报与目标 | 按从并行梯度、MapReduce、同步/异步与A3C分析吞吐、陈旧度和策略一致性构造回报、目标、估计量或搜索统计 | 第13章 并行计算的逐步回报、目标分量与中间状态 | 未满足“第13章 并行计算的目标可由同一轨迹、公式和随机状态复算” |
| 第13章 并行计算 · 更新与策略 | 执行一次受控更新并记录策略、价值、梯度或联合决策的变化 | 第13章 并行计算的更新前后差、首个分岔和恢复路径 | 未满足“第13章 并行计算没有把代理损失、单次回报或训练内统计当作最终结论” |
| 第13章 并行计算 · 独立评估 | 重放基线、单故障、恢复和边界案例 | 第13章 并行计算的接受、回退或拒绝理由 | 未满足“第13章 并行计算满足“参数版本、梯度版本、聚合顺序、随机流与更新计数可追溯”” |
unit: "drl-13"
question: "并行工作器计算的梯度对应哪个参数与策略版本?"
scenario: "重放多个工作器对共享参数的更新队列"
invariant: "参数版本、梯度版本、聚合顺序、随机流与更新计数可追溯"
fault: "无版本记录地应用陈旧梯度并把吞吐提升等同于学习提升"
evidence: "工作器时间线、梯度版本、冲突率与样本效率报告"
reset: restore_concept_mode_stage_trace_step_case_gates_and_artifact“第13章 并行计算”要求从同一环境、轨迹、策略/对手版本、预算和随机状态重放参考、故障与恢复路径。重置后若目录选择、合同模式、阶段、轨迹步骤、案例、证据门或交付包没有回到基线,本次比较已经混入状态泄漏。
本页回顾
掌握“第13章 并行计算”不是背算法名或抄训练循环,而是围绕“并行工作器计算的梯度对应哪个参数与策略版本?”重建环境、轨迹、回报、目标、更新、策略/对手快照与独立评估,并用“参数版本、梯度版本、聚合顺序、随机流与更新计数可追溯”拒绝“无版本记录地应用陈旧梯度并把吞吐提升等同于学习提升”。最终交付为工作器时间线、梯度版本、冲突率与样本效率报告。
练习与答案
练习
- 问题 1:实验合同。 “第13章 并行计算”为什么必须先冻结环境、轨迹、策略/对手版本、预算、随机性和评估口径?
- 问题 2:目录逐项覆盖。 怎样证明“第13章 并行计算”的正式目录坐标已经进入机制、交互和练习?
- 问题 3:故障恢复。 怎样证明“无版本记录地应用陈旧梯度并把吞吐提升等同于学习提升”已经被修正?
名词解释
名词解释
本章出现的专业名词,用大白话再讲一遍。
- 多智能体强化学习
检索键 drl-A 对应正式目录坐标「第四部分 多智能体强化学习」;在“第13章 并行计算”中用于声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 并行计算
检索键 drl-B 对应正式目录坐标「第13章 并行计算」;在“第13章 并行计算”中用于跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 并行计算基础
检索键 drl-C 对应正式目录坐标「13·1 并行计算基础」;在“第13章 并行计算”中用于跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 并行梯度下降
检索键 drl-D 对应正式目录坐标「13·1·1 并行梯度下降」;在“第13章 并行计算”中用于明确输入/输出shape、损失、局部导数和参数更新,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- MapReduce
检索键 drl-E 对应正式目录坐标「13·1·2 MapReduce」;在“第13章 并行计算”中用于跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 用MapReduce实现并行梯度下降
检索键 drl-F 对应正式目录坐标「13·1·3 用MapReduce实现并行梯度下降」;在“第13章 并行计算”中用于明确输入/输出shape、损失、局部导数和参数更新,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 并行计算的代价
检索键 drl-G 对应正式目录坐标「13·1·4 并行计算的代价」;在“第13章 并行计算”中用于跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 同步与异步
检索键 drl-H 对应正式目录坐标「13·2 同步与异步」;在“第13章 并行计算”中用于跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 同步算法
检索键 drl-I 对应正式目录坐标「13·2·1 同步算法」;在“第13章 并行计算”中用于跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 异步算法
检索键 drl-J 对应正式目录坐标「13·2·2 异步算法」;在“第13章 并行计算”中用于跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 同步梯度下降与异步梯度下降的对比
检索键 drl-K 对应正式目录坐标「13·2·3 同步梯度下降与异步梯度下降的对比」;在“第13章 并行计算”中用于明确输入/输出shape、损失、局部导数和参数更新,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 并行强化学习
检索键 drl-L 对应正式目录坐标「13·3 并行强化学习」;在“第13章 并行计算”中用于跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 异步并行双Q学习
检索键 drl-M 对应正式目录坐标「13·3·1 异步并行双Q学习」;在“第13章 并行计算”中用于构造可复算的TD目标并区分同策略、异策略、采样和目标网络角色,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- A3C
检索键 drl-N 对应正式目录坐标「13·3·2 A3C:异步并行A2C」;在“第13章 并行计算”中用于跟踪工作器、参数版本、梯度陈旧度、聚合顺序和吞吐代价,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。