第16章 非合作关系设定下的多智能体强化学习
在非合作与混合关系中分析策略目标、收敛判别、MADDPG和集中式critic;用环境合同、更新轨迹和独立评估门交付对手池、交叉对战矩阵、critic输入与纳什偏差诊断
学习目标
- 能说明“第16章 非合作关系设定下的多智能体强化学习”如何在非合作与混合关系中分析策略目标、收敛判别、MADDPG和集中式critic,并区分原版目录、作者代码映射、独立技术来源和本站重写
- 能先预测“对手策略持续变化时,候选策略相对哪个快照被评价?”会改变哪一个环境、轨迹、回报、目标、策略或评估状态,再操作三类交互证据
- 能只注入“只对训练末尾的同代对手评估并宣称策略普遍占优”,定位首个偏离“对手快照、联合动作、critic信息、随机种子与评价协议不随候选改变”的状态,并从同一快照完成恢复
为什么从这个问题开始
“第16章 非合作关系设定下的多智能体强化学习”围绕“对手策略持续变化时,候选策略相对哪个快照被评价?”建立贯穿任务:冻结对手池后评估多智能体A2C与MADDPG候选。先写下哪个环境、轨迹、回报、目标、策略或评估状态会最先变化,再运行参考、故障和恢复路径;运行后补理由不算预测。只有守住“对手快照、联合动作、critic信息、随机种子与评价协议不随候选改变”并交付对手池、交叉对战矩阵、critic输入与纳什偏差诊断,训练回报、策略价值、搜索统计或应用收益才构成机制证据。
原版书目、272个正式坐标与访问边界
“第16章 非合作关系设定下的多智能体强化学习”以作者官方代码仓库核对王树森、黎彧君、张志华著《深度强化学习》的第1至19章及主要算法—实现映射,以馆藏书目核对人民邮电出版社、2022年11月、294页和ISBN 9787115600691,再以发行数字版完整目录核对5个部分、19章、233个编号节/小节、附录A、附录B与B.1至B.13,合计272个正式目录层级。
作者仓库验证章节和算法实现确实对应,但仓库页面未提供可据以复用代码、图表或书稿的明确许可;发行数字版用于核对目录范围,不作为复制正文的授权。“第16章 非合作关系设定下的多智能体强化学习”不翻译、摘编或改写原书正文,也不复制仓库代码;中文讲解、状态轨迹、反例、交互、练习与答案均为独立教学重写。
本页独立核对 1只用于独立核对本页算法、环境接口或实验边界,不能反向证明原书使用本站表述。Gymnasium、PyTorch、PettingZoo等当前API行为按2026-07-30核对并显式视为当前实现,不倒填为2022年原书内容。
原版目录层级与可验证机制
第16章 非合作关系设定下的多智能体强化学习
↡非合作关系设定下的多智能体强化学习对应正式目录坐标“第16章 非合作关系设定下的多智能体强化学习”,在“第16章 非合作关系设定下的多智能体强化学习”中用于声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 1/19。 原版目录键 第16章 非合作关系设定下的多智能体强化学习。在“第16章 非合作关系设定下的多智能体强化学习”的第1个正式坐标中,「第16章 非合作关系设定下的多智能体强化学习」通过声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构推进非平稳对手、集中式critic与交叉评估;复核者保存身份表、联合动作、奖励归属、可见性矩阵、对战矩阵与掩码,出现智能体顺序、全局信息、对手版本或padding掩码泄漏就撤回结论。
16·1 非合作关系设定下的策略学习
↡非合作关系设定下的策略学习对应正式目录坐标“16.1 非合作关系设定下的策略学习”,在“第16章 非合作关系设定下的多智能体强化学习”中用于建立环境、轨迹、终止、策略、回报和价值的时间合同,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 2/19。 原版目录键 16.1 非合作关系设定下的策略学习。围绕“对手策略持续变化时,候选策略相对哪个快照被评价?”,“第16章 非合作关系设定下的多智能体强化学习”在坐标2把「16·1 非合作关系设定下的策略学习」落实为建立环境、轨迹、终止、策略、回报和价值的时间合同;只有转移记录、策略概率、终止/截断标记、回报与价值残差可重放且反例排除混淆状态与观测、终止与截断或行为策略与目标策略,本节点才算掌握。
16·1·1 非合作关系设定下的目标函数
↡非合作关系设定下的目标函数对应正式目录坐标“16.1.1 非合作关系设定下的目标函数”,在“第16章 非合作关系设定下的多智能体强化学习”中用于声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 3/19。 原版目录键 16.1.1 非合作关系设定下的目标函数。“第16章 非合作关系设定下的多智能体强化学习”的目录节点3「16·1·1 非合作关系设定下的目标函数」不能停在术语复述:它要声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构,交付身份表、联合动作、奖励归属、可见性矩阵、对战矩阵与掩码,并把智能体顺序、全局信息、对手版本或padding掩码泄漏设为单一反事实。
16·1·2 收敛的判别
↡收敛的判别对应正式目录坐标“16.1.2 收敛的判别”,在“第16章 非合作关系设定下的多智能体强化学习”中用于把“收敛的判别”放进非平稳对手、集中式critic与交叉评估的环境—轨迹—目标—更新链,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 4/19。 原版目录键 16.1.2 收敛的判别。对“第16章 非合作关系设定下的多智能体强化学习”而言,「16·1·2 收敛的判别」在第4次检查中改变可观察状态,因为它负责把“收敛的判别”放进非平稳对手、集中式critic与交叉评估的环境—轨迹—目标—更新链;第16章 非合作关系设定下的多智能体强化学习的输入角色、中间状态、策略快照、反例与独立评估必须与“对手快照、联合动作、critic信息、随机种子与评价协议不随候选改变”对齐,不能接受只复述“收敛的判别”名称而没有可观察状态、单一故障和恢复证据。
16·1·3 评价策略的优劣
↡评价策略的优劣对应正式目录坐标“16.1.3 评价策略的优劣”,在“第16章 非合作关系设定下的多智能体强化学习”中用于建立环境、轨迹、终止、策略、回报和价值的时间合同,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 5/19。 原版目录键 16.1.3 评价策略的优劣。在“第16章 非合作关系设定下的多智能体强化学习”的第5个正式坐标中,「16·1·3 评价策略的优劣」通过建立环境、轨迹、终止、策略、回报和价值的时间合同推进非平稳对手、集中式critic与交叉评估;复核者保存转移记录、策略概率、终止/截断标记、回报与价值残差,出现混淆状态与观测、终止与截断或行为策略与目标策略就撤回结论。
16·2 非合作关系设定下的多智能体A2C
↡非合作关系设定下的多智能体A2C对应正式目录坐标“16.2 非合作关系设定下的多智能体A2C”,在“第16章 非合作关系设定下的多智能体强化学习”中用于声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 6/19。 原版目录键 16.2 非合作关系设定下的多智能体A2C。围绕“对手策略持续变化时,候选策略相对哪个快照被评价?”,“第16章 非合作关系设定下的多智能体强化学习”在坐标6把「16·2 非合作关系设定下的多智能体A2C」落实为声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构;只有身份表、联合动作、奖励归属、可见性矩阵、对战矩阵与掩码可重放且反例排除智能体顺序、全局信息、对手版本或padding掩码泄漏,本节点才算掌握。
16·2·1 策略网络和价值网络
↡策略网络和价值网络对应正式目录坐标“16.2.1 策略网络和价值网络”,在“第16章 非合作关系设定下的多智能体强化学习”中用于建立环境、轨迹、终止、策略、回报和价值的时间合同,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 7/19。 原版目录键 16.2.1 策略网络和价值网络。“第16章 非合作关系设定下的多智能体强化学习”的目录节点7「16·2·1 策略网络和价值网络」不能停在术语复述:它要建立环境、轨迹、终止、策略、回报和价值的时间合同,交付转移记录、策略概率、终止/截断标记、回报与价值残差,并把混淆状态与观测、终止与截断或行为策略与目标策略设为单一反事实。
16·2·2 算法推导
↡算法推导对应正式目录坐标“16.2.2 算法推导”,在“第16章 非合作关系设定下的多智能体强化学习”中用于把“算法推导”放进非平稳对手、集中式critic与交叉评估的环境—轨迹—目标—更新链,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 8/19。 原版目录键 16.2.2 算法推导。对“第16章 非合作关系设定下的多智能体强化学习”而言,「16·2·2 算法推导」在第8次检查中改变可观察状态,因为它负责把“算法推导”放进非平稳对手、集中式critic与交叉评估的环境—轨迹—目标—更新链;第16章 非合作关系设定下的多智能体强化学习的输入角色、中间状态、策略快照、反例与独立评估必须与“对手快照、联合动作、critic信息、随机种子与评价协议不随候选改变”对齐,不能接受只复述“算法推导”名称而没有可观察状态、单一故障和恢复证据。
16·2·3 训练
↡训练对应正式目录坐标“16.2.3 训练”,在“第16章 非合作关系设定下的多智能体强化学习”中用于把“训练”放进非平稳对手、集中式critic与交叉评估的环境—轨迹—目标—更新链,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 9/19。 原版目录键 16.2.3 训练。在“第16章 非合作关系设定下的多智能体强化学习”的第9个正式坐标中,「16·2·3 训练」通过把“训练”放进非平稳对手、集中式critic与交叉评估的环境—轨迹—目标—更新链推进非平稳对手、集中式critic与交叉评估;复核者保存第16章 非合作关系设定下的多智能体强化学习的输入角色、中间状态、策略快照、反例与独立评估,出现只复述“训练”名称而没有可观察状态、单一故障和恢复证据就撤回结论。
16·2·4 决策
↡决策对应正式目录坐标“16.2.4 决策”,在“第16章 非合作关系设定下的多智能体强化学习”中用于把“决策”放进非平稳对手、集中式critic与交叉评估的环境—轨迹—目标—更新链,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 10/19。 原版目录键 16.2.4 决策。围绕“对手策略持续变化时,候选策略相对哪个快照被评价?”,“第16章 非合作关系设定下的多智能体强化学习”在坐标10把「16·2·4 决策」落实为把“决策”放进非平稳对手、集中式critic与交叉评估的环境—轨迹—目标—更新链;只有第16章 非合作关系设定下的多智能体强化学习的输入角色、中间状态、策略快照、反例与独立评估可重放且反例排除只复述“决策”名称而没有可观察状态、单一故障和恢复证据,本节点才算掌握。
16·3 三种架构
↡三种架构对应正式目录坐标“16.3 三种架构”,在“第16章 非合作关系设定下的多智能体强化学习”中用于把“三种架构”放进非平稳对手、集中式critic与交叉评估的环境—轨迹—目标—更新链,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 11/19。 原版目录键 16.3 三种架构。“第16章 非合作关系设定下的多智能体强化学习”的目录节点11「16·3 三种架构」不能停在术语复述:它要把“三种架构”放进非平稳对手、集中式critic与交叉评估的环境—轨迹—目标—更新链,交付第16章 非合作关系设定下的多智能体强化学习的输入角色、中间状态、策略快照、反例与独立评估,并把只复述“三种架构”名称而没有可观察状态、单一故障和恢复证据设为单一反事实。
16·3·1 中心化训练+中心化决策
↡中心化训练+中心化决策对应正式目录坐标“16.3.1 中心化训练+中心化决策”,在“第16章 非合作关系设定下的多智能体强化学习”中用于声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 12/19。 原版目录键 16.3.1 中心化训练+中心化决策。对“第16章 非合作关系设定下的多智能体强化学习”而言,「16·3·1 中心化训练+中心化决策」在第12次检查中改变可观察状态,因为它负责声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构;身份表、联合动作、奖励归属、可见性矩阵、对战矩阵与掩码必须与“对手快照、联合动作、critic信息、随机种子与评价协议不随候选改变”对齐,不能接受智能体顺序、全局信息、对手版本或padding掩码泄漏。
16·3·2 去中心化训练+去中心化决策
↡去中心化训练+去中心化决策对应正式目录坐标“16.3.2 去中心化训练+去中心化决策”,在“第16章 非合作关系设定下的多智能体强化学习”中用于声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 13/19。 原版目录键 16.3.2 去中心化训练+去中心化决策。在“第16章 非合作关系设定下的多智能体强化学习”的第13个正式坐标中,「16·3·2 去中心化训练+去中心化决策」通过声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构推进非平稳对手、集中式critic与交叉评估;复核者保存身份表、联合动作、奖励归属、可见性矩阵、对战矩阵与掩码,出现智能体顺序、全局信息、对手版本或padding掩码泄漏就撤回结论。
16·3·3 中心化训练+去中心化决策
↡中心化训练+去中心化决策对应正式目录坐标“16.3.3 中心化训练+去中心化决策”,在“第16章 非合作关系设定下的多智能体强化学习”中用于声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 14/19。 原版目录键 16.3.3 中心化训练+去中心化决策。围绕“对手策略持续变化时,候选策略相对哪个快照被评价?”,“第16章 非合作关系设定下的多智能体强化学习”在坐标14把「16·3·3 中心化训练+去中心化决策」落实为声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构;只有身份表、联合动作、奖励归属、可见性矩阵、对战矩阵与掩码可重放且反例排除智能体顺序、全局信息、对手版本或padding掩码泄漏,本节点才算掌握。
16·4 连续控制与MADDPG
↡连续控制与MADDPG对应正式目录坐标“16.4 连续控制与MADDPG”,在“第16章 非合作关系设定下的多智能体强化学习”中用于对齐连续动作范围、critic目标、双Q、噪声与延迟策略更新,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 15/19。 原版目录键 16.4 连续控制与MADDPG。“第16章 非合作关系设定下的多智能体强化学习”的目录节点15「16·4 连续控制与MADDPG」不能停在术语复述:它要对齐连续动作范围、critic目标、双Q、噪声与延迟策略更新,交付动作缩放、噪声、双Q目标、策略梯度和更新频率,并把动作尺度、目标噪声或actor/critic更新时序错位设为单一反事实。
16·4·1 策略网络和价值网络
↡策略网络和价值网络对应正式目录坐标“16.4.1 策略网络和价值网络”,在“第16章 非合作关系设定下的多智能体强化学习”中用于建立环境、轨迹、终止、策略、回报和价值的时间合同,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 16/19。 原版目录键 16.4.1 策略网络和价值网络。对“第16章 非合作关系设定下的多智能体强化学习”而言,「16·4·1 策略网络和价值网络」在第16次检查中改变可观察状态,因为它负责建立环境、轨迹、终止、策略、回报和价值的时间合同;转移记录、策略概率、终止/截断标记、回报与价值残差必须与“对手快照、联合动作、critic信息、随机种子与评价协议不随候选改变”对齐,不能接受混淆状态与观测、终止与截断或行为策略与目标策略。
16·4·2 算法推导
↡算法推导对应正式目录坐标“16.4.2 算法推导”,在“第16章 非合作关系设定下的多智能体强化学习”中用于把“算法推导”放进非平稳对手、集中式critic与交叉评估的环境—轨迹—目标—更新链,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 17/19。 原版目录键 16.4.2 算法推导。在“第16章 非合作关系设定下的多智能体强化学习”的第17个正式坐标中,「16·4·2 算法推导」通过把“算法推导”放进非平稳对手、集中式critic与交叉评估的环境—轨迹—目标—更新链推进非平稳对手、集中式critic与交叉评估;复核者保存第16章 非合作关系设定下的多智能体强化学习的输入角色、中间状态、策略快照、反例与独立评估,出现只复述“算法推导”名称而没有可观察状态、单一故障和恢复证据就撤回结论。
16·4·3 中心化训练
↡中心化训练对应正式目录坐标“16.4.3 中心化训练”,在“第16章 非合作关系设定下的多智能体强化学习”中用于声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 18/19。 原版目录键 16.4.3 中心化训练。围绕“对手策略持续变化时,候选策略相对哪个快照被评价?”,“第16章 非合作关系设定下的多智能体强化学习”在坐标18把「16·4·3 中心化训练」落实为声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构;只有身份表、联合动作、奖励归属、可见性矩阵、对战矩阵与掩码可重放且反例排除智能体顺序、全局信息、对手版本或padding掩码泄漏,本节点才算掌握。
16·4·4 去中心化决策
↡去中心化决策对应正式目录坐标“16.4.4 去中心化决策”,在“第16章 非合作关系设定下的多智能体强化学习”中用于声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构,并受环境、轨迹、策略快照、随机性、评估与版本边界约束。正式坐标 19/19。 原版目录键 16.4.4 去中心化决策。“第16章 非合作关系设定下的多智能体强化学习”的目录节点19「16·4·4 去中心化决策」不能停在术语复述:它要声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构,交付身份表、联合动作、奖励归属、可见性矩阵、对战矩阵与掩码,并把智能体顺序、全局信息、对手版本或padding掩码泄漏设为单一反事实。
先预测,再操作三个章专属实验
1. 环境与轨迹合同
为“第16章 非合作关系设定下的多智能体强化学习”选择正式目录坐标,在参考合同与单一反事实间切换,逐角色核对输入、状态变化、证据与即时裁决。
环境—轨迹合同
第16章 非合作关系设定下的多智能体强化学习
选择正式目录坐标,冻结环境角色,再定位参考轨迹与单一反事实的首个分岔。
合同 1/4
第16章 非合作关系设定下的多智能体强化学习 · 环境与角色
- 输入角色
- 冻结对手池后评估多智能体A2C与MADDPG候选
- 状态变化
- 冻结非平稳对手、集中式critic与交叉评估所需的环境版本、观测/状态、动作、奖励和数据角色
- 应留证据
- 第16章 非合作关系设定下的多智能体强化学习的环境合同、策略快照与基线轨迹
- 即时裁决
- 第16章 非合作关系设定下的多智能体强化学习的角色、时间索引、shape、终止和可见性没有错位
第16章 非合作关系设定下的多智能体强化学习的可重放协议
| 阶段 | 允许动作 | 必留证据 | 拒绝条件 |
|---|---|---|---|
| 第16章 非合作关系设定下的多智能体强化学习 · 环境与角色 | 冻结非平稳对手、集中式critic与交叉评估所需的环境版本、观测/状态、动作、奖励和数据角色 | 第16章 非合作关系设定下的多智能体强化学习的环境合同、策略快照与基线轨迹 | 未满足“第16章 非合作关系设定下的多智能体强化学习的角色、时间索引、shape、终止和可见性没有错位” |
| 第16章 非合作关系设定下的多智能体强化学习 · 回报与目标 | 按在非合作与混合关系中分析策略目标、收敛判别、MADDPG和集中式critic构造回报、目标、估计量或搜索统计 | 第16章 非合作关系设定下的多智能体强化学习的逐步回报、目标分量与中间状态 | 未满足“第16章 非合作关系设定下的多智能体强化学习的目标可由同一轨迹、公式和随机状态复算” |
| 第16章 非合作关系设定下的多智能体强化学习 · 更新与策略 | 执行一次受控更新并记录策略、价值、梯度或联合决策的变化 | 第16章 非合作关系设定下的多智能体强化学习的更新前后差、首个分岔和恢复路径 | 未满足“第16章 非合作关系设定下的多智能体强化学习没有把代理损失、单次回报或训练内统计当作最终结论” |
| 第16章 非合作关系设定下的多智能体强化学习 · 独立评估 | 重放基线、单故障、恢复和边界案例 | 第16章 非合作关系设定下的多智能体强化学习的接受、回退或拒绝理由 | 未满足“第16章 非合作关系设定下的多智能体强化学习满足“对手快照、联合动作、critic信息、随机种子与评价协议不随候选改变”” |
unit: "drl-16"
question: "对手策略持续变化时,候选策略相对哪个快照被评价?"
scenario: "冻结对手池后评估多智能体A2C与MADDPG候选"
invariant: "对手快照、联合动作、critic信息、随机种子与评价协议不随候选改变"
fault: "只对训练末尾的同代对手评估并宣称策略普遍占优"
evidence: "对手池、交叉对战矩阵、critic输入与纳什偏差诊断"
reset: restore_concept_mode_stage_trace_step_case_gates_and_artifact“第16章 非合作关系设定下的多智能体强化学习”要求从同一环境、轨迹、策略/对手版本、预算和随机状态重放参考、故障与恢复路径。重置后若目录选择、合同模式、阶段、轨迹步骤、案例、证据门或交付包没有回到基线,本次比较已经混入状态泄漏。
本页回顾
掌握“第16章 非合作关系设定下的多智能体强化学习”不是背算法名或抄训练循环,而是围绕“对手策略持续变化时,候选策略相对哪个快照被评价?”重建环境、轨迹、回报、目标、更新、策略/对手快照与独立评估,并用“对手快照、联合动作、critic信息、随机种子与评价协议不随候选改变”拒绝“只对训练末尾的同代对手评估并宣称策略普遍占优”。最终交付为对手池、交叉对战矩阵、critic输入与纳什偏差诊断。
练习与答案
练习
- 问题 1:实验合同。 “第16章 非合作关系设定下的多智能体强化学习”为什么必须先冻结环境、轨迹、策略/对手版本、预算、随机性和评估口径?
- 问题 2:目录逐项覆盖。 怎样证明“第16章 非合作关系设定下的多智能体强化学习”的正式目录坐标已经进入机制、交互和练习?
- 问题 3:故障恢复。 怎样证明“只对训练末尾的同代对手评估并宣称策略普遍占优”已经被修正?
名词解释
名词解释
本章出现的专业名词,用大白话再讲一遍。
- 非合作关系设定下的多智能体强化学习
检索键 drl-A 对应正式目录坐标「第16章 非合作关系设定下的多智能体强化学习」;在“第16章 非合作关系设定下的多智能体强化学习”中用于声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 非合作关系设定下的策略学习
检索键 drl-B 对应正式目录坐标「16·1 非合作关系设定下的策略学习」;在“第16章 非合作关系设定下的多智能体强化学习”中用于建立环境、轨迹、终止、策略、回报和价值的时间合同,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 非合作关系设定下的目标函数
检索键 drl-C 对应正式目录坐标「16·1·1 非合作关系设定下的目标函数」;在“第16章 非合作关系设定下的多智能体强化学习”中用于声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 收敛的判别
检索键 drl-D 对应正式目录坐标「16·1·2 收敛的判别」;在“第16章 非合作关系设定下的多智能体强化学习”中用于把“收敛的判别”放进非平稳对手、集中式critic与交叉评估的环境—轨迹—目标—更新链,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 评价策略的优劣
检索键 drl-E 对应正式目录坐标「16·1·3 评价策略的优劣」;在“第16章 非合作关系设定下的多智能体强化学习”中用于建立环境、轨迹、终止、策略、回报和价值的时间合同,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 非合作关系设定下的多智能体A2C
检索键 drl-F 对应正式目录坐标「16·2 非合作关系设定下的多智能体A2C」;在“第16章 非合作关系设定下的多智能体强化学习”中用于声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 策略网络和价值网络
检索键 drl-G 对应正式目录坐标「16·2·1 策略网络和价值网络」;在“第16章 非合作关系设定下的多智能体强化学习”中用于建立环境、轨迹、终止、策略、回报和价值的时间合同,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 算法推导
检索键 drl-H 对应正式目录坐标「16·2·2 算法推导」;在“第16章 非合作关系设定下的多智能体强化学习”中用于把“算法推导”放进非平稳对手、集中式critic与交叉评估的环境—轨迹—目标—更新链,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 训练
检索键 drl-I 对应正式目录坐标「16·2·3 训练」;在“第16章 非合作关系设定下的多智能体强化学习”中用于把“训练”放进非平稳对手、集中式critic与交叉评估的环境—轨迹—目标—更新链,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 决策
检索键 drl-J 对应正式目录坐标「16·2·4 决策」;在“第16章 非合作关系设定下的多智能体强化学习”中用于把“决策”放进非平稳对手、集中式critic与交叉评估的环境—轨迹—目标—更新链,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 三种架构
检索键 drl-K 对应正式目录坐标「16·3 三种架构」;在“第16章 非合作关系设定下的多智能体强化学习”中用于把“三种架构”放进非平稳对手、集中式critic与交叉评估的环境—轨迹—目标—更新链,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 中心化训练+中心化决策
检索键 drl-L 对应正式目录坐标「16·3·1 中心化训练+中心化决策」;在“第16章 非合作关系设定下的多智能体强化学习”中用于声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 去中心化训练+去中心化决策
检索键 drl-M 对应正式目录坐标「16·3·2 去中心化训练+去中心化决策」;在“第16章 非合作关系设定下的多智能体强化学习”中用于声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 中心化训练+去中心化决策
检索键 drl-N 对应正式目录坐标「16·3·3 中心化训练+去中心化决策」;在“第16章 非合作关系设定下的多智能体强化学习”中用于声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 连续控制与MADDPG
检索键 drl-O 对应正式目录坐标「16·4 连续控制与MADDPG」;在“第16章 非合作关系设定下的多智能体强化学习”中用于对齐连续动作范围、critic目标、双Q、噪声与延迟策略更新,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 策略网络和价值网络
检索键 drl-P 对应正式目录坐标「16·4·1 策略网络和价值网络」;在“第16章 非合作关系设定下的多智能体强化学习”中用于建立环境、轨迹、终止、策略、回报和价值的时间合同,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 算法推导
检索键 drl-Q 对应正式目录坐标「16·4·2 算法推导」;在“第16章 非合作关系设定下的多智能体强化学习”中用于把“算法推导”放进非平稳对手、集中式critic与交叉评估的环境—轨迹—目标—更新链,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 中心化训练
检索键 drl-R 对应正式目录坐标「16·4·3 中心化训练」;在“第16章 非合作关系设定下的多智能体强化学习”中用于声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。
- 去中心化决策
检索键 drl-S 对应正式目录坐标「16·4·4 去中心化决策」;在“第16章 非合作关系设定下的多智能体强化学习”中用于声明智能体身份、联合轨迹、信息可见性、对手快照与训练/执行架构,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。