第12章 模仿学习

比较行为克隆、逆向强化学习与GAIL的数据假设、分布偏移和训练信号;用环境合同、更新轨迹和独立评估门交付轨迹级切分、占用分布、判别信号与闭环评估

学习目标

  • 能说明“第12章 模仿学习”如何比较行为克隆、逆向强化学习与GAIL的数据假设、分布偏移和训练信号,并区分原版目录、作者代码映射、独立技术来源和本站重写
  • 能先预测“专家示范覆盖了什么状态分布,策略偏离后由谁提供纠错信号?”会改变哪一个环境、轨迹、回报、目标、策略或评估状态,再操作三类交互证据
  • 能只注入“把同一轨迹的相邻帧随机分到训练集与测试集”,定位首个偏离“专家/学习者轨迹、实体切分、奖励代理和环境评估保持独立”的状态,并从同一快照完成恢复

为什么从这个问题开始

“第12章 模仿学习”围绕“专家示范覆盖了什么状态分布,策略偏离后由谁提供纠错信号?”建立贯穿任务:用按轨迹划分的专家示范训练并评估模仿策略。先写下哪个环境、轨迹、回报、目标、策略或评估状态会最先变化,再运行参考、故障和恢复路径;运行后补理由不算预测。只有守住“专家/学习者轨迹、实体切分、奖励代理和环境评估保持独立”并交付轨迹级切分、占用分布、判别信号与闭环评估,训练回报、策略价值、搜索统计或应用收益才构成机制证据。

原版书目、272个正式坐标与访问边界

“第12章 模仿学习”以作者官方代码仓库核对王树森、黎彧君、张志华著《深度强化学习》的第1至19章及主要算法—实现映射,以馆藏书目核对人民邮电出版社、2022年11月、294页和ISBN 9787115600691,再以发行数字版完整目录核对5个部分、19章、233个编号节/小节、附录A、附录B与B.1至B.13,合计272个正式目录层级。

作者仓库验证章节和算法实现确实对应,但仓库页面未提供可据以复用代码、图表或书稿的明确许可;发行数字版用于核对目录范围,不作为复制正文的授权。“第12章 模仿学习”不翻译、摘编或改写原书正文,也不复制仓库代码;中文讲解、状态轨迹、反例、交互、练习与答案均为独立教学重写。

本页独立核对 1只用于独立核对本页算法、环境接口或实验边界,不能反向证明原书使用本站表述。Gymnasium、PyTorch、PettingZoo等当前API行为按2026-07-30核对并显式视为当前实现,不倒填为2022年原书内容。

原版目录层级与可验证机制

第12章 模仿学习

正式坐标 1/14。 原版目录键 第12章 模仿学习。在“第12章 模仿学习”的第1个正式坐标中,「第12章 模仿学习」通过区分状态/观测/记忆或专家/学习者分布并验证闭环偏移推进示范分布、奖励反推与闭环偏移;复核者保存隐藏状态、序列掩码、轨迹级切分、占用分布和闭环回报,出现隐藏状态错误重置或相邻帧泄漏到训练与测试两侧就撤回结论。

12·1 行为克隆

正式坐标 2/14。 原版目录键 12.1 行为克隆。围绕“专家示范覆盖了什么状态分布,策略偏离后由谁提供纠错信号?”,“第12章 模仿学习”在坐标2把「12·1 行为克隆」落实为区分状态/观测/记忆或专家/学习者分布并验证闭环偏移;只有隐藏状态、序列掩码、轨迹级切分、占用分布和闭环回报可重放且反例排除隐藏状态错误重置或相邻帧泄漏到训练与测试两侧,本节点才算掌握。

12·1·1 连续控制问题

正式坐标 3/14。 原版目录键 12.1.1 连续控制问题。“第12章 模仿学习”的目录节点3「12·1·1 连续控制问题」不能停在术语复述:它要对齐连续动作范围、critic目标、双Q、噪声与延迟策略更新,交付动作缩放、噪声、双Q目标、策略梯度和更新频率,并把动作尺度、目标噪声或actor/critic更新时序错位设为单一反事实。

12·1·2 离散控制问题

正式坐标 4/14。 原版目录键 12.1.2 离散控制问题。对“第12章 模仿学习”而言,「12·1·2 离散控制问题」在第4次检查中改变可观察状态,因为它负责把“离散控制问题”放进示范分布、奖励反推与闭环偏移的环境—轨迹—目标—更新链;第12章 模仿学习的输入角色、中间状态、策略快照、反例与独立评估必须与“专家/学习者轨迹、实体切分、奖励代理和环境评估保持独立”对齐,不能接受只复述“离散控制问题”名称而没有可观察状态、单一故障和恢复证据。

12·1·3 行为克隆与强化学习的对比

正式坐标 5/14。 原版目录键 12.1.3 行为克隆与强化学习的对比。在“第12章 模仿学习”的第5个正式坐标中,「12·1·3 行为克隆与强化学习的对比」通过区分状态/观测/记忆或专家/学习者分布并验证闭环偏移推进示范分布、奖励反推与闭环偏移;复核者保存隐藏状态、序列掩码、轨迹级切分、占用分布和闭环回报,出现隐藏状态错误重置或相邻帧泄漏到训练与测试两侧就撤回结论。

12·2 逆向强化学习

正式坐标 6/14。 原版目录键 12.2 逆向强化学习。围绕“专家示范覆盖了什么状态分布,策略偏离后由谁提供纠错信号?”,“第12章 模仿学习”在坐标6把「12·2 逆向强化学习」落实为区分状态/观测/记忆或专家/学习者分布并验证闭环偏移;只有隐藏状态、序列掩码、轨迹级切分、占用分布和闭环回报可重放且反例排除隐藏状态错误重置或相邻帧泄漏到训练与测试两侧,本节点才算掌握。

12·2·1 IRL的基本设定

正式坐标 7/14。 原版目录键 12.2.1 IRL的基本设定。“第12章 模仿学习”的目录节点7「12·2·1 IRL的基本设定」不能停在术语复述:它要区分状态/观测/记忆或专家/学习者分布并验证闭环偏移,交付隐藏状态、序列掩码、轨迹级切分、占用分布和闭环回报,并把隐藏状态错误重置或相邻帧泄漏到训练与测试两侧设为单一反事实。

12·2·2 IRL的基本思想

正式坐标 8/14。 原版目录键 12.2.2 IRL的基本思想。对“第12章 模仿学习”而言,「12·2·2 IRL的基本思想」在第8次检查中改变可观察状态,因为它负责区分状态/观测/记忆或专家/学习者分布并验证闭环偏移;隐藏状态、序列掩码、轨迹级切分、占用分布和闭环回报必须与“专家/学习者轨迹、实体切分、奖励代理和环境评估保持独立”对齐,不能接受隐藏状态错误重置或相邻帧泄漏到训练与测试两侧。

12·2·3 从黑箱策略反推奖励

正式坐标 9/14。 原版目录键 12.2.3 从黑箱策略反推奖励。在“第12章 模仿学习”的第9个正式坐标中,「12·2·3 从黑箱策略反推奖励」通过建立环境、轨迹、终止、策略、回报和价值的时间合同推进示范分布、奖励反推与闭环偏移;复核者保存转移记录、策略概率、终止/截断标记、回报与价值残差,出现混淆状态与观测、终止与截断或行为策略与目标策略就撤回结论。

12·2·4 用奖励函数训练策略网络

正式坐标 10/14。 原版目录键 12.2.4 用奖励函数训练策略网络。围绕“专家示范覆盖了什么状态分布,策略偏离后由谁提供纠错信号?”,“第12章 模仿学习”在坐标10把「12·2·4 用奖励函数训练策略网络」落实为建立环境、轨迹、终止、策略、回报和价值的时间合同;只有转移记录、策略概率、终止/截断标记、回报与价值残差可重放且反例排除混淆状态与观测、终止与截断或行为策略与目标策略,本节点才算掌握。

12·3 生成判别模仿学习

正式坐标 11/14。 原版目录键 12.3 生成判别模仿学习。“第12章 模仿学习”的目录节点11「12·3 生成判别模仿学习」不能停在术语复述:它要区分状态/观测/记忆或专家/学习者分布并验证闭环偏移,交付隐藏状态、序列掩码、轨迹级切分、占用分布和闭环回报,并把隐藏状态错误重置或相邻帧泄漏到训练与测试两侧设为单一反事实。

12·3·1 生成判别网络

正式坐标 12/14。 原版目录键 12.3.1 生成判别网络。对“第12章 模仿学习”而言,「12·3·1 生成判别网络」在第12次检查中改变可观察状态,因为它负责把“生成判别网络”放进示范分布、奖励反推与闭环偏移的环境—轨迹—目标—更新链;第12章 模仿学习的输入角色、中间状态、策略快照、反例与独立评估必须与“专家/学习者轨迹、实体切分、奖励代理和环境评估保持独立”对齐,不能接受只复述“生成判别网络”名称而没有可观察状态、单一故障和恢复证据。

12·3·2 GAIL的生成器和判别器

正式坐标 13/14。 原版目录键 12.3.2 GAIL的生成器和判别器。在“第12章 模仿学习”的第13个正式坐标中,「12·3·2 GAIL的生成器和判别器」通过区分状态/观测/记忆或专家/学习者分布并验证闭环偏移推进示范分布、奖励反推与闭环偏移;复核者保存隐藏状态、序列掩码、轨迹级切分、占用分布和闭环回报,出现隐藏状态错误重置或相邻帧泄漏到训练与测试两侧就撤回结论。

12·3·3 GAIL的训练

正式坐标 14/14。 原版目录键 12.3.3 GAIL的训练。围绕“专家示范覆盖了什么状态分布,策略偏离后由谁提供纠错信号?”,“第12章 模仿学习”在坐标14把「12·3·3 GAIL的训练」落实为区分状态/观测/记忆或专家/学习者分布并验证闭环偏移;只有隐藏状态、序列掩码、轨迹级切分、占用分布和闭环回报可重放且反例排除隐藏状态错误重置或相邻帧泄漏到训练与测试两侧,本节点才算掌握。

先预测,再操作三个章专属实验

分步1 / 3

1. 环境与轨迹合同

为“第12章 模仿学习”选择正式目录坐标,在参考合同与单一反事实间切换,逐角色核对输入、状态变化、证据与即时裁决。

环境—轨迹合同

第12章 模仿学习

选择正式目录坐标,冻结环境角色,再定位参考轨迹与单一反事实的首个分岔。

合同 1/4

第12章 模仿学习 · 环境与角色

输入角色
用按轨迹划分的专家示范训练并评估模仿策略
状态变化
冻结示范分布、奖励反推与闭环偏移所需的环境版本、观测/状态、动作、奖励和数据角色
应留证据
第12章 模仿学习的环境合同、策略快照与基线轨迹
即时裁决
第12章 模仿学习的角色、时间索引、shape、终止和可见性没有错位

第12章 模仿学习的可重放协议

阶段允许动作必留证据拒绝条件
第12章 模仿学习 · 环境与角色冻结示范分布、奖励反推与闭环偏移所需的环境版本、观测/状态、动作、奖励和数据角色第12章 模仿学习的环境合同、策略快照与基线轨迹未满足“第12章 模仿学习的角色、时间索引、shape、终止和可见性没有错位”
第12章 模仿学习 · 回报与目标按比较行为克隆、逆向强化学习与GAIL的数据假设、分布偏移和训练信号构造回报、目标、估计量或搜索统计第12章 模仿学习的逐步回报、目标分量与中间状态未满足“第12章 模仿学习的目标可由同一轨迹、公式和随机状态复算”
第12章 模仿学习 · 更新与策略执行一次受控更新并记录策略、价值、梯度或联合决策的变化第12章 模仿学习的更新前后差、首个分岔和恢复路径未满足“第12章 模仿学习没有把代理损失、单次回报或训练内统计当作最终结论”
第12章 模仿学习 · 独立评估重放基线、单故障、恢复和边界案例第12章 模仿学习的接受、回退或拒绝理由未满足“第12章 模仿学习满足“专家/学习者轨迹、实体切分、奖励代理和环境评估保持独立””
unit: "drl-12"
question: "专家示范覆盖了什么状态分布,策略偏离后由谁提供纠错信号?"
scenario: "用按轨迹划分的专家示范训练并评估模仿策略"
invariant: "专家/学习者轨迹、实体切分、奖励代理和环境评估保持独立"
fault: "把同一轨迹的相邻帧随机分到训练集与测试集"
evidence: "轨迹级切分、占用分布、判别信号与闭环评估"
reset: restore_concept_mode_stage_trace_step_case_gates_and_artifact

“第12章 模仿学习”要求从同一环境、轨迹、策略/对手版本、预算和随机状态重放参考、故障与恢复路径。重置后若目录选择、合同模式、阶段、轨迹步骤、案例、证据门或交付包没有回到基线,本次比较已经混入状态泄漏。

本页回顾

掌握“第12章 模仿学习”不是背算法名或抄训练循环,而是围绕“专家示范覆盖了什么状态分布,策略偏离后由谁提供纠错信号?”重建环境、轨迹、回报、目标、更新、策略/对手快照与独立评估,并用“专家/学习者轨迹、实体切分、奖励代理和环境评估保持独立”拒绝“把同一轨迹的相邻帧随机分到训练集与测试集”。最终交付为轨迹级切分、占用分布、判别信号与闭环评估。

练习与答案

练习

  1. 问题 1:实验合同。 “第12章 模仿学习”为什么必须先冻结环境、轨迹、策略/对手版本、预算、随机性和评估口径?
  1. 问题 2:目录逐项覆盖。 怎样证明“第12章 模仿学习”的正式目录坐标已经进入机制、交互和练习?
  1. 问题 3:故障恢复。 怎样证明“把同一轨迹的相邻帧随机分到训练集与测试集”已经被修正?

名词解释

名词解释

本章出现的专业名词,用大白话再讲一遍。

模仿学习

检索键 drl-A 对应正式目录坐标「第12章 模仿学习」;在“第12章 模仿学习”中用于区分状态/观测/记忆或专家/学习者分布并验证闭环偏移,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。

行为克隆

检索键 drl-B 对应正式目录坐标「12·1 行为克隆」;在“第12章 模仿学习”中用于区分状态/观测/记忆或专家/学习者分布并验证闭环偏移,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。

连续控制问题

检索键 drl-C 对应正式目录坐标「12·1·1 连续控制问题」;在“第12章 模仿学习”中用于对齐连续动作范围、critic目标、双Q、噪声与延迟策略更新,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。

离散控制问题

检索键 drl-D 对应正式目录坐标「12·1·2 离散控制问题」;在“第12章 模仿学习”中用于把“离散控制问题”放进示范分布、奖励反推与闭环偏移的环境—轨迹—目标—更新链,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。

行为克隆与强化学习的对比

检索键 drl-E 对应正式目录坐标「12·1·3 行为克隆与强化学习的对比」;在“第12章 模仿学习”中用于区分状态/观测/记忆或专家/学习者分布并验证闭环偏移,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。

逆向强化学习

检索键 drl-F 对应正式目录坐标「12·2 逆向强化学习」;在“第12章 模仿学习”中用于区分状态/观测/记忆或专家/学习者分布并验证闭环偏移,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。

IRL的基本设定

检索键 drl-G 对应正式目录坐标「12·2·1 IRL的基本设定」;在“第12章 模仿学习”中用于区分状态/观测/记忆或专家/学习者分布并验证闭环偏移,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。

IRL的基本思想

检索键 drl-H 对应正式目录坐标「12·2·2 IRL的基本思想」;在“第12章 模仿学习”中用于区分状态/观测/记忆或专家/学习者分布并验证闭环偏移,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。

从黑箱策略反推奖励

检索键 drl-I 对应正式目录坐标「12·2·3 从黑箱策略反推奖励」;在“第12章 模仿学习”中用于建立环境、轨迹、终止、策略、回报和价值的时间合同,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。

用奖励函数训练策略网络

检索键 drl-J 对应正式目录坐标「12·2·4 用奖励函数训练策略网络」;在“第12章 模仿学习”中用于建立环境、轨迹、终止、策略、回报和价值的时间合同,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。

生成判别模仿学习

检索键 drl-K 对应正式目录坐标「12·3 生成判别模仿学习」;在“第12章 模仿学习”中用于区分状态/观测/记忆或专家/学习者分布并验证闭环偏移,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。

生成判别网络

检索键 drl-L 对应正式目录坐标「12·3·1 生成判别网络」;在“第12章 模仿学习”中用于把“生成判别网络”放进示范分布、奖励反推与闭环偏移的环境—轨迹—目标—更新链,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。

GAIL的生成器和判别器

检索键 drl-M 对应正式目录坐标「12·3·2 GAIL的生成器和判别器」;在“第12章 模仿学习”中用于区分状态/观测/记忆或专家/学习者分布并验证闭环偏移,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。

GAIL的训练

检索键 drl-N 对应正式目录坐标「12·3·3 GAIL的训练」;在“第12章 模仿学习”中用于区分状态/观测/记忆或专家/学习者分布并验证闭环偏移,需要连接结构范围、轨迹状态、更新证据、独立评估与不适用边界。

资料与写作方式声明

本章以王树森、黎彧君、张志华著《深度强化学习》权威目录界定学习范围,并结合正文列出的技术资料独立重写;不宣称复现原书正文,也不沿用原作表述。

原作版权归作者与出版社所有;本站原创教学结构与表述仅供学习交流。

讨论

评论区加载中…