第5章 蒙特卡罗法
用完整回合样本估计价值,并复核同策略控制、离策略评价与重要性采样;用转移账本、单故障收益更新轨迹和冻结评估门完成复核。
学习目标
- 能说明“第5章 蒙特卡罗法”如何用完整回合样本估计价值,并复核同策略控制、离策略评价与重要性采样,并区分2022年原版、2024年中文授权版与当前扩展
- 能先预测“怎样从一条完整轨迹反向计算收益,同时证明采样策略、目标策略和权重没有被混淆?”会改变哪一条转移、收益/目标、价值、梯度或策略概率,再逐步复核
- 能注入“用目标策略生成的概率当作行为策略概率计算重要性权重;在第5章 蒙特卡罗法验收中只注入这一处”,用“回合边界、奖励下标、首次或每次访问口径、策略概率与重要性权重一致;第5章 蒙特卡罗法的结论不得越过原版目录、实验数据和评估边界”决定接受、回退或拒绝强化学习结论
为什么从这个强化学习问题开始
本章不读取转移分布,而是从完整回合的实际奖励构造价值证据,因此轨迹身份和概率尤其重要。 “第5章 蒙特卡罗法”的贯穿任务是:为“第5章 蒙特卡罗法”冻结环境、状态/动作语义、奖励、终止规则、策略版本、训练预算和随机种子,再对照参考路径与单故障路径。 动手前先写下哪个状态、动作、奖励、收益/目标、价值、梯度、策略概率或评估哈希会先变化;运行后补理由不算预测。
围绕“怎样从一条完整轨迹反向计算收益,同时证明采样策略、目标策略和权重没有被混淆?”,“第5章 蒙特卡罗法”建立参考、故障与恢复路径。只有“第5章 蒙特卡罗法”守住“回合边界、奖励下标、首次或每次访问口径、策略概率与重要性权重一致;第5章 蒙特卡罗法的结论不得越过原版目录、实验数据和评估边界”并交付第5章 蒙特卡罗法的环境快照、转移五元组、收益/目标手算、更新前后状态、随机性记录、失败复现与冻结评估报告,奖励曲线或成功轨迹才构成机制证据。
书目、205个原版层级与版本边界
“第5章 蒙特卡罗法”以O’Reilly Japan原版官方书页核对斋藤康毅著《ゼロから作るDeep Learning ❹ ―強化学習編》于2022年4月6日出版、376页、ISBN 9784873119755。“第5章 蒙特卡罗法”采用出版社同页给出的10章与附录A至D作为完整目录边界;本站逐项统计10个章标题、57个一级节、128个二级节、4个附录标题和6个附录节,共205个正式目录层级。“第5章 蒙特卡罗法”再以出版社官方代码仓库核对实现目录,以官方勘误识别已知错误。
“第5章 蒙特卡罗法”没有使用未获授权的原书完整正文,只以出版社完整目录、官方代码和勘误限定范围;中文解释、数值、交互、练习与答案均为独立教学重写。“第5章 蒙特卡罗法”的中文授权书目页仅用于核对《深度学习入门4:强化学习》、人民邮电出版社2024年8月、333页和ISBN 9787115649171,不用来证明日文原版正文。“第5章 蒙特卡罗法”以2022年日文原版与2024年中文授权版目录为内容边界;当前环境API、后续论文与兼容修正只作带时间标签的独立核验。
“第5章 蒙特卡罗法”另以技术核对 1、技术核对 2、技术核对 3核对算法定义、实现语义或实验边界;这些资料能验证本页技术事实,不能反向证明原书采用了本站表述。
原版目录层级与实现机制
第5章 蒙特卡罗方法
↡蒙特卡罗方法对应原版目录坐标“第5章 蒙特卡罗方法”,在“第5章 蒙特卡罗法”中用于声明本章在环境—转移—目标—更新—评估链中的职责与边界,并受环境、状态/动作、奖励、策略、随机性、训练预算、评估协议与版本边界约束。原版坐标 1/24。 在“第5章 蒙特卡罗法”的坐标1中,目录项「第5章 蒙特卡罗方法」用于声明本章在环境—转移—目标—更新—评估链中的职责与边界;先冻结环境、策略与随机性,再以原版坐标、输入对象、核心状态、下游接口、反例和时间边界复核,出现只罗列算法名或用当前热点重排原版时撤回结论。
5.1 蒙特卡罗方法的基础知识
↡蒙特卡罗方法的基础知识对应原版目录坐标“5·1 蒙特卡罗方法的基础知识”,在“第5章 蒙特卡罗法”中用于从完整样本回合计算收益,并在目标策略与行为策略间校正分布,并受环境、状态/动作、奖励、策略、随机性、训练预算、评估协议与版本边界约束。原版坐标 2/24。 目录项「5·1 蒙特卡罗方法的基础知识」进入“第5章 蒙特卡罗法”后要回答第2个机制问题:它怎样从完整样本回合计算收益,并在目标策略与行为策略间校正分布、改变哪个真实状态、由哪些轨迹、访问口径、反向收益、动作概率、重要性权重、估计累计量与方差证明,并如何排除概率身份颠倒、支持集缺失或把高方差样本当作确定结论。
5.1.1 骰子的点数和
↡骰子的点数和对应原版目录坐标“5·1·1 骰子的点数和”,在“第5章 蒙特卡罗法”中用于从完整样本回合计算收益,并在目标策略与行为策略间校正分布,并受环境、状态/动作、奖励、策略、随机性、训练预算、评估协议与版本边界约束。原版坐标 3/24。 围绕“怎样从一条完整轨迹反向计算收益,同时证明采样策略、目标策略和权重没有被混淆?”,“第5章 蒙特卡罗法”在原版层级3把「5·1·1 骰子的点数和」落实为从完整样本回合计算收益,并在目标策略与行为策略间校正分布;复核者先读取轨迹、访问口径、反向收益、动作概率、重要性权重、估计累计量与方差,不能接受概率身份颠倒、支持集缺失或把高方差样本当作确定结论。
5.1.2 分布模型和样本模型
↡分布模型和样本模型对应原版目录坐标“5·1·2 分布模型和样本模型”,在“第5章 蒙特卡罗法”中用于从完整样本回合计算收益,并在目标策略与行为策略间校正分布,并受环境、状态/动作、奖励、策略、随机性、训练预算、评估协议与版本边界约束。原版坐标 4/24。 对“第5章 蒙特卡罗法”而言,目录项「5·1·2 分布模型和样本模型」的最小强化学习合同是从完整样本回合计算收益,并在目标策略与行为策略间校正分布,第4次检查保存轨迹、访问口径、反向收益、动作概率、重要性权重、估计累计量与方差;若产生概率身份颠倒、支持集缺失或把高方差样本当作确定结论,就返回同一环境与参数快照。
5.1.3 蒙特卡罗方法的实现
↡蒙特卡罗方法的实现对应原版目录坐标“5·1·3 蒙特卡罗方法的实现”,在“第5章 蒙特卡罗法”中用于从完整样本回合计算收益,并在目标策略与行为策略间校正分布,并受环境、状态/动作、奖励、策略、随机性、训练预算、评估协议与版本边界约束。原版坐标 5/24。 第5个正式坐标「5·1·3 蒙特卡罗方法的实现」服务于用完整回合样本估计价值,并复核同策略控制、离策略评价与重要性采样,需要以轨迹、访问口径、反向收益、动作概率、重要性权重、估计累计量与方差呈现从完整样本回合计算收益,并在目标策略与行为策略间校正分布;概率身份颠倒、支持集缺失或把高方差样本当作确定结论会破坏“回合边界、奖励下标、首次或每次访问口径、策略概率与重要性权重一致;第5章 蒙特卡罗法的结论不得越过原版目录、实验数据和评估边界”。
5.2 使用蒙特卡罗方法评估策略
↡使用蒙特卡罗方法评估策略对应原版目录坐标“5·2 使用蒙特卡罗方法评估策略”,在“第5章 蒙特卡罗法”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,并受环境、状态/动作、奖励、策略、随机性、训练预算、评估协议与版本边界约束。原版坐标 6/24。 在“第5章 蒙特卡罗法”的坐标6中,目录项「5·2 使用蒙特卡罗方法评估策略」用于把智能体和环境的交互定义为带概率与终止语义的决策过程;先冻结环境、策略与随机性,再以状态、合法动作、转移分布、奖励、策略概率、折扣、终止和轨迹复核,出现状态遗漏历史信息或把即时奖励误作长期收益时撤回结论。
5.2.1 使用蒙特卡罗方法计算价值函数
↡使用蒙特卡罗方法计算价值函数对应原版目录坐标“5·2·1 使用蒙特卡罗方法计算价值函数”,在“第5章 蒙特卡罗法”中用于从完整样本回合计算收益,并在目标策略与行为策略间校正分布,并受环境、状态/动作、奖励、策略、随机性、训练预算、评估协议与版本边界约束。原版坐标 7/24。 目录项「5·2·1 使用蒙特卡罗方法计算价值函数」进入“第5章 蒙特卡罗法”后要回答第7个机制问题:它怎样从完整样本回合计算收益,并在目标策略与行为策略间校正分布、改变哪个真实状态、由哪些轨迹、访问口径、反向收益、动作概率、重要性权重、估计累计量与方差证明,并如何排除概率身份颠倒、支持集缺失或把高方差样本当作确定结论。
5.2.2 求所有状态的价值函数
↡求所有状态的价值函数对应原版目录坐标“5·2·2 求所有状态的价值函数”,在“第5章 蒙特卡罗法”中用于把目录坐标转成有环境、转移、目标、更新和评估证据的实验合同,并受环境、状态/动作、奖励、策略、随机性、训练预算、评估协议与版本边界约束。原版坐标 8/24。 围绕“怎样从一条完整轨迹反向计算收益,同时证明采样策略、目标策略和权重没有被混淆?”,“第5章 蒙特卡罗法”在原版层级8把「5·2·2 求所有状态的价值函数」落实为把目录坐标转成有环境、转移、目标、更新和评估证据的实验合同;复核者先读取原版范围、输入输出、状态、动作、奖励、目标、参数、随机性与反例,不能接受只复述术语或只展示最终平均奖励。
5.2.3 蒙特卡罗方法的高效实现
↡蒙特卡罗方法的高效实现对应原版目录坐标“5·2·3 蒙特卡罗方法的高效实现”,在“第5章 蒙特卡罗法”中用于从完整样本回合计算收益,并在目标策略与行为策略间校正分布,并受环境、状态/动作、奖励、策略、随机性、训练预算、评估协议与版本边界约束。原版坐标 9/24。 对“第5章 蒙特卡罗法”而言,目录项「5·2·3 蒙特卡罗方法的高效实现」的最小强化学习合同是从完整样本回合计算收益,并在目标策略与行为策略间校正分布,第9次检查保存轨迹、访问口径、反向收益、动作概率、重要性权重、估计累计量与方差;若产生概率身份颠倒、支持集缺失或把高方差样本当作确定结论,就返回同一环境与参数快照。
5.3 蒙特卡罗方法的实现
↡蒙特卡罗方法的实现对应原版目录坐标“5·3 蒙特卡罗方法的实现”,在“第5章 蒙特卡罗法”中用于从完整样本回合计算收益,并在目标策略与行为策略间校正分布,并受环境、状态/动作、奖励、策略、随机性、训练预算、评估协议与版本边界约束。原版坐标 10/24。 第10个正式坐标「5·3 蒙特卡罗方法的实现」服务于用完整回合样本估计价值,并复核同策略控制、离策略评价与重要性采样,需要以轨迹、访问口径、反向收益、动作概率、重要性权重、估计累计量与方差呈现从完整样本回合计算收益,并在目标策略与行为策略间校正分布;概率身份颠倒、支持集缺失或把高方差样本当作确定结论会破坏“回合边界、奖励下标、首次或每次访问口径、策略概率与重要性权重一致;第5章 蒙特卡罗法的结论不得越过原版目录、实验数据和评估边界”。
5.3.1 step方法
↡step方法对应原版目录坐标“5·3·1 step方法”,在“第5章 蒙特卡罗法”中用于从完整样本回合计算收益,并在目标策略与行为策略间校正分布,并受环境、状态/动作、奖励、策略、随机性、训练预算、评估协议与版本边界约束。原版坐标 11/24。 在“第5章 蒙特卡罗法”的坐标11中,目录项「5·3·1 step方法」用于从完整样本回合计算收益,并在目标策略与行为策略间校正分布;先冻结环境、策略与随机性,再以轨迹、访问口径、反向收益、动作概率、重要性权重、估计累计量与方差复核,出现概率身份颠倒、支持集缺失或把高方差样本当作确定结论时撤回结论。
5.3.2 智能体类的实现
↡智能体类的实现对应原版目录坐标“5·3·2 智能体类的实现”,在“第5章 蒙特卡罗法”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,并受环境、状态/动作、奖励、策略、随机性、训练预算、评估协议与版本边界约束。原版坐标 12/24。 目录项「5·3·2 智能体类的实现」进入“第5章 蒙特卡罗法”后要回答第12个机制问题:它怎样把智能体和环境的交互定义为带概率与终止语义的决策过程、改变哪个真实状态、由哪些状态、合法动作、转移分布、奖励、策略概率、折扣、终止和轨迹证明,并如何排除状态遗漏历史信息或把即时奖励误作长期收益。
5.3.3 运行蒙特卡罗方法
↡运行蒙特卡罗方法对应原版目录坐标“5·3·3 运行蒙特卡罗方法”,在“第5章 蒙特卡罗法”中用于从完整样本回合计算收益,并在目标策略与行为策略间校正分布,并受环境、状态/动作、奖励、策略、随机性、训练预算、评估协议与版本边界约束。原版坐标 13/24。 围绕“怎样从一条完整轨迹反向计算收益,同时证明采样策略、目标策略和权重没有被混淆?”,“第5章 蒙特卡罗法”在原版层级13把「5·3·3 运行蒙特卡罗方法」落实为从完整样本回合计算收益,并在目标策略与行为策略间校正分布;复核者先读取轨迹、访问口径、反向收益、动作概率、重要性权重、估计累计量与方差,不能接受概率身份颠倒、支持集缺失或把高方差样本当作确定结论。
5.4 使用蒙特卡罗方法的策略控制
↡使用蒙特卡罗方法的策略控制对应原版目录坐标“5·4 使用蒙特卡罗方法的策略控制”,在“第5章 蒙特卡罗法”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,并受环境、状态/动作、奖励、策略、随机性、训练预算、评估协议与版本边界约束。原版坐标 14/24。 对“第5章 蒙特卡罗法”而言,目录项「5·4 使用蒙特卡罗方法的策略控制」的最小强化学习合同是把智能体和环境的交互定义为带概率与终止语义的决策过程,第14次检查保存状态、合法动作、转移分布、奖励、策略概率、折扣、终止和轨迹;若产生状态遗漏历史信息或把即时奖励误作长期收益,就返回同一环境与参数快照。
5.4.1 评估和改善
↡评估和改善对应原版目录坐标“5·4·1 评估和改善”,在“第5章 蒙特卡罗法”中用于把目录坐标转成有环境、转移、目标、更新和评估证据的实验合同,并受环境、状态/动作、奖励、策略、随机性、训练预算、评估协议与版本边界约束。原版坐标 15/24。 第15个正式坐标「5·4·1 评估和改善」服务于用完整回合样本估计价值,并复核同策略控制、离策略评价与重要性采样,需要以原版范围、输入输出、状态、动作、奖励、目标、参数、随机性与反例呈现把目录坐标转成有环境、转移、目标、更新和评估证据的实验合同;只复述术语或只展示最终平均奖励会破坏“回合边界、奖励下标、首次或每次访问口径、策略概率与重要性权重一致;第5章 蒙特卡罗法的结论不得越过原版目录、实验数据和评估边界”。
5.4.2 使用蒙特卡罗方法实现策略控制
↡使用蒙特卡罗方法实现策略控制对应原版目录坐标“5·4·2 使用蒙特卡罗方法实现策略控制”,在“第5章 蒙特卡罗法”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,并受环境、状态/动作、奖励、策略、随机性、训练预算、评估协议与版本边界约束。原版坐标 16/24。 在“第5章 蒙特卡罗法”的坐标16中,目录项「5·4·2 使用蒙特卡罗方法实现策略控制」用于把智能体和环境的交互定义为带概率与终止语义的决策过程;先冻结环境、策略与随机性,再以状态、合法动作、转移分布、奖励、策略概率、折扣、终止和轨迹复核,出现状态遗漏历史信息或把即时奖励误作长期收益时撤回结论。
5.4.3 ε-greedy方法(第1个修改)
↡ε-greedy方法(第1个修改)对应原版目录坐标“5·4·3 ε-greedy方法(第1个修改)”,在“第5章 蒙特卡罗法”中用于把目录坐标转成有环境、转移、目标、更新和评估证据的实验合同,并受环境、状态/动作、奖励、策略、随机性、训练预算、评估协议与版本边界约束。原版坐标 17/24。 目录项「5·4·3 ε-greedy方法(第1个修改)」进入“第5章 蒙特卡罗法”后要回答第17个机制问题:它怎样把目录坐标转成有环境、转移、目标、更新和评估证据的实验合同、改变哪个真实状态、由哪些原版范围、输入输出、状态、动作、奖励、目标、参数、随机性与反例证明,并如何排除只复述术语或只展示最终平均奖励。
5.4.4 修改为固定值α的方式(第2个修改)
↡修改为固定值α的方式(第2个修改)对应原版目录坐标“5·4·4 修改为固定值α的方式(第2个修改)”,在“第5章 蒙特卡罗法”中用于把目录坐标转成有环境、转移、目标、更新和评估证据的实验合同,并受环境、状态/动作、奖励、策略、随机性、训练预算、评估协议与版本边界约束。原版坐标 18/24。 围绕“怎样从一条完整轨迹反向计算收益,同时证明采样策略、目标策略和权重没有被混淆?”,“第5章 蒙特卡罗法”在原版层级18把「5·4·4 修改为固定值α的方式(第2个修改)」落实为把目录坐标转成有环境、转移、目标、更新和评估证据的实验合同;复核者先读取原版范围、输入输出、状态、动作、奖励、目标、参数、随机性与反例,不能接受只复述术语或只展示最终平均奖励。
5.4.5 修改版:使用蒙特卡罗方法实现策略迭代法
↡修改版对应原版目录坐标“5·4·5 修改版:使用蒙特卡罗方法实现策略迭代法”,在“第5章 蒙特卡罗法”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,并受环境、状态/动作、奖励、策略、随机性、训练预算、评估协议与版本边界约束。原版坐标 19/24。 对“第5章 蒙特卡罗法”而言,目录项「5·4·5 修改版:使用蒙特卡罗方法实现策略迭代法」的最小强化学习合同是把智能体和环境的交互定义为带概率与终止语义的决策过程,第19次检查保存状态、合法动作、转移分布、奖励、策略概率、折扣、终止和轨迹;若产生状态遗漏历史信息或把即时奖励误作长期收益,就返回同一环境与参数快照。
5.5 异策略和重要性采样
↡异策略和重要性采样对应原版目录坐标“5·5 异策略和重要性采样”,在“第5章 蒙特卡罗法”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,并受环境、状态/动作、奖励、策略、随机性、训练预算、评估协议与版本边界约束。原版坐标 20/24。 第20个正式坐标「5·5 异策略和重要性采样」服务于用完整回合样本估计价值,并复核同策略控制、离策略评价与重要性采样,需要以状态、合法动作、转移分布、奖励、策略概率、折扣、终止和轨迹呈现把智能体和环境的交互定义为带概率与终止语义的决策过程;状态遗漏历史信息或把即时奖励误作长期收益会破坏“回合边界、奖励下标、首次或每次访问口径、策略概率与重要性权重一致;第5章 蒙特卡罗法的结论不得越过原版目录、实验数据和评估边界”。
5.5.1 同策略和异策略
↡同策略和异策略对应原版目录坐标“5·5·1 同策略和异策略”,在“第5章 蒙特卡罗法”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,并受环境、状态/动作、奖励、策略、随机性、训练预算、评估协议与版本边界约束。原版坐标 21/24。 在“第5章 蒙特卡罗法”的坐标21中,目录项「5·5·1 同策略和异策略」用于把智能体和环境的交互定义为带概率与终止语义的决策过程;先冻结环境、策略与随机性,再以状态、合法动作、转移分布、奖励、策略概率、折扣、终止和轨迹复核,出现状态遗漏历史信息或把即时奖励误作长期收益时撤回结论。
5.5.2 重要性采样
↡重要性采样对应原版目录坐标“5·5·2 重要性采样”,在“第5章 蒙特卡罗法”中用于从完整样本回合计算收益,并在目标策略与行为策略间校正分布,并受环境、状态/动作、奖励、策略、随机性、训练预算、评估协议与版本边界约束。原版坐标 22/24。 目录项「5·5·2 重要性采样」进入“第5章 蒙特卡罗法”后要回答第22个机制问题:它怎样从完整样本回合计算收益,并在目标策略与行为策略间校正分布、改变哪个真实状态、由哪些轨迹、访问口径、反向收益、动作概率、重要性权重、估计累计量与方差证明,并如何排除概率身份颠倒、支持集缺失或把高方差样本当作确定结论。
5.5.3 如何减少方差
↡如何减少方差对应原版目录坐标“5·5·3 如何减少方差”,在“第5章 蒙特卡罗法”中用于从完整样本回合计算收益,并在目标策略与行为策略间校正分布,并受环境、状态/动作、奖励、策略、随机性、训练预算、评估协议与版本边界约束。原版坐标 23/24。 围绕“怎样从一条完整轨迹反向计算收益,同时证明采样策略、目标策略和权重没有被混淆?”,“第5章 蒙特卡罗法”在原版层级23把「5·5·3 如何减少方差」落实为从完整样本回合计算收益,并在目标策略与行为策略间校正分布;复核者先读取轨迹、访问口径、反向收益、动作概率、重要性权重、估计累计量与方差,不能接受概率身份颠倒、支持集缺失或把高方差样本当作确定结论。
5.6 小结
↡小结对应原版目录坐标“5·6 小结”,在“第5章 蒙特卡罗法”中用于声明本章在环境—转移—目标—更新—评估链中的职责与边界,并受环境、状态/动作、奖励、策略、随机性、训练预算、评估协议与版本边界约束。原版坐标 24/24。 对“第5章 蒙特卡罗法”而言,目录项「5·6 小结」的最小强化学习合同是声明本章在环境—转移—目标—更新—评估链中的职责与边界,第24次检查保存原版坐标、输入对象、核心状态、下游接口、反例和时间边界;若产生只罗列算法名或用当前热点重排原版,就返回同一环境与参数快照。
先预测,再操作三个章节专属强化学习实验
1. 状态—动作—奖励转移账本
固定“为“第5章 蒙特卡罗法”冻结环境、状态/动作语义、奖励、终止规则、策略版本、训练预算和随机种子,再对照参考路径与单故障路径。”,在参考、单故障和边界探针间切换,逐阶段查看“采样回合、反向算收益、累计估计、改善策略、检查权重”的输入对象、唯一动作、输出状态和必留证据。
强化学习状态—动作—奖励账本
选择运行情形,逐阶段核对真实对象与状态变化
怎样从一条完整轨迹反向计算收益,同时证明采样策略、目标策略和权重没有被混淆?
环境与策略设置
第5章 蒙特卡罗法使用冻结环境、固定策略版本、固定预算和种子,不启用故障。
运行前预测
第5章 蒙特卡罗法应沿“采样回合 → 反向算收益 → 累计估计 → 改善策略 → 检查权重”得到可重放的转移、目标、更新与评估轨迹。
适用与拒绝边界
第5章 蒙特卡罗法的参考运行只证明声明环境与预算内的机制,不外推到未测任务。
进入本阶段的对象与状态
第5章 蒙特卡罗法在“采样回合”读取环境版本、状态/动作空间、奖励、终止语义、初始分布、策略与随机种子。
本阶段唯一允许的动作
第5章 蒙特卡罗法在“采样回合”阶段冻结本页问题所需的任务快照,不运行训练或评估。
离开本阶段的真实状态
第5章 蒙特卡罗法在“采样回合”阶段产出可哈希的环境与策略前置状态。
必须保存的可复核证据
第5章 蒙特卡罗法在“采样回合”阶段保存环境配置、空间定义、种子、参数版本与允许读取的信息。
原版目录坐标:第5章 蒙特卡罗方法、5.1 蒙特卡罗方法的基础知识、5.1.1 骰子的点数和、5.1.2 分布模型和样本模型、5.1.3 蒙特卡罗方法的实现、5.2 使用蒙特卡罗方法评估策略、5.2.1 使用蒙特卡罗方法计算价值函数、5.2.2 求所有状态的价值函数、5.2.3 蒙特卡罗方法的高效实现、5.3 蒙特卡罗方法的实现、5.3.1 step方法、5.3.2 智能体类的实现、5.3.3 运行蒙特卡罗方法、5.4 使用蒙特卡罗方法的策略控制、5.4.1 评估和改善、5.4.2 使用蒙特卡罗方法实现策略控制、5.4.3 ε-greedy方法(第1个修改)、5.4.4 修改为固定值α的方式(第2个修改)、5.4.5 修改版:使用蒙特卡罗方法实现策略迭代法、5.5 异策略和重要性采样、5.5.1 同策略和异策略、5.5.2 重要性采样、5.5.3 如何减少方差、5.6 小结
第5章 蒙特卡罗法的可重放实现协议
| 阶段 | 允许动作 | 必留证据 | 拒绝条件 |
|---|---|---|---|
| 采样回合 | 在“第5章 蒙特卡罗法”执行采样回合,只改变声明的环境、转移、目标、价值、参数或评估状态 | 环境/空间定义、奖励/终止语义、策略版本、初值与种子 | 任务或随机性不可追溯 |
| 反向算收益 | 在“第5章 蒙特卡罗法”执行反向算收益,只改变声明的环境、转移、目标、价值、参数或评估状态 | 转移五元组、旧值、收益/目标分量、梯度或策略概率与新值 | 用目标策略生成的概率当作行为策略概率计算重要性权重;在第5章 蒙特卡罗法验收中只注入这一处 |
| 累计估计 | 在“第5章 蒙特卡罗法”执行累计估计,只改变声明的环境、转移、目标、价值、参数或评估状态 | 转移五元组、旧值、收益/目标分量、梯度或策略概率与新值 | 用目标策略生成的概率当作行为策略概率计算重要性权重;在第5章 蒙特卡罗法验收中只注入这一处 |
| 改善策略 | 在“第5章 蒙特卡罗法”执行改善策略,只改变声明的环境、转移、目标、价值、参数或评估状态 | 转移五元组、旧值、收益/目标分量、梯度或策略概率与新值 | 用目标策略生成的概率当作行为策略概率计算重要性权重;在第5章 蒙特卡罗法验收中只注入这一处 |
| 检查权重 | 在“第5章 蒙特卡罗法”执行检查权重,只改变声明的环境、转移、目标、价值、参数或评估状态 | 冻结评估、逐种子分布、反例、2022/当前边界与参数哈希 | 评估仍写参数或无法重放 |
unit: "dlr-05"
question: "怎样从一条完整轨迹反向计算收益,同时证明采样策略、目标策略和权重没有被混淆?"
scenario: "为“第5章 蒙特卡罗法”冻结环境、状态/动作语义、奖励、终止规则、策略版本、训练预算和随机种子,再对照参考路径与单故障路径。"
stages: ["采样回合", "反向算收益", "累计估计", "改善策略", "检查权重"]
invariant: "回合边界、奖励下标、首次或每次访问口径、策略概率与重要性权重一致;第5章 蒙特卡罗法的结论不得越过原版目录、实验数据和评估边界"
fault: "用目标策略生成的概率当作行为策略概率计算重要性权重;在第5章 蒙特卡罗法验收中只注入这一处"
evidence: "第5章 蒙特卡罗法的环境快照、转移五元组、收益/目标手算、更新前后状态、随机性记录、失败复现与冻结评估报告"
reset: restore_environment_policy_parameters_rng_trace_gates_and_artifact该协议要求“第5章 蒙特卡罗法”在相同环境、状态/动作语义、奖励、终止规则、策略版本、初值、预算和随机序列下重放。重置“第5章 蒙特卡罗法”后若案例、阶段、轨迹模式、步骤、验收门或证据包没有回到基线,交互状态已经污染比较。
本页回顾
掌握“第5章 蒙特卡罗法”不是背诵算法名或最终奖励,而是能围绕“怎样从一条完整轨迹反向计算收益,同时证明采样策略、目标策略和权重没有被混淆?”重建环境、转移、收益/目标、价值或策略更新、随机性与冻结评估证据,并用“回合边界、奖励下标、首次或每次访问口径、策略概率与重要性权重一致;第5章 蒙特卡罗法的结论不得越过原版目录、实验数据和评估边界”拒绝“用目标策略生成的概率当作行为策略概率计算重要性权重;在第5章 蒙特卡罗法验收中只注入这一处”。“第5章 蒙特卡罗法”最终交付为第5章 蒙特卡罗法的环境快照、转移五元组、收益/目标手算、更新前后状态、随机性记录、失败复现与冻结评估报告
练习与答案
练习
- 问题 1:强化学习实验合同。 “第5章 蒙特卡罗法”为什么必须先冻结环境、空间语义、奖励、终止规则、策略版本、初值、预算和随机种子?
- 问题 2:目录逐项覆盖。 怎样证明“第5章 蒙特卡罗法”的原版目录坐标已经进入机制、交互和练习?
- 问题 3:故障恢复。 怎样证明“第5章 蒙特卡罗法”中的“用目标策略生成的概率当作行为策略概率计算重要性权重;在第5章 蒙特卡罗法验收中只注入这一处”已经被修正?
名词解释
名词解释
本章出现的专业名词,用大白话再讲一遍。
- 蒙特卡罗方法
检索键 dlr-A 对应目录坐标「第5章 蒙特卡罗方法」;在“第5章 蒙特卡罗法”中用于声明本章在环境—转移—目标—更新—评估链中的职责与边界,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。
- 蒙特卡罗方法的基础知识
检索键 dlr-B 对应目录坐标「5·1 蒙特卡罗方法的基础知识」;在“第5章 蒙特卡罗法”中用于从完整样本回合计算收益,并在目标策略与行为策略间校正分布,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。
- 骰子的点数和
检索键 dlr-C 对应目录坐标「5·1·1 骰子的点数和」;在“第5章 蒙特卡罗法”中用于从完整样本回合计算收益,并在目标策略与行为策略间校正分布,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。
- 分布模型和样本模型
检索键 dlr-D 对应目录坐标「5·1·2 分布模型和样本模型」;在“第5章 蒙特卡罗法”中用于从完整样本回合计算收益,并在目标策略与行为策略间校正分布,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。
- 蒙特卡罗方法的实现
检索键 dlr-E 对应目录坐标「5·1·3 蒙特卡罗方法的实现」;在“第5章 蒙特卡罗法”中用于从完整样本回合计算收益,并在目标策略与行为策略间校正分布,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。
- 使用蒙特卡罗方法评估策略
检索键 dlr-F 对应目录坐标「5·2 使用蒙特卡罗方法评估策略」;在“第5章 蒙特卡罗法”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。
- 使用蒙特卡罗方法计算价值函数
检索键 dlr-G 对应目录坐标「5·2·1 使用蒙特卡罗方法计算价值函数」;在“第5章 蒙特卡罗法”中用于从完整样本回合计算收益,并在目标策略与行为策略间校正分布,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。
- 求所有状态的价值函数
检索键 dlr-H 对应目录坐标「5·2·2 求所有状态的价值函数」;在“第5章 蒙特卡罗法”中用于把目录坐标转成有环境、转移、目标、更新和评估证据的实验合同,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。
- 蒙特卡罗方法的高效实现
检索键 dlr-I 对应目录坐标「5·2·3 蒙特卡罗方法的高效实现」;在“第5章 蒙特卡罗法”中用于从完整样本回合计算收益,并在目标策略与行为策略间校正分布,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。
- 蒙特卡罗方法的实现
检索键 dlr-J 对应目录坐标「5·3 蒙特卡罗方法的实现」;在“第5章 蒙特卡罗法”中用于从完整样本回合计算收益,并在目标策略与行为策略间校正分布,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。
- step方法
检索键 dlr-K 对应目录坐标「5·3·1 step方法」;在“第5章 蒙特卡罗法”中用于从完整样本回合计算收益,并在目标策略与行为策略间校正分布,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。
- 智能体类的实现
检索键 dlr-L 对应目录坐标「5·3·2 智能体类的实现」;在“第5章 蒙特卡罗法”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。
- 运行蒙特卡罗方法
检索键 dlr-M 对应目录坐标「5·3·3 运行蒙特卡罗方法」;在“第5章 蒙特卡罗法”中用于从完整样本回合计算收益,并在目标策略与行为策略间校正分布,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。
- 使用蒙特卡罗方法的策略控制
检索键 dlr-N 对应目录坐标「5·4 使用蒙特卡罗方法的策略控制」;在“第5章 蒙特卡罗法”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。
- 评估和改善
检索键 dlr-O 对应目录坐标「5·4·1 评估和改善」;在“第5章 蒙特卡罗法”中用于把目录坐标转成有环境、转移、目标、更新和评估证据的实验合同,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。
- 使用蒙特卡罗方法实现策略控制
检索键 dlr-P 对应目录坐标「5·4·2 使用蒙特卡罗方法实现策略控制」;在“第5章 蒙特卡罗法”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。
- ε-greedy方法(第1个修改)
检索键 dlr-Q 对应目录坐标「5·4·3 ε-greedy方法(第1个修改)」;在“第5章 蒙特卡罗法”中用于把目录坐标转成有环境、转移、目标、更新和评估证据的实验合同,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。
- 修改为固定值α的方式(第2个修改)
检索键 dlr-R 对应目录坐标「5·4·4 修改为固定值α的方式(第2个修改)」;在“第5章 蒙特卡罗法”中用于把目录坐标转成有环境、转移、目标、更新和评估证据的实验合同,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。
- 修改版
检索键 dlr-S 对应目录坐标「5·4·5 修改版:使用蒙特卡罗方法实现策略迭代法」;在“第5章 蒙特卡罗法”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。
- 异策略和重要性采样
检索键 dlr-T 对应目录坐标「5·5 异策略和重要性采样」;在“第5章 蒙特卡罗法”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。
- 同策略和异策略
检索键 dlr-U 对应目录坐标「5·5·1 同策略和异策略」;在“第5章 蒙特卡罗法”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。
- 重要性采样
检索键 dlr-V 对应目录坐标「5·5·2 重要性采样」;在“第5章 蒙特卡罗法”中用于从完整样本回合计算收益,并在目标策略与行为策略间校正分布,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。
- 如何减少方差
检索键 dlr-W 对应目录坐标「5·5·3 如何减少方差」;在“第5章 蒙特卡罗法”中用于从完整样本回合计算收益,并在目标策略与行为策略间校正分布,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。
- 小结
检索键 dlr-X 对应目录坐标「5·6 小结」;在“第5章 蒙特卡罗法”中用于声明本章在环境—转移—目标—更新—评估链中的职责与边界,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。