第2章 马尔可夫决策过程

把智能体和环境写成状态、动作、转移、奖励、策略与折扣收益合同;用转移账本、单故障收益更新轨迹和冻结评估门完成复核。

学习目标

  • 能说明“第2章 马尔可夫决策过程”如何把智能体和环境写成状态、动作、转移、奖励、策略与折扣收益合同,并区分2022年原版、2024年中文授权版与当前扩展
  • 能先预测“怎样证明一个问题满足所声明的MDP边界,并让每个价值量都能回到明确的轨迹分布?”会改变哪一条转移、收益/目标、价值、梯度或策略概率,再逐步复核
  • 能注入“把影响下一状态的隐藏历史排除在状态之外,却仍声称满足马尔可夫性;在第2章 马尔可夫决策过程验收中只注入这一处”,用“状态包含决策所需信息,转移与奖励只读取允许变量,策略和收益下标一致;第2章 马尔可夫决策过程的结论不得越过原版目录、实验数据和评估边界”决定接受、回退或拒绝强化学习结论

为什么从这个强化学习问题开始

本章把强化学习的对象边界形式化,重点不是背诵符号,而是说明每个随机变量由谁产生。 “第2章 马尔可夫决策过程”的贯穿任务是:为“第2章 马尔可夫决策过程”冻结环境、状态/动作语义、奖励、终止规则、策略版本、训练预算和随机种子,再对照参考路径与单故障路径。 动手前先写下哪个状态、动作、奖励、收益/目标、价值、梯度、策略概率或评估哈希会先变化;运行后补理由不算预测。

围绕“怎样证明一个问题满足所声明的MDP边界,并让每个价值量都能回到明确的轨迹分布?”,“第2章 马尔可夫决策过程”建立参考、故障与恢复路径。只有“第2章 马尔可夫决策过程”守住“状态包含决策所需信息,转移与奖励只读取允许变量,策略和收益下标一致;第2章 马尔可夫决策过程的结论不得越过原版目录、实验数据和评估边界”并交付第2章 马尔可夫决策过程的环境快照、转移五元组、收益/目标手算、更新前后状态、随机性记录、失败复现与冻结评估报告,奖励曲线或成功轨迹才构成机制证据。

书目、205个原版层级与版本边界

“第2章 马尔可夫决策过程”以O’Reilly Japan原版官方书页核对斋藤康毅著《ゼロから作るDeep Learning ❹ ―強化学習編》于2022年4月6日出版、376页、ISBN 9784873119755。“第2章 马尔可夫决策过程”采用出版社同页给出的10章与附录A至D作为完整目录边界;本站逐项统计10个章标题、57个一级节、128个二级节、4个附录标题和6个附录节,共205个正式目录层级。“第2章 马尔可夫决策过程”再以出版社官方代码仓库核对实现目录,以官方勘误识别已知错误。

“第2章 马尔可夫决策过程”没有使用未获授权的原书完整正文,只以出版社完整目录、官方代码和勘误限定范围;中文解释、数值、交互、练习与答案均为独立教学重写。“第2章 马尔可夫决策过程”的中文授权书目页仅用于核对《深度学习入门4:强化学习》、人民邮电出版社2024年8月、333页和ISBN 9787115649171,不用来证明日文原版正文。“第2章 马尔可夫决策过程”以2022年日文原版与2024年中文授权版目录为内容边界;当前环境API、后续论文与兼容修正只作带时间标签的独立核验。

“第2章 马尔可夫决策过程”另以技术核对 1技术核对 2技术核对 3核对算法定义、实现语义或实验边界;这些资料能验证本页技术事实,不能反向证明原书采用了本站表述。

原版目录层级与实现机制

第2章 马尔可夫决策过程

原版坐标 1/17。 在“第2章 马尔可夫决策过程”的坐标1中,目录项「第2章 马尔可夫决策过程」用于声明本章在环境—转移—目标—更新—评估链中的职责与边界;先冻结环境、策略与随机性,再以原版坐标、输入对象、核心状态、下游接口、反例和时间边界复核,出现只罗列算法名或用当前热点重排原版时撤回结论。

2.1 什么是MDP

原版坐标 2/17。 目录项「2·1 什么是MDP」进入“第2章 马尔可夫决策过程”后要回答第2个机制问题:它怎样把智能体和环境的交互定义为带概率与终止语义的决策过程、改变哪个真实状态、由哪些状态、合法动作、转移分布、奖励、策略概率、折扣、终止和轨迹证明,并如何排除状态遗漏历史信息或把即时奖励误作长期收益。

2.1.1 MDP的具体例子

原版坐标 3/17。 围绕“怎样证明一个问题满足所声明的MDP边界,并让每个价值量都能回到明确的轨迹分布?”,“第2章 马尔可夫决策过程”在原版层级3把「2·1·1 MDP的具体例子」落实为把智能体和环境的交互定义为带概率与终止语义的决策过程;复核者先读取状态、合法动作、转移分布、奖励、策略概率、折扣、终止和轨迹,不能接受状态遗漏历史信息或把即时奖励误作长期收益。

2.1.2 智能体与环境的互动

原版坐标 4/17。 对“第2章 马尔可夫决策过程”而言,目录项「2·1·2 智能体与环境的互动」的最小强化学习合同是把智能体和环境的交互定义为带概率与终止语义的决策过程,第4次检查保存状态、合法动作、转移分布、奖励、策略概率、折扣、终止和轨迹;若产生状态遗漏历史信息或把即时奖励误作长期收益,就返回同一环境与参数快照。

2.2 环境和智能体的数学表示

原版坐标 5/17。 第5个正式坐标「2·2 环境和智能体的数学表示」服务于把智能体和环境写成状态、动作、转移、奖励、策略与折扣收益合同,需要以状态、合法动作、转移分布、奖励、策略概率、折扣、终止和轨迹呈现把智能体和环境的交互定义为带概率与终止语义的决策过程;状态遗漏历史信息或把即时奖励误作长期收益会破坏“状态包含决策所需信息,转移与奖励只读取允许变量,策略和收益下标一致;第2章 马尔可夫决策过程的结论不得越过原版目录、实验数据和评估边界”。

2.2.1 状态转移

原版坐标 6/17。 在“第2章 马尔可夫决策过程”的坐标6中,目录项「2·2·1 状态转移」用于把智能体和环境的交互定义为带概率与终止语义的决策过程;先冻结环境、策略与随机性,再以状态、合法动作、转移分布、奖励、策略概率、折扣、终止和轨迹复核,出现状态遗漏历史信息或把即时奖励误作长期收益时撤回结论。

2.2.2 奖励函数

原版坐标 7/17。 目录项「2·2·2 奖励函数」进入“第2章 马尔可夫决策过程”后要回答第7个机制问题:它怎样把智能体和环境的交互定义为带概率与终止语义的决策过程、改变哪个真实状态、由哪些状态、合法动作、转移分布、奖励、策略概率、折扣、终止和轨迹证明,并如何排除状态遗漏历史信息或把即时奖励误作长期收益。

2.2.3 智能体的策略

原版坐标 8/17。 围绕“怎样证明一个问题满足所声明的MDP边界,并让每个价值量都能回到明确的轨迹分布?”,“第2章 马尔可夫决策过程”在原版层级8把「2·2·3 智能体的策略」落实为把智能体和环境的交互定义为带概率与终止语义的决策过程;复核者先读取状态、合法动作、转移分布、奖励、策略概率、折扣、终止和轨迹,不能接受状态遗漏历史信息或把即时奖励误作长期收益。

2.3 MDP的目标

原版坐标 9/17。 对“第2章 马尔可夫决策过程”而言,目录项「2·3 MDP的目标」的最小强化学习合同是把智能体和环境的交互定义为带概率与终止语义的决策过程,第9次检查保存状态、合法动作、转移分布、奖励、策略概率、折扣、终止和轨迹;若产生状态遗漏历史信息或把即时奖励误作长期收益,就返回同一环境与参数快照。

2.3.1 回合制任务和连续性任务

原版坐标 10/17。 第10个正式坐标「2·3·1 回合制任务和连续性任务」服务于把智能体和环境写成状态、动作、转移、奖励、策略与折扣收益合同,需要以状态、合法动作、转移分布、奖励、策略概率、折扣、终止和轨迹呈现把智能体和环境的交互定义为带概率与终止语义的决策过程;状态遗漏历史信息或把即时奖励误作长期收益会破坏“状态包含决策所需信息,转移与奖励只读取允许变量,策略和收益下标一致;第2章 马尔可夫决策过程的结论不得越过原版目录、实验数据和评估边界”。

2.3.2 收益

原版坐标 11/17。 在“第2章 马尔可夫决策过程”的坐标11中,目录项「2·3·2 收益」用于把智能体和环境的交互定义为带概率与终止语义的决策过程;先冻结环境、策略与随机性,再以状态、合法动作、转移分布、奖励、策略概率、折扣、终止和轨迹复核,出现状态遗漏历史信息或把即时奖励误作长期收益时撤回结论。

2.3.3 状态价值函数

原版坐标 12/17。 目录项「2·3·3 状态价值函数」进入“第2章 马尔可夫决策过程”后要回答第12个机制问题:它怎样用一步递归把当前奖励与后继价值组合为一致的价值等式、改变哪个真实状态、由哪些转移概率、策略概率、即时奖励、折扣、后继价值、最大值与残差证明,并如何排除在同一备份中混用不同策略、不同MDP或错误的最大化位置。

2.3.4 最优策略和最优价值函数

原版坐标 13/17。 围绕“怎样证明一个问题满足所声明的MDP边界,并让每个价值量都能回到明确的轨迹分布?”,“第2章 马尔可夫决策过程”在原版层级13把「2·3·4 最优策略和最优价值函数」落实为把智能体和环境的交互定义为带概率与终止语义的决策过程;复核者先读取状态、合法动作、转移分布、奖励、策略概率、折扣、终止和轨迹,不能接受状态遗漏历史信息或把即时奖励误作长期收益。

2.4 MDP的例子

原版坐标 14/17。 对“第2章 马尔可夫决策过程”而言,目录项「2·4 MDP的例子」的最小强化学习合同是把智能体和环境的交互定义为带概率与终止语义的决策过程,第14次检查保存状态、合法动作、转移分布、奖励、策略概率、折扣、终止和轨迹;若产生状态遗漏历史信息或把即时奖励误作长期收益,就返回同一环境与参数快照。

2.4.1 回溯线图

原版坐标 15/17。 第15个正式坐标「2·4·1 回溯线图」服务于把智能体和环境写成状态、动作、转移、奖励、策略与折扣收益合同,需要以转移概率、策略概率、即时奖励、折扣、后继价值、最大值与残差呈现用一步递归把当前奖励与后继价值组合为一致的价值等式;在同一备份中混用不同策略、不同MDP或错误的最大化位置会破坏“状态包含决策所需信息,转移与奖励只读取允许变量,策略和收益下标一致;第2章 马尔可夫决策过程的结论不得越过原版目录、实验数据和评估边界”。

2.4.2 找出最优策略

原版坐标 16/17。 在“第2章 马尔可夫决策过程”的坐标16中,目录项「2·4·2 找出最优策略」用于把智能体和环境的交互定义为带概率与终止语义的决策过程;先冻结环境、策略与随机性,再以状态、合法动作、转移分布、奖励、策略概率、折扣、终止和轨迹复核,出现状态遗漏历史信息或把即时奖励误作长期收益时撤回结论。

2.5 小结

原版坐标 17/17。 目录项「2·5 小结」进入“第2章 马尔可夫决策过程”后要回答第17个机制问题:它怎样声明本章在环境—转移—目标—更新—评估链中的职责与边界、改变哪个真实状态、由哪些原版坐标、输入对象、核心状态、下游接口、反例和时间边界证明,并如何排除只罗列算法名或用当前热点重排原版。

先预测,再操作三个章节专属强化学习实验

分步1 / 3

1. 状态—动作—奖励转移账本

固定“为“第2章 马尔可夫决策过程”冻结环境、状态/动作语义、奖励、终止规则、策略版本、训练预算和随机种子,再对照参考路径与单故障路径。”,在参考、单故障和边界探针间切换,逐阶段查看“定义状态、选择动作、执行转移、累计收益、核对策略”的输入对象、唯一动作、输出状态和必留证据。

强化学习状态—动作—奖励账本

选择运行情形,逐阶段核对真实对象与状态变化

怎样证明一个问题满足所声明的MDP边界,并让每个价值量都能回到明确的轨迹分布?

环境与策略设置

第2章 马尔可夫决策过程使用冻结环境、固定策略版本、固定预算和种子,不启用故障。

运行前预测

第2章 马尔可夫决策过程应沿“定义状态 → 选择动作 → 执行转移 → 累计收益 → 核对策略”得到可重放的转移、目标、更新与评估轨迹。

适用与拒绝边界

第2章 马尔可夫决策过程的参考运行只证明声明环境与预算内的机制,不外推到未测任务。

进入本阶段的对象与状态

第2章 马尔可夫决策过程在“定义状态”读取环境版本、状态/动作空间、奖励、终止语义、初始分布、策略与随机种子。

本阶段唯一允许的动作

第2章 马尔可夫决策过程在“定义状态”阶段冻结本页问题所需的任务快照,不运行训练或评估。

离开本阶段的真实状态

第2章 马尔可夫决策过程在“定义状态”阶段产出可哈希的环境与策略前置状态。

必须保存的可复核证据

第2章 马尔可夫决策过程在“定义状态”阶段保存环境配置、空间定义、种子、参数版本与允许读取的信息。

原版目录坐标:第2章 马尔可夫决策过程、2.1 什么是MDP、2.1.1 MDP的具体例子、2.1.2 智能体与环境的互动、2.2 环境和智能体的数学表示、2.2.1 状态转移、2.2.2 奖励函数、2.2.3 智能体的策略、2.3 MDP的目标、2.3.1 回合制任务和连续性任务、2.3.2 收益、2.3.3 状态价值函数、2.3.4 最优策略和最优价值函数、2.4 MDP的例子、2.4.1 回溯线图、2.4.2 找出最优策略、2.5 小结

第2章 马尔可夫决策过程的可重放实现协议

阶段允许动作必留证据拒绝条件
定义状态在“第2章 马尔可夫决策过程”执行定义状态,只改变声明的环境、转移、目标、价值、参数或评估状态环境/空间定义、奖励/终止语义、策略版本、初值与种子任务或随机性不可追溯
选择动作在“第2章 马尔可夫决策过程”执行选择动作,只改变声明的环境、转移、目标、价值、参数或评估状态转移五元组、旧值、收益/目标分量、梯度或策略概率与新值把影响下一状态的隐藏历史排除在状态之外,却仍声称满足马尔可夫性;在第2章 马尔可夫决策过程验收中只注入这一处
执行转移在“第2章 马尔可夫决策过程”执行执行转移,只改变声明的环境、转移、目标、价值、参数或评估状态转移五元组、旧值、收益/目标分量、梯度或策略概率与新值把影响下一状态的隐藏历史排除在状态之外,却仍声称满足马尔可夫性;在第2章 马尔可夫决策过程验收中只注入这一处
累计收益在“第2章 马尔可夫决策过程”执行累计收益,只改变声明的环境、转移、目标、价值、参数或评估状态转移五元组、旧值、收益/目标分量、梯度或策略概率与新值把影响下一状态的隐藏历史排除在状态之外,却仍声称满足马尔可夫性;在第2章 马尔可夫决策过程验收中只注入这一处
核对策略在“第2章 马尔可夫决策过程”执行核对策略,只改变声明的环境、转移、目标、价值、参数或评估状态冻结评估、逐种子分布、反例、2022/当前边界与参数哈希评估仍写参数或无法重放
unit: "dlr-02"
question: "怎样证明一个问题满足所声明的MDP边界,并让每个价值量都能回到明确的轨迹分布?"
scenario: "为“第2章 马尔可夫决策过程”冻结环境、状态/动作语义、奖励、终止规则、策略版本、训练预算和随机种子,再对照参考路径与单故障路径。"
stages: ["定义状态", "选择动作", "执行转移", "累计收益", "核对策略"]
invariant: "状态包含决策所需信息,转移与奖励只读取允许变量,策略和收益下标一致;第2章 马尔可夫决策过程的结论不得越过原版目录、实验数据和评估边界"
fault: "把影响下一状态的隐藏历史排除在状态之外,却仍声称满足马尔可夫性;在第2章 马尔可夫决策过程验收中只注入这一处"
evidence: "第2章 马尔可夫决策过程的环境快照、转移五元组、收益/目标手算、更新前后状态、随机性记录、失败复现与冻结评估报告"
reset: restore_environment_policy_parameters_rng_trace_gates_and_artifact

该协议要求“第2章 马尔可夫决策过程”在相同环境、状态/动作语义、奖励、终止规则、策略版本、初值、预算和随机序列下重放。重置“第2章 马尔可夫决策过程”后若案例、阶段、轨迹模式、步骤、验收门或证据包没有回到基线,交互状态已经污染比较。

本页回顾

掌握“第2章 马尔可夫决策过程”不是背诵算法名或最终奖励,而是能围绕“怎样证明一个问题满足所声明的MDP边界,并让每个价值量都能回到明确的轨迹分布?”重建环境、转移、收益/目标、价值或策略更新、随机性与冻结评估证据,并用“状态包含决策所需信息,转移与奖励只读取允许变量,策略和收益下标一致;第2章 马尔可夫决策过程的结论不得越过原版目录、实验数据和评估边界”拒绝“把影响下一状态的隐藏历史排除在状态之外,却仍声称满足马尔可夫性;在第2章 马尔可夫决策过程验收中只注入这一处”。“第2章 马尔可夫决策过程”最终交付为第2章 马尔可夫决策过程的环境快照、转移五元组、收益/目标手算、更新前后状态、随机性记录、失败复现与冻结评估报告

练习与答案

练习

  1. 问题 1:强化学习实验合同。 “第2章 马尔可夫决策过程”为什么必须先冻结环境、空间语义、奖励、终止规则、策略版本、初值、预算和随机种子?
  1. 问题 2:目录逐项覆盖。 怎样证明“第2章 马尔可夫决策过程”的原版目录坐标已经进入机制、交互和练习?
  1. 问题 3:故障恢复。 怎样证明“第2章 马尔可夫决策过程”中的“把影响下一状态的隐藏历史排除在状态之外,却仍声称满足马尔可夫性;在第2章 马尔可夫决策过程验收中只注入这一处”已经被修正?

名词解释

名词解释

本章出现的专业名词,用大白话再讲一遍。

马尔可夫决策过程

检索键 dlr-A 对应目录坐标「第2章 马尔可夫决策过程」;在“第2章 马尔可夫决策过程”中用于声明本章在环境—转移—目标—更新—评估链中的职责与边界,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。

什么是MDP

检索键 dlr-B 对应目录坐标「2·1 什么是MDP」;在“第2章 马尔可夫决策过程”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。

MDP的具体例子

检索键 dlr-C 对应目录坐标「2·1·1 MDP的具体例子」;在“第2章 马尔可夫决策过程”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。

智能体与环境的互动

检索键 dlr-D 对应目录坐标「2·1·2 智能体与环境的互动」;在“第2章 马尔可夫决策过程”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。

环境和智能体的数学表示

检索键 dlr-E 对应目录坐标「2·2 环境和智能体的数学表示」;在“第2章 马尔可夫决策过程”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。

状态转移

检索键 dlr-F 对应目录坐标「2·2·1 状态转移」;在“第2章 马尔可夫决策过程”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。

奖励函数

检索键 dlr-G 对应目录坐标「2·2·2 奖励函数」;在“第2章 马尔可夫决策过程”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。

智能体的策略

检索键 dlr-H 对应目录坐标「2·2·3 智能体的策略」;在“第2章 马尔可夫决策过程”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。

MDP的目标

检索键 dlr-I 对应目录坐标「2·3 MDP的目标」;在“第2章 马尔可夫决策过程”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。

回合制任务和连续性任务

检索键 dlr-J 对应目录坐标「2·3·1 回合制任务和连续性任务」;在“第2章 马尔可夫决策过程”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。

收益

检索键 dlr-K 对应目录坐标「2·3·2 收益」;在“第2章 马尔可夫决策过程”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。

状态价值函数

检索键 dlr-L 对应目录坐标「2·3·3 状态价值函数」;在“第2章 马尔可夫决策过程”中用于用一步递归把当前奖励与后继价值组合为一致的价值等式,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。

最优策略和最优价值函数

检索键 dlr-M 对应目录坐标「2·3·4 最优策略和最优价值函数」;在“第2章 马尔可夫决策过程”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。

MDP的例子

检索键 dlr-N 对应目录坐标「2·4 MDP的例子」;在“第2章 马尔可夫决策过程”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。

回溯线图

检索键 dlr-O 对应目录坐标「2·4·1 回溯线图」;在“第2章 马尔可夫决策过程”中用于用一步递归把当前奖励与后继价值组合为一致的价值等式,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。

找出最优策略

检索键 dlr-P 对应目录坐标「2·4·2 找出最优策略」;在“第2章 马尔可夫决策过程”中用于把智能体和环境的交互定义为带概率与终止语义的决策过程,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。

小结

检索键 dlr-Q 对应目录坐标「2·5 小结」;在“第2章 马尔可夫决策过程”中用于声明本章在环境—转移—目标—更新—评估链中的职责与边界,需要连接原版范围、环境快照、转移、目标/更新和冻结评估证据。

讨论

评论区加载中…