第1章:强化学习与深度学习

区分人工智能、机器学习、强化学习与深度学习,并用回报、Q 值和函数近似建立共同接口。

学习目标

  • 能用“深度学习在强化学习中究竟替代了什么,又有哪些目标和边界完全没有改变?”解释本页问题,并把结论限制在官方 2017 年版目录范围内
  • 能逐项重建“深度网络替代表格的存储方式,但不会替代环境、奖励、策略或最大化累计回报的学习目标。”的输入、状态、公式与中间证据
  • 能对“对四状态两动作迷宫同时建立 4×2 的 Q 表和输入四维、输出二维的小网络;比较两者接收同一状态、返回同一动作价值接口的方式。”完成一次手算或逐步重放,而不是只观察最终奖励
  • 能注入“把网络预测误写成环境奖励”,定位首个分岔并用重置回到相同初值

为什么从这个问题开始

深度学习在强化学习中究竟替代了什么,又有哪些目标和边界完全没有改变? 深度网络替代表格的存储方式,但不会替代环境、奖励、策略或最大化累计回报的学习目标。 “第1章:强化学习与深度学习”的学习目标不是复述原书目录,而是把目录约束转成可以计算、运行、失败和复位的教学合同。把术语层级落实为状态、动作、奖励、回报与函数近似器之间的可检查接口。

先写预测:在同一初值下,如果故障“把网络预测误写成环境奖励”被启用,最先变化的是输入、转移、TD 目标、激活、梯度还是评价哈希?运行后若观察不一致,应缩小结论并检查第一处差异,不能用更长训练覆盖它。

来源、版次与版权边界

欧姆社官方书页确认小高知宏著、2017 年 10 月 14 日出版、208 页、ISBN 978-4-274-22114-9,并公开四章详细目录。官方页同时声明配套压缩包仅供购书者使用;本课程没有下载、缓存或改写该压缩包,只用公开目录核定范围。

技术事实另以《Reinforcement Learning: An Introduction》作者页面《Deep Learning》作者开放页面交叉核对。第1章:强化学习与深度学习的中文解释、C 片段、交互、数值、反例、练习与答案均为独立教学重写;现代 DQN、经验回放、目标网络或策略梯度若出现,只能明确标成边界,不能倒填为 2017 年原书内容。

术语、对象与前提

  • :观察状态、选择动作并接收奖励的学习主体。
  • :根据状态动作产生下一状态、奖励和终止信号的系统。
  • :从当前时刻起折扣累计的未来奖励。
  • :从状态到动作选择概率或规则的映射。
  • :对未来回报期望的估计。
  • :用多层网络参数表示状态动作价值。

必须先声明以下假设:

  • 折扣因子在零到一的闭区间内
  • 状态、动作、奖励和终止标记含义固定
  • 表格与网络比较使用同一任务和评价轨迹
  • 神经网络只承担函数近似,不改写强化学习目标

实现管线

第1章:强化学习与深度学习

深度学习在强化学习中究竟替代了什么,又有哪些目标和边界完全没有改变?

输入与状态合同

声明智能体、环境、状态、动作、奖励和 episode 终止条件。

必须留下的证据

给出一个完整转移记录并解释每个字段。

G_t = Σ γ^k r_(t+k+1); Q(s,a) ≈ f_θ(s)_a

来源边界:欧姆社公开目录核定范围;购书者示例包未下载、未缓存、未改写;本课程代码与实验独立编写。

核心机制与可复算表达

本页主张: 深度网络替代表格的存储方式,但不会替代环境、奖励、策略或最大化累计回报的学习目标。

Gt=Σγkr(t+k+1);Q(s,a)fθ(s)aG_t = Σ γ^k r_(t+k+1); Q(s,a) ≈ f_θ(s)_a

这条主张只在上述四条假设下成立。对四状态两动作迷宫同时建立 4×2 的 Q 表和输入四维、输出二维的小网络;比较两者接收同一状态、返回同一动作价值接口的方式。 验收时必须保存“术语边界图、三步回报手算、同任务的表格与网络接口、状态动作尺寸和冻结评价记录。”,否则最终奖励或损失曲线不足以排除索引、初始化、终止和评价模式错误。

正常轨迹与单故障轨迹

逐步重放

正常轨迹与失败轨迹使用同一输入合同

  1. 01环境返回下一状态、即时奖励和终止标记。
  2. 02智能体把奖励放入回报或 TD 目标。
  3. 03Q 表或网络输出表示同一个状态动作价值。
  4. 04策略依据当前价值选择下一动作。

不变量:无论使用表格还是网络,环境转移、奖励语义与最大化期望回报的目标保持不变。

正常轨迹要求同一输入和随机序列得到同一中间状态。故障轨迹只删除一个前提:“把网络预测误写成环境奖励”。两条轨迹共用其余条件,才能把首个分岔归因到该故障,而不是换了任务、模型或初值。

独立 C 实现片段

double discounted_return(const double reward[], int length, double gamma) {
    double value = 0.0;
    for (int i = length - 1; i >= 0; --i) {
        value = reward[i] + gamma * value;
    }
    return value;
}

这段代码由本课程独立编写,只展示“第1章:强化学习与深度学习”的最小接口,不复制官方购书者压缩包。编译时应启用告警、地址检测和未定义行为检测;运行记录包含输入尺寸、索引、旧值、新值和终止标记。

反例、适用边界与复位

反例与证据

删除一个前提,定位首个错误状态

基线可继续:无论使用表格还是网络,环境转移、奖励语义与最大化期望回报的目标保持不变。

复位不是只把按钮切回默认值。它必须恢复与“第1章:强化学习与深度学习”有关的环境、随机数、表格、参数、轨迹和模式开关,并再次确认“无论使用表格还是网络,环境转移、奖励语义与最大化期望回报的目标保持不变。”。

正式目录逐项深读

第1章 强化学习与深度学习

目录映射 1/12。 第1章 强化学习与深度学习在“第1章:强化学习与深度学习”中承担把术语层级落实为状态、动作、奖励、回报与函数近似器之间的可检查接口。的一个明确节点。复核时先指出它读取的输入和允许改变的状态,再用“无论使用表格还是网络,环境转移、奖励语义与最大化期望回报的目标保持不变。”核对结果;不能把目录标题本身当作技术结论。

1.1 机器学习与强化学习

目录映射 2/12。 1.1 机器学习与强化学习在“第1章:强化学习与深度学习”中承担把术语层级落实为状态、动作、奖励、回报与函数近似器之间的可检查接口。的一个明确节点。复核时先指出它读取的输入和允许改变的状态,再用“无论使用表格还是网络,环境转移、奖励语义与最大化期望回报的目标保持不变。”核对结果;不能把目录标题本身当作技术结论。

1.1.1 人工智能

目录映射 3/12。 1.1.1 人工智能在“第1章:强化学习与深度学习”中承担把术语层级落实为状态、动作、奖励、回报与函数近似器之间的可检查接口。的一个明确节点。复核时先指出它读取的输入和允许改变的状态,再用“无论使用表格还是网络,环境转移、奖励语义与最大化期望回报的目标保持不变。”核对结果;不能把目录标题本身当作技术结论。

1.1.2 机器学习

目录映射 4/12。 1.1.2 机器学习在“第1章:强化学习与深度学习”中承担把术语层级落实为状态、动作、奖励、回报与函数近似器之间的可检查接口。的一个明确节点。复核时先指出它读取的输入和允许改变的状态,再用“无论使用表格还是网络,环境转移、奖励语义与最大化期望回报的目标保持不变。”核对结果;不能把目录标题本身当作技术结论。

1.1.3 强化学习

目录映射 5/12。 1.1.3 强化学习在“第1章:强化学习与深度学习”中承担把术语层级落实为状态、动作、奖励、回报与函数近似器之间的可检查接口。的一个明确节点。复核时先指出它读取的输入和允许改变的状态,再用“无论使用表格还是网络,环境转移、奖励语义与最大化期望回报的目标保持不变。”核对结果;不能把目录标题本身当作技术结论。

1.2 什么是深度学习

目录映射 6/12。 1.2 什么是深度学习在“第1章:强化学习与深度学习”中承担把术语层级落实为状态、动作、奖励、回报与函数近似器之间的可检查接口。的一个明确节点。复核时先指出它读取的输入和允许改变的状态,再用“无论使用表格还是网络,环境转移、奖励语义与最大化期望回报的目标保持不变。”核对结果;不能把目录标题本身当作技术结论。

1.2.1 神经网络

目录映射 7/12。 1.2.1 神经网络在“第1章:强化学习与深度学习”中承担把术语层级落实为状态、动作、奖励、回报与函数近似器之间的可检查接口。的一个明确节点。复核时先指出它读取的输入和允许改变的状态,再用“无论使用表格还是网络,环境转移、奖励语义与最大化期望回报的目标保持不变。”核对结果;不能把目录标题本身当作技术结论。

1.2.2 深度学习的出现

目录映射 8/12。 1.2.2 深度学习的出现在“第1章:强化学习与深度学习”中承担把术语层级落实为状态、动作、奖励、回报与函数近似器之间的可检查接口。的一个明确节点。复核时先指出它读取的输入和允许改变的状态,再用“无论使用表格还是网络,环境转移、奖励语义与最大化期望回报的目标保持不变。”核对结果;不能把目录标题本身当作技术结论。

1.3 什么是深度强化学习

目录映射 9/12。 1.3 什么是深度强化学习在“第1章:强化学习与深度学习”中承担把术语层级落实为状态、动作、奖励、回报与函数近似器之间的可检查接口。的一个明确节点。复核时先指出它读取的输入和允许改变的状态,再用“无论使用表格还是网络,环境转移、奖励语义与最大化期望回报的目标保持不变。”核对结果;不能把目录标题本身当作技术结论。

1.3.1 强化学习与深度学习

目录映射 10/12。 1.3.1 强化学习与深度学习在“第1章:强化学习与深度学习”中承担把术语层级落实为状态、动作、奖励、回报与函数近似器之间的可检查接口。的一个明确节点。复核时先指出它读取的输入和允许改变的状态,再用“无论使用表格还是网络,环境转移、奖励语义与最大化期望回报的目标保持不变。”核对结果;不能把目录标题本身当作技术结论。

1.3.2 深度强化学习的实现

目录映射 11/12。 1.3.2 深度强化学习的实现在“第1章:强化学习与深度学习”中承担把术语层级落实为状态、动作、奖励、回报与函数近似器之间的可检查接口。的一个明确节点。复核时先指出它读取的输入和允许改变的状态,再用“无论使用表格还是网络,环境转移、奖励语义与最大化期望回报的目标保持不变。”核对结果;不能把目录标题本身当作技术结论。

1.3.3 基础机器学习系统示例:示例程序运行方法

目录映射 12/12。 1.3.3 基础机器学习系统示例:示例程序运行方法在“第1章:强化学习与深度学习”中承担把术语层级落实为状态、动作、奖励、回报与函数近似器之间的可检查接口。的一个明确节点。复核时先指出它读取的输入和允许改变的状态,再用“无论使用表格还是网络,环境转移、奖励语义与最大化期望回报的目标保持不变。”核对结果;不能把目录标题本身当作技术结论。

小结

  • 强化学习从试错中学策略
  • 深度学习从数据中学表示
  • 两者结合解决序贯决策
  • C 语言实现看清底层细节
  • 环境、智能体、奖励三要素

最小可重放记录

unit: 01-rl-deep-learning/rlc-01-rl-deep-learning
question: "深度学习在强化学习中究竟替代了什么,又有哪些目标和边界完全没有改变?"
initial_state: fixed_and_hashed
normal_trace: saved
fault: "把网络预测误写成环境奖励"
first_divergence: required
invariant: "无论使用表格还是网络,环境转移、奖励语义与最大化期望回报的目标保持不变。"
artifact: "术语边界图、三步回报手算、同任务的表格与网络接口、状态动作尺寸和冻结评价记录。"
reset: restore_environment_rng_tables_weights_trace_and_mode

这份记录把“第1章:强化学习与深度学习”的目录坐标、输入、故障和证据绑在一起。复核者应先盲跑正常轨迹,再注入故障,最后执行恢复与复位;任何依赖隐藏操作者或上一轮状态的运行都不合格。

练习与答案

练习

问题 1: 三步奖励为 0、0、1,折扣因子为 0.9,起点回报是多少?

问题 2: 表格型 Q 与网络 Q 的共同接口是什么?

问题 3: 什么证据能推翻“网络一定优于表格”?

本页回顾

深度网络替代表格的存储方式,但不会替代环境、奖励、策略或最大化累计回报的学习目标。 掌握“第1章:强化学习与深度学习”的标准是:能声明假设、手算关键值、逐步解释 C 状态变化、制造一个最小反例,并证明“无论使用表格还是网络,环境转移、奖励语义与最大化期望回报的目标保持不变。”在复位后仍然成立。

名词解释

本章出现的专业名词,用大白话再讲一遍。

智能体
观察状态、选择动作并接收奖励的学习主体。
环境
根据状态动作产生下一状态、奖励和终止信号的系统。
回报
从当前时刻起折扣累计的未来奖励。
策略
从状态到动作选择概率或规则的映射。
价值函数
对未来回报期望的估计。
深度函数近似
用多层网络参数表示状态动作价值。

讨论

评论区加载中…