第2章 神经网络
覆盖M-P模型、感知器、多层感知器、反向传播、误差与激活、似然、SGD和学习率;用五阶段信号、单故障训练轨迹和可复现实验门完成独立复核。
学习目标
- 能说明“第2章 神经网络”如何覆盖M-P模型、感知器、多层感知器、反向传播、误差与激活、似然、SGD和学习率,并把2016原版、2018中文版与当前迁移信息分层
- 能先预测“怎样从加权和一路追到损失梯度与参数更新,并用数值梯度或下降轨迹反证错误实现?”的五阶段信号,再用输入、中间状态、输出和反例逐层复核
- 能注入“激活导数或损失符号写反,训练日志仍下降一小段便误判反向传播正确”,用“前向计算、目标函数、链式法则、梯度方向、批次抽样和学习率固定,同一初值可重放”决定接受、修正或拒绝实验结论
为什么从这个学习任务开始
神经网络页把每个箭头都落实为张量与可检验计算;“会训练”必须能解释梯度从输出层怎样回到参数。 “第2章 神经网络”的贯穿任务是:用一个两层感知器拟合XOR,比较解析梯度与有限差分,并切换过小、合适和过大学习率。 操作前必须写下哪一阶段会先变化,运行后再补理由不算预测。
本页围绕“怎样从加权和一路追到损失梯度与参数更新,并用数值梯度或下降轨迹反证错误实现?”建立正常、故障与恢复路径。只有“第2章 神经网络”守住“前向计算、目标函数、链式法则、梯度方向、批次抽样和学习率固定,同一初值可重放”并交付网络图、参数初值、前向张量、激活、损失、解析梯度、数值梯度、批次序列、学习率与更新轨迹。,最终图表或指标才构成学习证据。
书目、59个原版层级与重写边界
讲谈社官方书页确认山下隆义《イラストで学ぶ ディープラーニング》于2016年出版、215页、ISBN 9784061538252,并公开8章51个编号小节;中文版书目用于交叉核对张弥译、人民邮电出版社2018年版。覆盖分母计入8个章标题和51个编号小节,共59个原版目录层级。
“第2章 神经网络”未取得原书完整正文,只以权威目录限定范围;中文解释、图示结构、交互、实验、练习与答案均为独立教学重写。本章以经典前馈网络为范围;现代优化器可以做迁移对照,但不能替换原版SGD和学习率坐标。
本页另以技术核对 1、技术核对 2核对技术机制。2016年原版范围、后来项目状态与当前迁移建议分别标注;技术资料能验证机制或工具状态,不能反向证明原书正文采用了本站表述。
原版目录层级与可检验机制
第2章 神经网络
↡神经网络对应原版目录坐标“第2章 神经网络”,在“第2章 神经网络”中用于从阈值单元推进到可训练的多层前馈计算,并受数据、目标、随机性、版本和时间边界约束。原版坐标 1/11。 在“第2章 神经网络”的坐标1中,目录项「第2章 神经网络」用于从阈值单元推进到可训练的多层前馈计算;先锁定条件,再以拓扑、权重、偏置、加权和、激活和预测复核,出现把线性分类能力外推到不可线性分问题时撤回结论。
2.1 神经网络的历史
↡神经网络的历史对应原版目录坐标“2.1 神经网络的历史”,在“第2章 神经网络”中用于从阈值单元推进到可训练的多层前馈计算,并受数据、目标、随机性、版本和时间边界约束。原版坐标 2/11。 目录项「2.1 神经网络的历史」进入“第2章 神经网络”后要回答第2个实验问题:它怎样从阈值单元推进到可训练的多层前馈计算、改变什么状态、由哪些拓扑、权重、偏置、加权和、激活和预测证明,并如何排除把线性分类能力外推到不可线性分问题。
2.2 M-P模型
↡M-P模型对应原版目录坐标“2.2 M-P模型”,在“第2章 神经网络”中用于从阈值单元推进到可训练的多层前馈计算,并受数据、目标、随机性、版本和时间边界约束。原版坐标 3/11。 围绕“怎样从加权和一路追到损失梯度与参数更新,并用数值梯度或下降轨迹反证错误实现?”,原版层级3把「2.2 M-P模型」解释为从阈值单元推进到可训练的多层前馈计算;复核者先读取拓扑、权重、偏置、加权和、激活和预测,不能接受把线性分类能力外推到不可线性分问题。
2.3 感知器
↡感知器对应原版目录坐标“2.3 感知器”,在“第2章 神经网络”中用于从阈值单元推进到可训练的多层前馈计算,并受数据、目标、随机性、版本和时间边界约束。原版坐标 4/11。 对“第2章 神经网络”而言,目录项「2.3 感知器」的最小合同是从阈值单元推进到可训练的多层前馈计算,第4次检查保存拓扑、权重、偏置、加权和、激活和预测;若产生把线性分类能力外推到不可线性分问题,就返回上游重放。
2.4 多层感知器
↡多层感知器对应原版目录坐标“2.4 多层感知器”,在“第2章 神经网络”中用于从阈值单元推进到可训练的多层前馈计算,并受数据、目标、随机性、版本和时间边界约束。原版坐标 5/11。 第5个正式坐标「2.4 多层感知器」服务于覆盖M-P模型、感知器、多层感知器、反向传播、误差与激活、似然、SGD和学习率,需要以拓扑、权重、偏置、加权和、激活和预测呈现从阈值单元推进到可训练的多层前馈计算;把线性分类能力外推到不可线性分问题会破坏“前向计算、目标函数、链式法则、梯度方向、批次抽样和学习率固定,同一初值可重放”。
2.5 误差反向传播算法
↡误差反向传播算法对应原版目录坐标“2.5 误差反向传播算法”,在“第2章 神经网络”中用于用目标函数和链式法则产生参数更新,并受数据、目标、随机性、版本和时间边界约束。原版坐标 6/11。 学习者在“第2章 神经网络”中讨论目录项「2.5 误差反向传播算法」前预测用目标函数和链式法则产生参数更新会改变哪项张量或状态,再读取前向值、损失、导数、批次、梯度检查和更新轨迹;观察到损失下降掩盖导数符号或尺度错误时保留失败轨迹。
2.6 误差函数和激活函数
↡误差函数和激活函数对应原版目录坐标“2.6 误差函数和激活函数”,在“第2章 神经网络”中用于用目标函数和链式法则产生参数更新,并受数据、目标、随机性、版本和时间边界约束。原版坐标 7/11。 在“第2章 神经网络”的坐标7中,目录项「2.6 误差函数和激活函数」用于用目标函数和链式法则产生参数更新;先锁定条件,再以前向值、损失、导数、批次、梯度检查和更新轨迹复核,出现损失下降掩盖导数符号或尺度错误时撤回结论。
2.7 似然函数
↡似然函数对应原版目录坐标“2.7 似然函数”,在“第2章 神经网络”中用于用目标函数和链式法则产生参数更新,并受数据、目标、随机性、版本和时间边界约束。原版坐标 8/11。 目录项「2.7 似然函数」进入“第2章 神经网络”后要回答第8个实验问题:它怎样用目标函数和链式法则产生参数更新、改变什么状态、由哪些前向值、损失、导数、批次、梯度检查和更新轨迹证明,并如何排除损失下降掩盖导数符号或尺度错误。
2.8 随机梯度下降法
↡随机梯度下降法对应原版目录坐标“2.8 随机梯度下降法”,在“第2章 神经网络”中用于用目标函数和链式法则产生参数更新,并受数据、目标、随机性、版本和时间边界约束。原版坐标 9/11。 围绕“怎样从加权和一路追到损失梯度与参数更新,并用数值梯度或下降轨迹反证错误实现?”,原版层级9把「2.8 随机梯度下降法」解释为用目标函数和链式法则产生参数更新;复核者先读取前向值、损失、导数、批次、梯度检查和更新轨迹,不能接受损失下降掩盖导数符号或尺度错误。
2.9 学习率
↡学习率对应原版目录坐标“2.9 学习率”,在“第2章 神经网络”中用于用目标函数和链式法则产生参数更新,并受数据、目标、随机性、版本和时间边界约束。原版坐标 10/11。 对“第2章 神经网络”而言,目录项「2.9 学习率」的最小合同是用目标函数和链式法则产生参数更新,第10次检查保存前向值、损失、导数、批次、梯度检查和更新轨迹;若产生损失下降掩盖导数符号或尺度错误,就返回上游重放。
2.10 小结
↡小结对应原版目录坐标“2.10 小结”,在“第2章 神经网络”中用于把本章概念压缩为可重放的输入、操作、输出和证据合同,并受数据、目标、随机性、版本和时间边界约束。原版坐标 11/11。 第11个正式坐标「2.10 小结」服务于覆盖M-P模型、感知器、多层感知器、反向传播、误差与激活、似然、SGD和学习率,需要以概念清单、关键不变量、单一故障、实验工件和复核结论呈现把本章概念压缩为可重放的输入、操作、输出和证据合同;只复述名词而没有实验验收会破坏“前向计算、目标函数、链式法则、梯度方向、批次抽样和学习率固定,同一初值可重放”。
先预测,再操作三个章专属实验
1. 五阶段信号路径
固定“用一个两层感知器拟合XOR,比较解析梯度与有限差分,并切换过小、合适和过大学习率。”,在基线与边界反例间切换,逐一查看“输入、加权和、激活、损失、梯度与更新”的输入、操作、输出与复核证据。
信号路径
固定场景,逐层核对输入与输出
怎样从加权和一路追到损失梯度与参数更新,并用数值梯度或下降轨迹反证错误实现?
固定条件
用一个两层感知器拟合XOR,比较解析梯度与有限差分,并切换过小、合适和过大学习率。 固定数据、代码、依赖、初值与随机种子。
操作前预测:沿“输入 → 加权和 → 激活 → 损失 → 梯度与更新”得到满足“前向计算、目标函数、链式法则、梯度方向、批次抽样和学习率固定,同一初值可重放”的完整证据。
输入
第2章 神经网络:冻结的样本、任务或上游张量
操作
登记形状、版本和边界,并守住“前向计算、目标函数、链式法则、梯度方向、批次抽样和学习率固定,同一初值可重放”
输出
可追踪输入
复核证据
数据卡、哈希与形状;出现“激活导数或损失符号写反,训练日志仍下降一小段便误判反向传播正确”时保留失败记录
原版坐标:第2章 神经网络、2.1 神经网络的历史、2.2 M-P模型、2.3 感知器、2.4 多层感知器、2.5 误差反向传播算法、2.6 误差函数和激活函数、2.7 似然函数、2.8 随机梯度下降法、2.9 学习率、2.10 小结
第2章 神经网络的可重放实验协议
| 阶段 | 学习动作 | 必留证据 | 拒绝条件 |
|---|---|---|---|
| 输入 | 在“第2章 神经网络”执行输入,一次只改变声明变量 | 任务、数据切分、版本与输入形状 | 输入或数据边界不可追溯 |
| 加权和 | 在“第2章 神经网络”执行加权和,一次只改变声明变量 | 中间张量、参数、目标、梯度或采样状态 | 激活导数或损失符号写反,训练日志仍下降一小段便误判反向传播正确 |
| 激活 | 在“第2章 神经网络”执行激活,一次只改变声明变量 | 中间张量、参数、目标、梯度或采样状态 | 激活导数或损失符号写反,训练日志仍下降一小段便误判反向传播正确 |
| 损失 | 在“第2章 神经网络”执行损失,一次只改变声明变量 | 中间张量、参数、目标、梯度或采样状态 | 激活导数或损失符号写反,训练日志仍下降一小段便误判反向传播正确 |
| 梯度与更新 | 在“第2章 神经网络”执行梯度与更新,一次只改变声明变量 | 留出指标、反例、环境与时间标签 | 无法独立重放或解释失败 |
unit: "idl-02"
question: "怎样从加权和一路追到损失梯度与参数更新,并用数值梯度或下降轨迹反证错误实现?"
scenario: "用一个两层感知器拟合XOR,比较解析梯度与有限差分,并切换过小、合适和过大学习率。"
stages: ["输入", "加权和", "激活", "损失", "梯度与更新"]
invariant: "前向计算、目标函数、链式法则、梯度方向、批次抽样和学习率固定,同一初值可重放"
fault: "激活导数或损失符号写反,训练日志仍下降一小段便误判反向传播正确"
evidence: "网络图、参数初值、前向张量、激活、损失、解析梯度、数值梯度、批次序列、学习率与更新轨迹。"
reset: restore_scenario_stage_trace_mode_step_gates_and_artifact该协议要求“第2章 神经网络”在相同任务、数据、代码、环境、初值与种子下重放。重置后若场景、阶段、轨迹模式、步骤、发布门或证据显示没有回到基线,交互状态已经污染比较,不能作为实验结论。
本页回顾
掌握“第2章 神经网络”不是记住框架或名词,而是能围绕“怎样从加权和一路追到损失梯度与参数更新,并用数值梯度或下降轨迹反证错误实现?”重建输入、计算与证据,并用“前向计算、目标函数、链式法则、梯度方向、批次抽样和学习率固定,同一初值可重放”拒绝“激活导数或损失符号写反,训练日志仍下降一小段便误判反向传播正确”。最终交付为网络图、参数初值、前向张量、激活、损失、解析梯度、数值梯度、批次序列、学习率与更新轨迹。
练习与答案
练习
- 问题 1:实验合同。 “第2章 神经网络”为什么必须先冻结任务、数据、代码、环境、参数初值与随机种子?
- 问题 2:目录逐项覆盖。 怎样证明原版目录坐标已经进入机制、交互和练习?
- 问题 3:故障恢复。 怎样证明“激活导数或损失符号写反,训练日志仍下降一小段便误判反向传播正确”已经被修正?
名词解释
名词解释
本章出现的专业名词,用大白话再讲一遍。
- 神经网络
对应“第2章 神经网络”;在“第2章 神经网络”中用于从阈值单元推进到可训练的多层前馈计算,需要连接原版范围、实验状态与时间边界。
- 神经网络的历史
对应“2.1 神经网络的历史”;在“第2章 神经网络”中用于从阈值单元推进到可训练的多层前馈计算,需要连接原版范围、实验状态与时间边界。
- M-P模型
对应“2.2 M-P模型”;在“第2章 神经网络”中用于从阈值单元推进到可训练的多层前馈计算,需要连接原版范围、实验状态与时间边界。
- 感知器
对应“2.3 感知器”;在“第2章 神经网络”中用于从阈值单元推进到可训练的多层前馈计算,需要连接原版范围、实验状态与时间边界。
- 多层感知器
对应“2.4 多层感知器”;在“第2章 神经网络”中用于从阈值单元推进到可训练的多层前馈计算,需要连接原版范围、实验状态与时间边界。
- 误差反向传播算法
对应“2.5 误差反向传播算法”;在“第2章 神经网络”中用于用目标函数和链式法则产生参数更新,需要连接原版范围、实验状态与时间边界。
- 误差函数和激活函数
对应“2.6 误差函数和激活函数”;在“第2章 神经网络”中用于用目标函数和链式法则产生参数更新,需要连接原版范围、实验状态与时间边界。
- 似然函数
对应“2.7 似然函数”;在“第2章 神经网络”中用于用目标函数和链式法则产生参数更新,需要连接原版范围、实验状态与时间边界。
- 随机梯度下降法
对应“2.8 随机梯度下降法”;在“第2章 神经网络”中用于用目标函数和链式法则产生参数更新,需要连接原版范围、实验状态与时间边界。
- 学习率
对应“2.9 学习率”;在“第2章 神经网络”中用于用目标函数和链式法则产生参数更新,需要连接原版范围、实验状态与时间边界。
- 小结
对应“2.10 小结”;在“第2章 神经网络”中用于把本章概念压缩为可重放的输入、操作、输出和证据合同,需要连接原版范围、实验状态与时间边界。