第6章 与学习相关的技巧

覆盖SGD/Momentum/AdaGrad/Adam、初始化、BatchNorm、权值衰减、Dropout与超参数验证;用张量路径、单故障梯度轨迹和训练验收门完成独立复核。

学习目标

  • 能说明“第6章 与学习相关的技巧”如何覆盖SGD/Momentum/AdaGrad/Adam、初始化、BatchNorm、权值衰减、Dropout与超参数验证,并区分2016年原版、2018年中文译本与当前扩展
  • 能先预测“怎样在相同初值和数据顺序下比较训练技巧,并用验证集而不是测试集选择超参数?”“第6章 与学习相关的技巧”会改变哪个数组、缓存、梯度或训练状态,再用shape与数值断言逐步复核
  • 能注入“不同优化器使用不同种子/数据顺序,或读取测试结果选择超参数”,用“初始化、batch顺序、学习率、优化器状态、归一统计、正则、训练/推理模式和验证协议固定”决定接受、降级或拒绝实现结论

为什么从这个实现问题开始

学习技巧页把每项技巧视为受控实验,不能用不公平的终点精度比较。 “第6章 与学习相关的技巧”的贯穿任务是:在同一MNIST子集上对照优化器、初始化、BatchNorm、Dropout和权值衰减。 动手前先写下哪个输入、shape、缓存、梯度、参数或指标会变化;运行后补理由不算预测。

围绕“怎样在相同初值和数据顺序下比较训练技巧,并用验证集而不是测试集选择超参数?”“第6章 与学习相关的技巧”建立参考、故障与恢复路径。只有它守住“初始化、batch顺序、学习率、优化器状态、归一统计、正则、训练/推理模式和验证协议固定”并交付共同初值、batch序列、优化器状态、激活直方图、running统计、mask、正则项、训练/验证曲线和测试封条。,代码、图形或指标才构成从零实现证据。

书目、211个原版层级与版本边界

“第6章 与学习相关的技巧”以O’Reilly Japan原版官方书页核对斋藤康毅著《ゼロから作るDeep Learning》于2016年9月24日出版、320页、ISBN 9784873117584,并以出版社完整目录逐项统计8个章标题、202个编号节/小节与附录A,共211个正式目录层级。出版社官方代码仓库提供可运行示例,官方勘误用于识别已知错误。

本项目没有取得原书完整正文授权,只以官方完整目录、示例代码和勘误限定范围;中文解释、代码实验、交互、练习与答案均为独立教学重写。O’Reilly中文在线书目只用于核对陆宇杰译、人民邮电出版社2018年7月、ISBN 9787115485588和中文目录,不用来证明日文原版正文。“第6章 与学习相关的技巧”以2016年日文原版与2018年中文译本目录为内容边界;当前Python/NumPy兼容修正、自动微分框架和后续架构只作带时间标签的独立核验。

本页另以技术核对 1技术核对 2技术核对 3核对算法定义、实现语义或数值诊断。外部资料能验证技术事实,不能反向证明原书采用了本站表述。

原版目录层级与实现机制

第6章 与学习相关的技巧

原版坐标 1/27。 在“第6章 与学习相关的技巧”的坐标1中,目录项「第6章 与学习相关的技巧」用于以损失、数值微分和更新构造可检查训练循环;先冻结环境与shape,再以数据角色、batch索引、损失、差分步长、梯度、学习率与曲线复核,出现测试泄漏或不稳定数值梯度被当作基准时撤回结论。

6.1 参数的更新

原版坐标 2/27。 目录项「6·1 参数的更新」进入“第6章 与学习相关的技巧”后要回答第2个实现问题:它怎样在共同基线上比较优化、初始化、归一和正则策略、改变哪个数组或训练状态、由哪些共同初值、batch顺序、优化器状态、激活分布、running统计、mask和验证曲线证明,并如何排除不公平基线或读取测试结果选择策略。

6.1.1 探险家的故事

原版坐标 3/27。 围绕“怎样在相同初值和数据顺序下比较训练技巧,并用验证集而不是测试集选择超参数?”“第6章 与学习相关的技巧”在原版层级3把「6·1·1 探险家的故事」落实为把目录坐标转为有代码、形状、梯度、训练和评估的实现合同;复核者先读取环境、输入输出、张量shape、缓存、梯度、训练轨迹、反例和时间边界,不能接受只复述代码或模型名称。

6.1.2 SGD

原版坐标 4/27。 对“第6章 与学习相关的技巧”而言,目录项「6·1·2 SGD」的最小实现合同是在共同基线上比较优化、初始化、归一和正则策略,第4次检查保存共同初值、batch顺序、优化器状态、激活分布、running统计、mask和验证曲线;若产生不公平基线或读取测试结果选择策略,就返回上一步。

6.1.3 SGD的缺点

原版坐标 5/27。 第5个正式坐标「6·1·3 SGD的缺点」服务于覆盖SGD/Momentum/AdaGrad/Adam、初始化、BatchNorm、权值衰减、Dropout与超参数验证,需要以共同初值、batch顺序、优化器状态、激活分布、running统计、mask和验证曲线呈现在共同基线上比较优化、初始化、归一和正则策略;不公平基线或读取测试结果选择策略会破坏“初始化、batch顺序、学习率、优化器状态、归一统计、正则、训练/推理模式和验证协议固定”。

6.1.4 Momentum

原版坐标 6/27。 在“第6章 与学习相关的技巧”的坐标6中,目录项「6·1·4 Momentum」用于在共同基线上比较优化、初始化、归一和正则策略;先冻结环境与shape,再以共同初值、batch顺序、优化器状态、激活分布、running统计、mask和验证曲线复核,出现不公平基线或读取测试结果选择策略时撤回结论。

6.1.5 AdaGrad

原版坐标 7/27。 目录项「6·1·5 AdaGrad」进入“第6章 与学习相关的技巧”后要回答第7个实现问题:它怎样在共同基线上比较优化、初始化、归一和正则策略、改变哪个数组或训练状态、由哪些共同初值、batch顺序、优化器状态、激活分布、running统计、mask和验证曲线证明,并如何排除不公平基线或读取测试结果选择策略。

6.1.6 Adam

原版坐标 8/27。 围绕“怎样在相同初值和数据顺序下比较训练技巧,并用验证集而不是测试集选择超参数?”“第6章 与学习相关的技巧”在原版层级8把「6·1·6 Adam」落实为在共同基线上比较优化、初始化、归一和正则策略;复核者先读取共同初值、batch顺序、优化器状态、激活分布、running统计、mask和验证曲线,不能接受不公平基线或读取测试结果选择策略。

6.1.7 使用哪种更新方法

原版坐标 9/27。 对“第6章 与学习相关的技巧”而言,目录项「6·1·7 使用哪种更新方法」的最小实现合同是把目录坐标转为有代码、形状、梯度、训练和评估的实现合同,第9次检查保存环境、输入输出、张量shape、缓存、梯度、训练轨迹、反例和时间边界;若产生只复述代码或模型名称,就返回上一步。

6.1.8 基于MNIST数据集的更新方法比较

原版坐标 10/27。 第10个正式坐标「6·1·8 基于MNIST数据集的更新方法比较」服务于覆盖SGD/Momentum/AdaGrad/Adam、初始化、BatchNorm、权值衰减、Dropout与超参数验证,需要以输入/权重/偏置shape、中间缓存、激活范围、概率和与批对照呈现沿张量形状执行仿射、激活、稳定输出与批量推理;矩阵轴错位、softmax溢出或批语义漂移会破坏“初始化、batch顺序、学习率、优化器状态、归一统计、正则、训练/推理模式和验证协议固定”。

6.2 权重的初始值

原版坐标 11/27。 在“第6章 与学习相关的技巧”的坐标11中,目录项「6·2 权重的初始值」用于在共同基线上比较优化、初始化、归一和正则策略;先冻结环境与shape,再以共同初值、batch顺序、优化器状态、激活分布、running统计、mask和验证曲线复核,出现不公平基线或读取测试结果选择策略时撤回结论。

6.2.1 可以将权重初始值设为0吗

原版坐标 12/27。 目录项「6·2·1 可以将权重初始值设为0吗」进入“第6章 与学习相关的技巧”后要回答第12个实现问题:它怎样在共同基线上比较优化、初始化、归一和正则策略、改变哪个数组或训练状态、由哪些共同初值、batch顺序、优化器状态、激活分布、running统计、mask和验证曲线证明,并如何排除不公平基线或读取测试结果选择策略。

6.2.2 隐藏层激活值的分布

原版坐标 13/27。 围绕“怎样在相同初值和数据顺序下比较训练技巧,并用验证集而不是测试集选择超参数?”“第6章 与学习相关的技巧”在原版层级13把「6·2·2 隐藏层激活值的分布」落实为沿张量形状执行仿射、激活、稳定输出与批量推理;复核者先读取输入/权重/偏置shape、中间缓存、激活范围、概率和与批对照,不能接受矩阵轴错位、softmax溢出或批语义漂移。

6.2.3 ReLU的权重初始值

原版坐标 14/27。 对“第6章 与学习相关的技巧”而言,目录项「6·2·3 ReLU的权重初始值」的最小实现合同是沿张量形状执行仿射、激活、稳定输出与批量推理,第14次检查保存输入/权重/偏置shape、中间缓存、激活范围、概率和与批对照;若产生矩阵轴错位、softmax溢出或批语义漂移,就返回上一步。

6.2.4 基于MNIST数据集的权重初始值比较

原版坐标 15/27。 第15个正式坐标「6·2·4 基于MNIST数据集的权重初始值比较」服务于覆盖SGD/Momentum/AdaGrad/Adam、初始化、BatchNorm、权值衰减、Dropout与超参数验证,需要以输入/权重/偏置shape、中间缓存、激活范围、概率和与批对照呈现沿张量形状执行仿射、激活、稳定输出与批量推理;矩阵轴错位、softmax溢出或批语义漂移会破坏“初始化、batch顺序、学习率、优化器状态、归一统计、正则、训练/推理模式和验证协议固定”。

6.3 Batch Normalization

原版坐标 16/27。 在“第6章 与学习相关的技巧”的坐标16中,目录项「6·3 Batch Normalization」用于在共同基线上比较优化、初始化、归一和正则策略;先冻结环境与shape,再以共同初值、batch顺序、优化器状态、激活分布、running统计、mask和验证曲线复核,出现不公平基线或读取测试结果选择策略时撤回结论。

6.3.1 Batch Normalization的算法

原版坐标 17/27。 目录项「6·3·1 Batch Normalization的算法」进入“第6章 与学习相关的技巧”后要回答第17个实现问题:它怎样在共同基线上比较优化、初始化、归一和正则策略、改变哪个数组或训练状态、由哪些共同初值、batch顺序、优化器状态、激活分布、running统计、mask和验证曲线证明,并如何排除不公平基线或读取测试结果选择策略。

6.3.2 Batch Normalization的评估

原版坐标 18/27。 围绕“怎样在相同初值和数据顺序下比较训练技巧,并用验证集而不是测试集选择超参数?”“第6章 与学习相关的技巧”在原版层级18把「6·3·2 Batch Normalization的评估」落实为在共同基线上比较优化、初始化、归一和正则策略;复核者先读取共同初值、batch顺序、优化器状态、激活分布、running统计、mask和验证曲线,不能接受不公平基线或读取测试结果选择策略。

6.4 正则化

原版坐标 19/27。 对“第6章 与学习相关的技巧”而言,目录项「6·4 正则化」的最小实现合同是在共同基线上比较优化、初始化、归一和正则策略,第19次检查保存共同初值、batch顺序、优化器状态、激活分布、running统计、mask和验证曲线;若产生不公平基线或读取测试结果选择策略,就返回上一步。

6.4.1 过拟合

原版坐标 20/27。 第20个正式坐标「6·4·1 过拟合」服务于覆盖SGD/Momentum/AdaGrad/Adam、初始化、BatchNorm、权值衰减、Dropout与超参数验证,需要以共同初值、batch顺序、优化器状态、激活分布、running统计、mask和验证曲线呈现在共同基线上比较优化、初始化、归一和正则策略;不公平基线或读取测试结果选择策略会破坏“初始化、batch顺序、学习率、优化器状态、归一统计、正则、训练/推理模式和验证协议固定”。

6.4.2 权值衰减

原版坐标 21/27。 在“第6章 与学习相关的技巧”的坐标21中,目录项「6·4·2 权值衰减」用于在共同基线上比较优化、初始化、归一和正则策略;先冻结环境与shape,再以共同初值、batch顺序、优化器状态、激活分布、running统计、mask和验证曲线复核,出现不公平基线或读取测试结果选择策略时撤回结论。

6.4.3 Dropout

原版坐标 22/27。 目录项「6·4·3 Dropout」进入“第6章 与学习相关的技巧”后要回答第22个实现问题:它怎样在共同基线上比较优化、初始化、归一和正则策略、改变哪个数组或训练状态、由哪些共同初值、batch顺序、优化器状态、激活分布、running统计、mask和验证曲线证明,并如何排除不公平基线或读取测试结果选择策略。

6.5 超参数的验证

原版坐标 23/27。 围绕“怎样在相同初值和数据顺序下比较训练技巧,并用验证集而不是测试集选择超参数?”“第6章 与学习相关的技巧”在原版层级23把「6·5 超参数的验证」落实为在共同基线上比较优化、初始化、归一和正则策略;复核者先读取共同初值、batch顺序、优化器状态、激活分布、running统计、mask和验证曲线,不能接受不公平基线或读取测试结果选择策略。

6.5.1 验证数据

原版坐标 24/27。 对“第6章 与学习相关的技巧”而言,目录项「6·5·1 验证数据」的最小实现合同是在共同基线上比较优化、初始化、归一和正则策略,第24次检查保存共同初值、batch顺序、优化器状态、激活分布、running统计、mask和验证曲线;若产生不公平基线或读取测试结果选择策略,就返回上一步。

6.5.2 超参数的最优化

原版坐标 25/27。 第25个正式坐标「6·5·2 超参数的最优化」服务于覆盖SGD/Momentum/AdaGrad/Adam、初始化、BatchNorm、权值衰减、Dropout与超参数验证,需要以共同初值、batch顺序、优化器状态、激活分布、running统计、mask和验证曲线呈现在共同基线上比较优化、初始化、归一和正则策略;不公平基线或读取测试结果选择策略会破坏“初始化、batch顺序、学习率、优化器状态、归一统计、正则、训练/推理模式和验证协议固定”。

6.5.3 超参数最优化的实现

原版坐标 26/27。 在“第6章 与学习相关的技巧”的坐标26中,目录项「6·5·3 超参数最优化的实现」用于在共同基线上比较优化、初始化、归一和正则策略;先冻结环境与shape,再以共同初值、batch顺序、优化器状态、激活分布、running统计、mask和验证曲线复核,出现不公平基线或读取测试结果选择策略时撤回结论。

6.6 小结

原版坐标 27/27。 目录项「6·6 小结」进入“第6章 与学习相关的技巧”后要回答第27个实现问题:它怎样复核Softmax-with-Loss的稳定正向和批量反向、改变哪个数组或训练状态、由哪些logit/标签shape、稳定平移、概率、损失归约、反向梯度与差分误差证明,并如何排除标签编码或batch归约错误。

先预测,再操作三个章专属实现实验

分步1 / 3

1. 张量、算子与程序状态

固定“在同一MNIST子集上对照优化器、初始化、BatchNorm、Dropout和权值衰减。”,在参考与反例间切换,逐阶段查看“复制共同基线、更新参数、检查激活分布、切换正则模式、验证超参数”的输入、代码动作、输出和shape检查。

张量信号路径

选择运行情形,逐步核对形状、算子与输出

怎样在相同初值和数据顺序下比较训练技巧,并用验证集而不是测试集选择超参数?

输入设置

在同一MNIST子集上对照优化器、初始化、BatchNorm、Dropout和权值衰减。 固定环境、数据、shape、初值、顺序、容差和种子。

事前预测

沿“复制共同基线 → 更新参数 → 检查激活分布 → 切换正则模式 → 验证超参数”得到可复核实现结果。

适用边界

全过程必须满足“初始化、batch顺序、学习率、优化器状态、归一统计、正则、训练/推理模式和验证协议固定”。

输入张量或程序状态

第6章 与学习相关的技巧:锁定解释器、依赖、输入与数据角色,保持其余实现合同不变

本步算子或代码动作

冻结版本、dtype、shape、轴、种子和允许读取的信息,并持续满足“初始化、batch顺序、学习率、优化器状态、归一统计、正则、训练/推理模式和验证协议固定”

输出张量或训练状态

复制共同基线产生可追溯输入状态

形状、梯度与数值检查

可追溯输入状态、shape与数值断言;出现“不同优化器使用不同种子/数据顺序,或读取测试结果选择超参数”时停止

原版坐标:第6章 与学习相关的技巧、6.1 参数的更新、6.1.1 探险家的故事、6.1.2 SGD、6.1.3 SGD的缺点、6.1.4 Momentum、6.1.5 AdaGrad、6.1.6 Adam、6.1.7 使用哪种更新方法、6.1.8 基于MNIST数据集的更新方法比较、6.2 权重的初始值、6.2.1 可以将权重初始值设为0吗、6.2.2 隐藏层激活值的分布、6.2.3 ReLU的权重初始值、6.2.4 基于MNIST数据集的权重初始值比较、6.3 Batch Normalization、6.3.1 Batch Normalization的算法、6.3.2 Batch Normalization的评估、6.4 正则化、6.4.1 过拟合、6.4.2 权值衰减、6.4.3 Dropout、6.5 超参数的验证、6.5.1 验证数据、6.5.2 超参数的最优化、6.5.3 超参数最优化的实现、6.6 小结

第6章 与学习相关的技巧的可重放实现协议

阶段允许动作必留证据拒绝条件
复制共同基线在“第6章 与学习相关的技巧”执行复制共同基线,只改变声明的代码、数组或训练状态环境、输入、dtype/shape、数据角色与版本环境或shape不可追溯
更新参数在“第6章 与学习相关的技巧”执行更新参数,只改变声明的代码、数组或训练状态层、参数、缓存、梯度、优化器状态与输出不同优化器使用不同种子/数据顺序,或读取测试结果选择超参数
检查激活分布在“第6章 与学习相关的技巧”执行检查激活分布,只改变声明的代码、数组或训练状态层、参数、缓存、梯度、优化器状态与输出不同优化器使用不同种子/数据顺序,或读取测试结果选择超参数
切换正则模式在“第6章 与学习相关的技巧”执行切换正则模式,只改变声明的代码、数组或训练状态层、参数、缓存、梯度、优化器状态与输出不同优化器使用不同种子/数据顺序,或读取测试结果选择超参数
验证超参数在“第6章 与学习相关的技巧”执行验证超参数,只改变声明的代码、数组或训练状态梯度误差、曲线、独立评估、反例与复现无法重放或缺少独立测试
unit: "dls-06"
question: "怎样在相同初值和数据顺序下比较训练技巧,并用验证集而不是测试集选择超参数?"
scenario: "在同一MNIST子集上对照优化器、初始化、BatchNorm、Dropout和权值衰减。"
stages:
  ["复制共同基线", "更新参数", "检查激活分布", "切换正则模式", "验证超参数"]
invariant: "初始化、batch顺序、学习率、优化器状态、归一统计、正则、训练/推理模式和验证协议固定"
fault: "不同优化器使用不同种子/数据顺序,或读取测试结果选择超参数"
evidence: "共同初值、batch序列、优化器状态、激活直方图、running统计、mask、正则项、训练/验证曲线和测试封条。"
reset: restore_case_stage_trace_mode_step_gates_and_artifact

该协议要求“第6章 与学习相关的技巧”在相同环境、数据角色、dtype/shape、初值、顺序、容差和种子下重放。重置后若案例、阶段、轨迹模式、步骤、训练门或证据包没有回到基线,交互状态已经污染比较。

本页回顾

掌握“第6章 与学习相关的技巧”不是背诵代码或API,而是能围绕“怎样在相同初值和数据顺序下比较训练技巧,并用验证集而不是测试集选择超参数?”重建环境、shape、前向、梯度、训练与评估证据,并用“初始化、batch顺序、学习率、优化器状态、归一统计、正则、训练/推理模式和验证协议固定”拒绝“不同优化器使用不同种子/数据顺序,或读取测试结果选择超参数”。最终交付为共同初值、batch序列、优化器状态、激活直方图、running统计、mask、正则项、训练/验证曲线和测试封条。

练习与答案

练习

  1. 问题 1:实现合同。 “第6章 与学习相关的技巧”为什么必须先冻结环境、数据角色、dtype/shape、初值、顺序、容差和种子?
  1. 问题 2:目录逐项覆盖。 怎样证明原版目录坐标已经进入机制、交互和练习?
  1. 问题 3:故障恢复。 怎样证明“不同优化器使用不同种子/数据顺序,或读取测试结果选择超参数”已经被修正?

名词解释

名词解释

本章出现的专业名词,用大白话再讲一遍。

与学习相关的技巧

检索键 dls-A 对应目录坐标「第6章 与学习相关的技巧」;在“第6章 与学习相关的技巧”中用于以损失、数值微分和更新构造可检查训练循环,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

参数的更新

检索键 dls-B 对应目录坐标「6·1 参数的更新」;在“第6章 与学习相关的技巧”中用于在共同基线上比较优化、初始化、归一和正则策略,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

探险家的故事

检索键 dls-C 对应目录坐标「6·1·1 探险家的故事」;在“第6章 与学习相关的技巧”中用于把目录坐标转为有代码、形状、梯度、训练和评估的实现合同,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

SGD

检索键 dls-D 对应目录坐标「6·1·2 SGD」;在“第6章 与学习相关的技巧”中用于在共同基线上比较优化、初始化、归一和正则策略,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

SGD的缺点

检索键 dls-E 对应目录坐标「6·1·3 SGD的缺点」;在“第6章 与学习相关的技巧”中用于在共同基线上比较优化、初始化、归一和正则策略,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

Momentum

检索键 dls-F 对应目录坐标「6·1·4 Momentum」;在“第6章 与学习相关的技巧”中用于在共同基线上比较优化、初始化、归一和正则策略,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

AdaGrad

检索键 dls-G 对应目录坐标「6·1·5 AdaGrad」;在“第6章 与学习相关的技巧”中用于在共同基线上比较优化、初始化、归一和正则策略,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

Adam

检索键 dls-H 对应目录坐标「6·1·6 Adam」;在“第6章 与学习相关的技巧”中用于在共同基线上比较优化、初始化、归一和正则策略,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

使用哪种更新方法

检索键 dls-I 对应目录坐标「6·1·7 使用哪种更新方法」;在“第6章 与学习相关的技巧”中用于把目录坐标转为有代码、形状、梯度、训练和评估的实现合同,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

基于MNIST数据集的更新方法比较

检索键 dls-J 对应目录坐标「6·1·8 基于MNIST数据集的更新方法比较」;在“第6章 与学习相关的技巧”中用于沿张量形状执行仿射、激活、稳定输出与批量推理,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

权重的初始值

检索键 dls-K 对应目录坐标「6·2 权重的初始值」;在“第6章 与学习相关的技巧”中用于在共同基线上比较优化、初始化、归一和正则策略,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

可以将权重初始值设为0吗

检索键 dls-L 对应目录坐标「6·2·1 可以将权重初始值设为0吗」;在“第6章 与学习相关的技巧”中用于在共同基线上比较优化、初始化、归一和正则策略,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

隐藏层激活值的分布

检索键 dls-M 对应目录坐标「6·2·2 隐藏层激活值的分布」;在“第6章 与学习相关的技巧”中用于沿张量形状执行仿射、激活、稳定输出与批量推理,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

ReLU的权重初始值

检索键 dls-N 对应目录坐标「6·2·3 ReLU的权重初始值」;在“第6章 与学习相关的技巧”中用于沿张量形状执行仿射、激活、稳定输出与批量推理,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

基于MNIST数据集的权重初始值比较

检索键 dls-O 对应目录坐标「6·2·4 基于MNIST数据集的权重初始值比较」;在“第6章 与学习相关的技巧”中用于沿张量形状执行仿射、激活、稳定输出与批量推理,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

Batch Normalization

检索键 dls-P 对应目录坐标「6·3 Batch Normalization」;在“第6章 与学习相关的技巧”中用于在共同基线上比较优化、初始化、归一和正则策略,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

Batch Normalization的算法

检索键 dls-Q 对应目录坐标「6·3·1 Batch Normalization的算法」;在“第6章 与学习相关的技巧”中用于在共同基线上比较优化、初始化、归一和正则策略,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

Batch Normalization的评估

检索键 dls-R 对应目录坐标「6·3·2 Batch Normalization的评估」;在“第6章 与学习相关的技巧”中用于在共同基线上比较优化、初始化、归一和正则策略,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

正则化

检索键 dls-S 对应目录坐标「6·4 正则化」;在“第6章 与学习相关的技巧”中用于在共同基线上比较优化、初始化、归一和正则策略,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

过拟合

检索键 dls-T 对应目录坐标「6·4·1 过拟合」;在“第6章 与学习相关的技巧”中用于在共同基线上比较优化、初始化、归一和正则策略,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

权值衰减

检索键 dls-U 对应目录坐标「6·4·2 权值衰减」;在“第6章 与学习相关的技巧”中用于在共同基线上比较优化、初始化、归一和正则策略,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

Dropout

检索键 dls-V 对应目录坐标「6·4·3 Dropout」;在“第6章 与学习相关的技巧”中用于在共同基线上比较优化、初始化、归一和正则策略,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

超参数的验证

检索键 dls-W 对应目录坐标「6·5 超参数的验证」;在“第6章 与学习相关的技巧”中用于在共同基线上比较优化、初始化、归一和正则策略,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

验证数据

检索键 dls-X 对应目录坐标「6·5·1 验证数据」;在“第6章 与学习相关的技巧”中用于在共同基线上比较优化、初始化、归一和正则策略,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

超参数的最优化

检索键 dls-Y 对应目录坐标「6·5·2 超参数的最优化」;在“第6章 与学习相关的技巧”中用于在共同基线上比较优化、初始化、归一和正则策略,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

超参数最优化的实现

检索键 dls-Z 对应目录坐标「6·5·3 超参数最优化的实现」;在“第6章 与学习相关的技巧”中用于在共同基线上比较优化、初始化、归一和正则策略,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

小结

检索键 dls-AA 对应目录坐标「6·6 小结」;在“第6章 与学习相关的技巧”中用于复核Softmax-with-Loss的稳定正向和批量反向,需要连接原版范围、代码/shape、梯度轨迹与独立评估证据。

资料与写作方式声明

本章以斋藤康毅著《ゼロから作るDeep Learning》权威目录界定学习范围,并结合正文列出的技术资料独立重写;不宣称复现原书正文,也不沿用原作表述。

原作版权归作者与出版社所有;本站原创教学结构与表述仅供学习交流。

讨论

评论区加载中…