第8章 深度模型中的优化

复核深度模型优化中的病态、鞍点、梯度尺度、初始化和更新算法;用依赖地图、计算轨迹和独立证据门交付梯度—更新账本、状态缓冲与首差诊断报告

学习目标

  • 能说明“第8章 深度模型中的优化”如何复核深度模型优化中的病态、鞍点、梯度尺度、初始化和更新算法,并区分原版、中文目录、开放访问许可和当前独立重写
  • 能先预测“怎样用梯度、步长、动量状态与曲率探针区分优化失败和泛化失败?”会改变哪个输入、shape、状态、目标、梯度、估计或评估结果,再操作三类证据视图
  • 能只注入“不同优化器使用不同随机批次却直接比较收敛曲线”,定位首个偏离“初始化、批次顺序、损失缩放、学习率、状态缓冲和停止条件必须一致”的状态,并从同一快照完成恢复

为什么从这个问题开始

“第8章 深度模型中的优化”围绕“怎样用梯度、步长、动量状态与曲率探针区分优化失败和泛化失败?”建立贯穿任务:在同一初始化与小批次序列上比较优化器。先写下哪个输入、shape、状态、目标、梯度、估计或评估会先变化,再运行参考、故障和恢复路径;运行后补理由不算预测。只有“第8章 深度模型中的优化”守住“初始化、批次顺序、损失缩放、学习率、状态缓冲和停止条件必须一致”并交付梯度—更新账本、状态缓冲与首差诊断报告,最终分数、似然、重构、样本或部署结果才构成机制证据。

书目、353个正式坐标与许可边界

“第8章 深度模型中的优化”以MIT Press书目页核对Ian Goodfellow、Yoshua Bengio、Aaron Courville著 Deep Learning:精装ISBN 9780262035613,2016年11月18日出版,800页;MIT Press同时把作者托管版列为开放访问资源,并标注CC BY-NC-ND 4.0。开放阅读不等于允许演绎,“第8章 深度模型中的优化”不复制、翻译或改写受保护正文,只把原版公开目录与可定位章节用作范围和事实核对。

“第8章 深度模型中的优化”以作者官方目录核对3个部分、20章和164个一级节,再以人民邮电出版社官方中文书页核对166个二级节、中文书名、ISBN 9787115461476和2017年8月出版信息;合计353个正式目录坐标。出版社页面中“有效有效”、缺空格等排版噪声已按英文原版标题规范化,但没有新增原版不存在的章节。

“第8章 深度模型中的优化”的中文讲解、状态图、数值实验、练习与答案均为独立教学重写;2016年以后出现的框架行为或研究进展必须带当前时间标签,不能倒填为原书原话。章专属核对 1章专属核对 2只用于核对本页算法、API或实验边界,不能反向证明原书采用本站表述。

原版目录层级与可验证机制

第8章 深度模型中的优化

正式坐标 1/35。 目录原文键 第8章 深度模型中的优化。在“第8章 深度模型中的优化”的第1个坐标中,「第8章 深度模型中的优化」通过跟踪浮点、梯度、曲率、状态缓冲和参数更新推进优化几何、初始化与更新状态;复核者保存dtype、条件数、梯度核对、步长、更新差与停止理由,一旦出现只看目标下降而忽略数值不稳、状态错位或泛化失败就撤回结论。

8·1 学习和纯优化有何不同

正式坐标 2/35。 目录原文键 8.1 学习和纯优化有何不同。围绕“怎样用梯度、步长、动量状态与曲率探针区分优化失败和泛化失败?”,“第8章 深度模型中的优化”在坐标2把「8·1 学习和纯优化有何不同」落实为跟踪浮点、梯度、曲率、状态缓冲和参数更新;只有dtype、条件数、梯度核对、步长、更新差与停止理由可复算且反例排除只看目标下降而忽略数值不稳、状态错位或泛化失败,本节点才算掌握。

8·1·1 经验风险最小化

正式坐标 3/35。 目录原文键 8.1.1 经验风险最小化。“第8章 深度模型中的优化”的原版节点3「8·1·1 经验风险最小化」不能停在名词解释:它要把“经验风险最小化”放进优化几何、初始化与更新状态的章专属计算链,交付第8章 深度模型中的优化的输入、状态变化、输出、反例与边界,并用只复述“经验风险最小化”名称而没有可观察状态和独立证据作为单一反事实检查。

8·1·2 代理损失函数和提前终止

正式坐标 4/35。 目录原文键 8.1.2 代理损失函数和提前终止。对“第8章 深度模型中的优化”而言,「8·1·2 代理损失函数和提前终止」在第4次检查中改变可观察状态,因为它负责改变有效容量、数据分布或参数约束并验证泛化;单因素消融、学习曲线、容量代理与独立评估必须与“初始化、批次顺序、损失缩放、学习率、状态缓冲和停止条件必须一致”对齐,不能接受同时改变多种正则条件却给单一机制归因。

8·1·3 批量算法和小批量算法

正式坐标 5/35。 目录原文键 8.1.3 批量算法和小批量算法。目录原文「8·1·3 批量算法和小批量算法」进入“第8章 深度模型中的优化”后形成第5个实验合同:先把“批量算法和小批量算法”放进优化几何、初始化与更新状态的章专属计算链,再保存第8章 深度模型中的优化的输入、状态变化、输出、反例与边界;若发生只复述“批量算法和小批量算法”名称而没有可观察状态和独立证据,从同一输入快照恢复。

8·2 神经网络优化中的挑战

正式坐标 6/35。 目录原文键 8.2 神经网络优化中的挑战。在“第8章 深度模型中的优化”的第6个坐标中,「8·2 神经网络优化中的挑战」通过跟踪浮点、梯度、曲率、状态缓冲和参数更新推进优化几何、初始化与更新状态;复核者保存dtype、条件数、梯度核对、步长、更新差与停止理由,一旦出现只看目标下降而忽略数值不稳、状态错位或泛化失败就撤回结论。

8·2·1 病态

正式坐标 7/35。 目录原文键 8.2.1 病态。围绕“怎样用梯度、步长、动量状态与曲率探针区分优化失败和泛化失败?”,“第8章 深度模型中的优化”在坐标7把「8·2·1 病态」落实为跟踪浮点、梯度、曲率、状态缓冲和参数更新;只有dtype、条件数、梯度核对、步长、更新差与停止理由可复算且反例排除只看目标下降而忽略数值不稳、状态错位或泛化失败,本节点才算掌握。

8·2·2 局部极小值

正式坐标 8/35。 目录原文键 8.2.2 局部极小值。“第8章 深度模型中的优化”的原版节点8「8·2·2 局部极小值」不能停在名词解释:它要把“局部极小值”放进优化几何、初始化与更新状态的章专属计算链,交付第8章 深度模型中的优化的输入、状态变化、输出、反例与边界,并用只复述“局部极小值”名称而没有可观察状态和独立证据作为单一反事实检查。

8·2·3 高原、鞍点和其他平坦区域

正式坐标 9/35。 目录原文键 8.2.3 高原、鞍点和其他平坦区域。对“第8章 深度模型中的优化”而言,「8·2·3 高原、鞍点和其他平坦区域」在第9次检查中改变可观察状态,因为它负责把“高原、鞍点和其他平坦区域”放进优化几何、初始化与更新状态的章专属计算链;第8章 深度模型中的优化的输入、状态变化、输出、反例与边界必须与“初始化、批次顺序、损失缩放、学习率、状态缓冲和停止条件必须一致”对齐,不能接受只复述“高原、鞍点和其他平坦区域”名称而没有可观察状态和独立证据。

8·2·4 悬崖和梯度爆炸

正式坐标 10/35。 目录原文键 8.2.4 悬崖和梯度爆炸。目录原文「8·2·4 悬崖和梯度爆炸」进入“第8章 深度模型中的优化”后形成第10个实验合同:先跟踪浮点、梯度、曲率、状态缓冲和参数更新,再保存dtype、条件数、梯度核对、步长、更新差与停止理由;若发生只看目标下降而忽略数值不稳、状态错位或泛化失败,从同一输入快照恢复。

8·2·5 长期依赖

正式坐标 11/35。 目录原文键 8.2.5 长期依赖。在“第8章 深度模型中的优化”的第11个坐标中,「8·2·5 长期依赖」通过沿时间展开状态、输入依赖、门控和梯度传播推进优化几何、初始化与更新状态;复核者保存时间索引、状态、掩码、教师信号、梯度与解码轨迹,一旦出现训练读取未来信息或推断协议与训练不一致就撤回结论。

8·2·6 非精确梯度

正式坐标 12/35。 目录原文键 8.2.6 非精确梯度。围绕“怎样用梯度、步长、动量状态与曲率探针区分优化失败和泛化失败?”,“第8章 深度模型中的优化”在坐标12把「8·2·6 非精确梯度」落实为跟踪浮点、梯度、曲率、状态缓冲和参数更新;只有dtype、条件数、梯度核对、步长、更新差与停止理由可复算且反例排除只看目标下降而忽略数值不稳、状态错位或泛化失败,本节点才算掌握。

8·2·7 局部和全局结构间的弱对应

正式坐标 13/35。 目录原文键 8.2.7 局部和全局结构间的弱对应。“第8章 深度模型中的优化”的原版节点13「8·2·7 局部和全局结构间的弱对应」不能停在名词解释:它要把“局部和全局结构间的弱对应”放进优化几何、初始化与更新状态的章专属计算链,交付第8章 深度模型中的优化的输入、状态变化、输出、反例与边界,并用只复述“局部和全局结构间的弱对应”名称而没有可观察状态和独立证据作为单一反事实检查。

8·2·8 优化的理论限制

正式坐标 14/35。 目录原文键 8.2.8 优化的理论限制。对“第8章 深度模型中的优化”而言,「8·2·8 优化的理论限制」在第14次检查中改变可观察状态,因为它负责跟踪浮点、梯度、曲率、状态缓冲和参数更新;dtype、条件数、梯度核对、步长、更新差与停止理由必须与“初始化、批次顺序、损失缩放、学习率、状态缓冲和停止条件必须一致”对齐,不能接受只看目标下降而忽略数值不稳、状态错位或泛化失败。

8·3 基本算法

正式坐标 15/35。 目录原文键 8.3 基本算法。目录原文「8·3 基本算法」进入“第8章 深度模型中的优化”后形成第15个实验合同:先把“基本算法”放进优化几何、初始化与更新状态的章专属计算链,再保存第8章 深度模型中的优化的输入、状态变化、输出、反例与边界;若发生只复述“基本算法”名称而没有可观察状态和独立证据,从同一输入快照恢复。

8·3·1 随机梯度下降

正式坐标 16/35。 目录原文键 8.3.1 随机梯度下降。在“第8章 深度模型中的优化”的第16个坐标中,「8·3·1 随机梯度下降」通过跟踪浮点、梯度、曲率、状态缓冲和参数更新推进优化几何、初始化与更新状态;复核者保存dtype、条件数、梯度核对、步长、更新差与停止理由,一旦出现只看目标下降而忽略数值不稳、状态错位或泛化失败就撤回结论。

8·3·2 动量

正式坐标 17/35。 目录原文键 8.3.2 动量。围绕“怎样用梯度、步长、动量状态与曲率探针区分优化失败和泛化失败?”,“第8章 深度模型中的优化”在坐标17把「8·3·2 动量」落实为跟踪浮点、梯度、曲率、状态缓冲和参数更新;只有dtype、条件数、梯度核对、步长、更新差与停止理由可复算且反例排除只看目标下降而忽略数值不稳、状态错位或泛化失败,本节点才算掌握。

8·3·3 Nesterov动量

正式坐标 18/35。 目录原文键 8.3.3 Nesterov动量。“第8章 深度模型中的优化”的原版节点18「8·3·3 Nesterov动量」不能停在名词解释:它要跟踪浮点、梯度、曲率、状态缓冲和参数更新,交付dtype、条件数、梯度核对、步长、更新差与停止理由,并用只看目标下降而忽略数值不稳、状态错位或泛化失败作为单一反事实检查。

8·4 参数初始化策略

正式坐标 19/35。 目录原文键 8.4 参数初始化策略。对“第8章 深度模型中的优化”而言,「8·4 参数初始化策略」在第19次检查中改变可观察状态,因为它负责跟踪浮点、梯度、曲率、状态缓冲和参数更新;dtype、条件数、梯度核对、步长、更新差与停止理由必须与“初始化、批次顺序、损失缩放、学习率、状态缓冲和停止条件必须一致”对齐,不能接受只看目标下降而忽略数值不稳、状态错位或泛化失败。

8·5 自适应学习率算法

正式坐标 20/35。 目录原文键 8.5 自适应学习率算法。目录原文「8·5 自适应学习率算法」进入“第8章 深度模型中的优化”后形成第20个实验合同:先跟踪浮点、梯度、曲率、状态缓冲和参数更新,再保存dtype、条件数、梯度核对、步长、更新差与停止理由;若发生只看目标下降而忽略数值不稳、状态错位或泛化失败,从同一输入快照恢复。

8·5·1 AdaGrad

正式坐标 21/35。 目录原文键 8.5.1 AdaGrad。在“第8章 深度模型中的优化”的第21个坐标中,「8·5·1 AdaGrad」通过跟踪浮点、梯度、曲率、状态缓冲和参数更新推进优化几何、初始化与更新状态;复核者保存dtype、条件数、梯度核对、步长、更新差与停止理由,一旦出现只看目标下降而忽略数值不稳、状态错位或泛化失败就撤回结论。

8·5·2 RMSProp

正式坐标 22/35。 目录原文键 8.5.2 RMSProp。围绕“怎样用梯度、步长、动量状态与曲率探针区分优化失败和泛化失败?”,“第8章 深度模型中的优化”在坐标22把「8·5·2 RMSProp」落实为跟踪浮点、梯度、曲率、状态缓冲和参数更新;只有dtype、条件数、梯度核对、步长、更新差与停止理由可复算且反例排除只看目标下降而忽略数值不稳、状态错位或泛化失败,本节点才算掌握。

8·5·3 Adam

正式坐标 23/35。 目录原文键 8.5.3 Adam。“第8章 深度模型中的优化”的原版节点23「8·5·3 Adam」不能停在名词解释:它要跟踪浮点、梯度、曲率、状态缓冲和参数更新,交付dtype、条件数、梯度核对、步长、更新差与停止理由,并用只看目标下降而忽略数值不稳、状态错位或泛化失败作为单一反事实检查。

8·5·4 选择正确的优化算法

正式坐标 24/35。 目录原文键 8.5.4 选择正确的优化算法。对“第8章 深度模型中的优化”而言,「8·5·4 选择正确的优化算法」在第24次检查中改变可观察状态,因为它负责跟踪浮点、梯度、曲率、状态缓冲和参数更新;dtype、条件数、梯度核对、步长、更新差与停止理由必须与“初始化、批次顺序、损失缩放、学习率、状态缓冲和停止条件必须一致”对齐,不能接受只看目标下降而忽略数值不稳、状态错位或泛化失败。

8·6 二阶近似方法

正式坐标 25/35。 目录原文键 8.6 二阶近似方法。目录原文「8·6 二阶近似方法」进入“第8章 深度模型中的优化”后形成第25个实验合同:先把“二阶近似方法”放进优化几何、初始化与更新状态的章专属计算链,再保存第8章 深度模型中的优化的输入、状态变化、输出、反例与边界;若发生只复述“二阶近似方法”名称而没有可观察状态和独立证据,从同一输入快照恢复。

8·6·1 牛顿法

正式坐标 26/35。 目录原文键 8.6.1 牛顿法。在“第8章 深度模型中的优化”的第26个坐标中,「8·6·1 牛顿法」通过把“牛顿法”放进优化几何、初始化与更新状态的章专属计算链推进优化几何、初始化与更新状态;复核者保存第8章 深度模型中的优化的输入、状态变化、输出、反例与边界,一旦出现只复述“牛顿法”名称而没有可观察状态和独立证据就撤回结论。

8·6·2 共轭梯度

正式坐标 27/35。 目录原文键 8.6.2 共轭梯度。围绕“怎样用梯度、步长、动量状态与曲率探针区分优化失败和泛化失败?”,“第8章 深度模型中的优化”在坐标27把「8·6·2 共轭梯度」落实为跟踪浮点、梯度、曲率、状态缓冲和参数更新;只有dtype、条件数、梯度核对、步长、更新差与停止理由可复算且反例排除只看目标下降而忽略数值不稳、状态错位或泛化失败,本节点才算掌握。

8·6·3 BFGS

正式坐标 28/35。 目录原文键 8.6.3 BFGS。“第8章 深度模型中的优化”的原版节点28「8·6·3 BFGS」不能停在名词解释:它要跟踪浮点、梯度、曲率、状态缓冲和参数更新,交付dtype、条件数、梯度核对、步长、更新差与停止理由,并用只看目标下降而忽略数值不稳、状态错位或泛化失败作为单一反事实检查。

8·7 优化策略和元算法

正式坐标 29/35。 目录原文键 8.7 优化策略和元算法。对“第8章 深度模型中的优化”而言,「8·7 优化策略和元算法」在第29次检查中改变可观察状态,因为它负责跟踪浮点、梯度、曲率、状态缓冲和参数更新;dtype、条件数、梯度核对、步长、更新差与停止理由必须与“初始化、批次顺序、损失缩放、学习率、状态缓冲和停止条件必须一致”对齐,不能接受只看目标下降而忽略数值不稳、状态错位或泛化失败。

8·7·1 批标准化

正式坐标 30/35。 目录原文键 8.7.1 批标准化。目录原文「8·7·1 批标准化」进入“第8章 深度模型中的优化”后形成第30个实验合同:先跟踪浮点、梯度、曲率、状态缓冲和参数更新,再保存dtype、条件数、梯度核对、步长、更新差与停止理由;若发生只看目标下降而忽略数值不稳、状态错位或泛化失败,从同一输入快照恢复。

8·7·2 坐标下降

正式坐标 31/35。 目录原文键 8.7.2 坐标下降。在“第8章 深度模型中的优化”的第31个坐标中,「8·7·2 坐标下降」通过把“坐标下降”放进优化几何、初始化与更新状态的章专属计算链推进优化几何、初始化与更新状态;复核者保存第8章 深度模型中的优化的输入、状态变化、输出、反例与边界,一旦出现只复述“坐标下降”名称而没有可观察状态和独立证据就撤回结论。

8·7·3 Polyak平均

正式坐标 32/35。 目录原文键 8.7.3 Polyak平均。围绕“怎样用梯度、步长、动量状态与曲率探针区分优化失败和泛化失败?”,“第8章 深度模型中的优化”在坐标32把「8·7·3 Polyak平均」落实为把“Polyak平均”放进优化几何、初始化与更新状态的章专属计算链;只有第8章 深度模型中的优化的输入、状态变化、输出、反例与边界可复算且反例排除只复述“Polyak平均”名称而没有可观察状态和独立证据,本节点才算掌握。

8·7·4 监督预训练

正式坐标 33/35。 目录原文键 8.7.4 监督预训练。“第8章 深度模型中的优化”的原版节点33「8·7·4 监督预训练」不能停在名词解释:它要建立任务、数据角色、估计、选择与泛化协议,交付实体切分、候选比较、偏差—方差、选择日志与封存测试,并用训练、验证和测试角色泄漏后仍报告独立泛化作为单一反事实检查。

8·7·5 设计有助于优化的模型

正式坐标 34/35。 目录原文键 8.7.5 设计有助于优化的模型。对“第8章 深度模型中的优化”而言,「8·7·5 设计有助于优化的模型」在第34次检查中改变可观察状态,因为它负责跟踪浮点、梯度、曲率、状态缓冲和参数更新;dtype、条件数、梯度核对、步长、更新差与停止理由必须与“初始化、批次顺序、损失缩放、学习率、状态缓冲和停止条件必须一致”对齐,不能接受只看目标下降而忽略数值不稳、状态错位或泛化失败。

8·7·6 延拓法和课程学习

正式坐标 35/35。 目录原文键 8.7.6 延拓法和课程学习。目录原文「8·7·6 延拓法和课程学习」进入“第8章 深度模型中的优化”后形成第35个实验合同:先把“延拓法和课程学习”放进优化几何、初始化与更新状态的章专属计算链,再保存第8章 深度模型中的优化的输入、状态变化、输出、反例与边界;若发生只复述“延拓法和课程学习”名称而没有可观察状态和独立证据,从同一输入快照恢复。

先预测,再操作三个章专属实验

分步1 / 3

1. 原版坐标、依赖与状态

为“第8章 深度模型中的优化”选择一个正式目录坐标,在参考合同与单一反例间切换,逐阶段核对输入、操作、输出和检查条件。

依赖与状态地图

第8章 深度模型中的优化

选择原版坐标,再比较参考合同与单一反例怎样改变同一条计算链。

1

第8章 深度模型中的优化 · 输入与角色

输入
在同一初始化与小批次序列上比较优化器
操作与输出
冻结优化几何、初始化与更新状态所需的数据角色、版本和shape第8章 深度模型中的优化的输入合同与基线快照
2

第8章 深度模型中的优化 · 计算与状态

输入
第8章 深度模型中的优化的输入合同
操作与输出
执行复核深度模型优化中的病态、鞍点、梯度尺度、初始化和更新算法的最小计算并保存中间状态第8章 深度模型中的优化的参考轨迹与单故障轨迹
3

第8章 深度模型中的优化 · 目标与更新

输入
第8章 深度模型中的优化的中间状态和目标口径
操作与输出
比较目标分量、梯度、估计或选择决定第8章 深度模型中的优化的更新前后差异与首个分岔
4

第8章 深度模型中的优化 · 独立评估

输入
第8章 深度模型中的优化的冻结候选与未见数据或独立诊断
操作与输出
重放预测、反例、恢复和边界检查第8章 深度模型中的优化的接受、回退或拒绝理由

第8章 深度模型中的优化的可重放协议

阶段允许动作必留证据拒绝条件
第8章 深度模型中的优化 · 输入与角色冻结优化几何、初始化与更新状态所需的数据角色、版本和shape第8章 深度模型中的优化的输入合同与基线快照未满足“第8章 深度模型中的优化的来源、角色、单位、shape和可见性没有越界”
第8章 深度模型中的优化 · 计算与状态执行复核深度模型优化中的病态、鞍点、梯度尺度、初始化和更新算法的最小计算并保存中间状态第8章 深度模型中的优化的参考轨迹与单故障轨迹未满足“第8章 深度模型中的优化每一步状态变化都能由输入、公式或算法操作复算”
第8章 深度模型中的优化 · 目标与更新比较目标分量、梯度、估计或选择决定第8章 深度模型中的优化的更新前后差异与首个分岔未满足“第8章 深度模型中的优化没有把代理目标、训练分数或偶然样本当作最终结论”
第8章 深度模型中的优化 · 独立评估重放预测、反例、恢复和边界检查第8章 深度模型中的优化的接受、回退或拒绝理由未满足“第8章 深度模型中的优化满足“初始化、批次顺序、损失缩放、学习率、状态缓冲和停止条件必须一致””
unit: "dlt-08"
question: "怎样用梯度、步长、动量状态与曲率探针区分优化失败和泛化失败?"
scenario: "在同一初始化与小批次序列上比较优化器"
invariant: "初始化、批次顺序、损失缩放、学习率、状态缓冲和停止条件必须一致"
fault: "不同优化器使用不同随机批次却直接比较收敛曲线"
evidence: "梯度—更新账本、状态缓冲与首差诊断报告"
reset: restore_concept_mode_trace_step_case_gates_and_artifact

“第8章 深度模型中的优化”要求从同一输入、版本、预算和随机状态重放参考、故障与恢复路径。重置后若目录选择、模式、轨迹步骤、案例、证据门或交付包没有回到基线,本次比较已经混入状态泄漏。

本页回顾

掌握“第8章 深度模型中的优化”不是背诵术语或抄公式,而是能围绕“怎样用梯度、步长、动量状态与曲率探针区分优化失败和泛化失败?”重建输入、shape、计算、目标、更新、随机性与独立评估,并用“初始化、批次顺序、损失缩放、学习率、状态缓冲和停止条件必须一致”拒绝“不同优化器使用不同随机批次却直接比较收敛曲线”。最终交付为梯度—更新账本、状态缓冲与首差诊断报告

练习与答案

练习

  1. 问题 1:实验合同。 “第8章 深度模型中的优化”为什么必须先冻结输入、版本、shape、目标、预算、随机性和评估口径?
  1. 问题 2:目录逐项覆盖。 怎样证明“第8章 深度模型中的优化”的正式目录坐标已经进入机制、交互和练习?
  1. 问题 3:故障恢复。 怎样证明“不同优化器使用不同随机批次却直接比较收敛曲线”已经被修正?

名词解释

名词解释

本章出现的专业名词,用大白话再讲一遍。

深度模型中的优化

检索键 dlt-A 对应目录坐标「第8章 深度模型中的优化」;在“第8章 深度模型中的优化”中用于跟踪浮点、梯度、曲率、状态缓冲和参数更新,需要连接原版范围、计算状态、独立证据和不适用边界。

学习和纯优化有何不同

检索键 dlt-B 对应目录坐标「8·1 学习和纯优化有何不同」;在“第8章 深度模型中的优化”中用于跟踪浮点、梯度、曲率、状态缓冲和参数更新,需要连接原版范围、计算状态、独立证据和不适用边界。

经验风险最小化

检索键 dlt-C 对应目录坐标「8·1·1 经验风险最小化」;在“第8章 深度模型中的优化”中用于把“经验风险最小化”放进优化几何、初始化与更新状态的章专属计算链,需要连接原版范围、计算状态、独立证据和不适用边界。

代理损失函数和提前终止

检索键 dlt-D 对应目录坐标「8·1·2 代理损失函数和提前终止」;在“第8章 深度模型中的优化”中用于改变有效容量、数据分布或参数约束并验证泛化,需要连接原版范围、计算状态、独立证据和不适用边界。

批量算法和小批量算法

检索键 dlt-E 对应目录坐标「8·1·3 批量算法和小批量算法」;在“第8章 深度模型中的优化”中用于把“批量算法和小批量算法”放进优化几何、初始化与更新状态的章专属计算链,需要连接原版范围、计算状态、独立证据和不适用边界。

神经网络优化中的挑战

检索键 dlt-F 对应目录坐标「8·2 神经网络优化中的挑战」;在“第8章 深度模型中的优化”中用于跟踪浮点、梯度、曲率、状态缓冲和参数更新,需要连接原版范围、计算状态、独立证据和不适用边界。

病态

检索键 dlt-G 对应目录坐标「8·2·1 病态」;在“第8章 深度模型中的优化”中用于跟踪浮点、梯度、曲率、状态缓冲和参数更新,需要连接原版范围、计算状态、独立证据和不适用边界。

局部极小值

检索键 dlt-H 对应目录坐标「8·2·2 局部极小值」;在“第8章 深度模型中的优化”中用于把“局部极小值”放进优化几何、初始化与更新状态的章专属计算链,需要连接原版范围、计算状态、独立证据和不适用边界。

高原、鞍点和其他平坦区域

检索键 dlt-I 对应目录坐标「8·2·3 高原、鞍点和其他平坦区域」;在“第8章 深度模型中的优化”中用于把“高原、鞍点和其他平坦区域”放进优化几何、初始化与更新状态的章专属计算链,需要连接原版范围、计算状态、独立证据和不适用边界。

悬崖和梯度爆炸

检索键 dlt-J 对应目录坐标「8·2·4 悬崖和梯度爆炸」;在“第8章 深度模型中的优化”中用于跟踪浮点、梯度、曲率、状态缓冲和参数更新,需要连接原版范围、计算状态、独立证据和不适用边界。

长期依赖

检索键 dlt-K 对应目录坐标「8·2·5 长期依赖」;在“第8章 深度模型中的优化”中用于沿时间展开状态、输入依赖、门控和梯度传播,需要连接原版范围、计算状态、独立证据和不适用边界。

非精确梯度

检索键 dlt-L 对应目录坐标「8·2·6 非精确梯度」;在“第8章 深度模型中的优化”中用于跟踪浮点、梯度、曲率、状态缓冲和参数更新,需要连接原版范围、计算状态、独立证据和不适用边界。

局部和全局结构间的弱对应

检索键 dlt-M 对应目录坐标「8·2·7 局部和全局结构间的弱对应」;在“第8章 深度模型中的优化”中用于把“局部和全局结构间的弱对应”放进优化几何、初始化与更新状态的章专属计算链,需要连接原版范围、计算状态、独立证据和不适用边界。

优化的理论限制

检索键 dlt-N 对应目录坐标「8·2·8 优化的理论限制」;在“第8章 深度模型中的优化”中用于跟踪浮点、梯度、曲率、状态缓冲和参数更新,需要连接原版范围、计算状态、独立证据和不适用边界。

基本算法

检索键 dlt-O 对应目录坐标「8·3 基本算法」;在“第8章 深度模型中的优化”中用于把“基本算法”放进优化几何、初始化与更新状态的章专属计算链,需要连接原版范围、计算状态、独立证据和不适用边界。

随机梯度下降

检索键 dlt-P 对应目录坐标「8·3·1 随机梯度下降」;在“第8章 深度模型中的优化”中用于跟踪浮点、梯度、曲率、状态缓冲和参数更新,需要连接原版范围、计算状态、独立证据和不适用边界。

动量

检索键 dlt-Q 对应目录坐标「8·3·2 动量」;在“第8章 深度模型中的优化”中用于跟踪浮点、梯度、曲率、状态缓冲和参数更新,需要连接原版范围、计算状态、独立证据和不适用边界。

Nesterov动量

检索键 dlt-R 对应目录坐标「8·3·3 Nesterov动量」;在“第8章 深度模型中的优化”中用于跟踪浮点、梯度、曲率、状态缓冲和参数更新,需要连接原版范围、计算状态、独立证据和不适用边界。

参数初始化策略

检索键 dlt-S 对应目录坐标「8·4 参数初始化策略」;在“第8章 深度模型中的优化”中用于跟踪浮点、梯度、曲率、状态缓冲和参数更新,需要连接原版范围、计算状态、独立证据和不适用边界。

自适应学习率算法

检索键 dlt-T 对应目录坐标「8·5 自适应学习率算法」;在“第8章 深度模型中的优化”中用于跟踪浮点、梯度、曲率、状态缓冲和参数更新,需要连接原版范围、计算状态、独立证据和不适用边界。

AdaGrad

检索键 dlt-U 对应目录坐标「8·5·1 AdaGrad」;在“第8章 深度模型中的优化”中用于跟踪浮点、梯度、曲率、状态缓冲和参数更新,需要连接原版范围、计算状态、独立证据和不适用边界。

RMSProp

检索键 dlt-V 对应目录坐标「8·5·2 RMSProp」;在“第8章 深度模型中的优化”中用于跟踪浮点、梯度、曲率、状态缓冲和参数更新,需要连接原版范围、计算状态、独立证据和不适用边界。

Adam

检索键 dlt-W 对应目录坐标「8·5·3 Adam」;在“第8章 深度模型中的优化”中用于跟踪浮点、梯度、曲率、状态缓冲和参数更新,需要连接原版范围、计算状态、独立证据和不适用边界。

选择正确的优化算法

检索键 dlt-X 对应目录坐标「8·5·4 选择正确的优化算法」;在“第8章 深度模型中的优化”中用于跟踪浮点、梯度、曲率、状态缓冲和参数更新,需要连接原版范围、计算状态、独立证据和不适用边界。

二阶近似方法

检索键 dlt-Y 对应目录坐标「8·6 二阶近似方法」;在“第8章 深度模型中的优化”中用于把“二阶近似方法”放进优化几何、初始化与更新状态的章专属计算链,需要连接原版范围、计算状态、独立证据和不适用边界。

牛顿法

检索键 dlt-Z 对应目录坐标「8·6·1 牛顿法」;在“第8章 深度模型中的优化”中用于把“牛顿法”放进优化几何、初始化与更新状态的章专属计算链,需要连接原版范围、计算状态、独立证据和不适用边界。

共轭梯度

检索键 dlt-AA 对应目录坐标「8·6·2 共轭梯度」;在“第8章 深度模型中的优化”中用于跟踪浮点、梯度、曲率、状态缓冲和参数更新,需要连接原版范围、计算状态、独立证据和不适用边界。

BFGS

检索键 dlt-AB 对应目录坐标「8·6·3 BFGS」;在“第8章 深度模型中的优化”中用于跟踪浮点、梯度、曲率、状态缓冲和参数更新,需要连接原版范围、计算状态、独立证据和不适用边界。

优化策略和元算法

检索键 dlt-AC 对应目录坐标「8·7 优化策略和元算法」;在“第8章 深度模型中的优化”中用于跟踪浮点、梯度、曲率、状态缓冲和参数更新,需要连接原版范围、计算状态、独立证据和不适用边界。

批标准化

检索键 dlt-AD 对应目录坐标「8·7·1 批标准化」;在“第8章 深度模型中的优化”中用于跟踪浮点、梯度、曲率、状态缓冲和参数更新,需要连接原版范围、计算状态、独立证据和不适用边界。

坐标下降

检索键 dlt-AE 对应目录坐标「8·7·2 坐标下降」;在“第8章 深度模型中的优化”中用于把“坐标下降”放进优化几何、初始化与更新状态的章专属计算链,需要连接原版范围、计算状态、独立证据和不适用边界。

Polyak平均

检索键 dlt-AF 对应目录坐标「8·7·3 Polyak平均」;在“第8章 深度模型中的优化”中用于把“Polyak平均”放进优化几何、初始化与更新状态的章专属计算链,需要连接原版范围、计算状态、独立证据和不适用边界。

监督预训练

检索键 dlt-AG 对应目录坐标「8·7·4 监督预训练」;在“第8章 深度模型中的优化”中用于建立任务、数据角色、估计、选择与泛化协议,需要连接原版范围、计算状态、独立证据和不适用边界。

设计有助于优化的模型

检索键 dlt-AH 对应目录坐标「8·7·5 设计有助于优化的模型」;在“第8章 深度模型中的优化”中用于跟踪浮点、梯度、曲率、状态缓冲和参数更新,需要连接原版范围、计算状态、独立证据和不适用边界。

延拓法和课程学习

检索键 dlt-AI 对应目录坐标「8·7·6 延拓法和课程学习」;在“第8章 深度模型中的优化”中用于把“延拓法和课程学习”放进优化几何、初始化与更新状态的章专属计算链,需要连接原版范围、计算状态、独立证据和不适用边界。

讨论

评论区加载中…