《深度学习进阶:自然语言处理》全书总复习
《深度学习进阶:自然语言处理》全书总复习逐项覆盖权威目录,以公式、从零实现、交互实验和失败对照重建核心知识。
为什么从可观测证据开始
、、、、、共同构成本页坐标。以同一小语料贯通共现统计、CBOW、RNNLM、LSTM、seq2seq和Attention,逐阶段比较目标函数、状态与验证证据。
自然语言模型容易产生“输出看起来合理”的错觉,但词表错位、广播轴错误、旧隐藏状态、错误采样、训练/推理路径混用都可能暂时给出低损失。实验开始前固定语料切片、词ID映射、批量与时间轴、参数、随机种子、模式和上一版结果;运行前写下首个应变化的中间量。
本页采用“定义对象 -> 写shape与公式 -> 手算最小样本 -> 运行交互实验 -> 比较独立证据 -> 注入失败并重放”的顺序。任何末端改进都要能沿证据链回到输入;首处分叉出现后停止扩大实验,清空缓存、梯度和循环状态,从固定输入重放。
数学骨架
每个方程进入代码前都声明批量轴、词表轴、时间轴和隐藏维。概率要核对归一化轴,查表要核对重复ID梯度,循环状态要核对跨批次边界,反向传播要与中心差分或可手算局部导数比较。
可复现证据工作表
第一栏记录原始文本、分词结果、词ID、批量索引和时间偏移,任何预处理变化都生成新的版本号。第二栏逐层写输入shape、参数shape、输出shape与归一化轴;查表层另记重复ID,循环层另记初始状态与截断边界,Attention另记mask覆盖位置。这样能在模型开始训练前发现大多数轴错位。
第三栏保存可独立重算的数值证据:计数模型保留共现行与PPMI项,预测模型保留logit与目标概率,循环模型保留每步隐藏状态与梯度范数,生成模型保留教师强制和自回归两条轨迹。第四栏写通过阈值与失败样本,明确哪一个中间量应最先报警,而不是等最终损失或文本输出暴露问题。
重放时从原始文本重新构造词表和小批量,重新初始化参数、优化器、随机采样器与循环状态;随后按同一顺序计算forward、局部梯度、参数更新和独立评价。若修复只在保留旧缓存时有效,或换一个固定随机种子就消失,应判为状态污染而不是算法改进。
核心实现合同
- 输入合同: 冻结语料版本、分词与词ID映射;批量、时间、词表和隐藏维不靠上下文猜测。
- 前向合同: 保存每层输入输出、shape、概率归一化轴、查表ID、循环状态或对齐权重。
- 反向合同: 共享参数与重复ID贡献必须累加;截断只切反向图,padding和无效位置不得贡献梯度。
- 状态合同: 训练、验证、生成和独立重放使用明确初始状态;Dropout、采样器和缓存不得跨模式泄漏。
- 评价合同: 损失、困惑度、近邻、精确匹配与可视化都从保存的预测重新计算,不读取训练期临时值。
- 失败合同: 至少注入一个错误轴、错位ID、旧状态、错误mask或采样泄漏,并证明检测器在首个中间量处报警。
权威目录逐项讲解
第1章 神经网络的复习
把该小节放回本章主链,先声明输入、输出、状态和评价标准,再用最小样本核对中间证据。实现应能解释为什么得到该结果、在哪个边界失效,以及如何从首个分叉点重放。 本页验收合同是“复习答案必须同时说明对象、公式、shape、最小实验、失败样本和通过阈值;只会给模型名称或最终分数不算掌握。”针对“第1章 神经网络的复习”,至少保存一组正常样本和一组故意破坏轴、状态、采样或模式的失败样本。
先预测“第1章 神经网络的复习”改变后最早变化的是计数、shape、概率、隐藏状态、梯度还是对齐权重,再运行固定样本。若最终指标改善但第一条预期证据没有出现,应停止并从原始输入、参数、随机种子和空状态完整重放。
第2章 自然语言和单词的分布式表示
把该小节放回本章主链,先声明输入、输出、状态和评价标准,再用最小样本核对中间证据。实现应能解释为什么得到该结果、在哪个边界失效,以及如何从首个分叉点重放。 本页验收合同是“复习答案必须同时说明对象、公式、shape、最小实验、失败样本和通过阈值;只会给模型名称或最终分数不算掌握。”针对“第2章 自然语言和单词的分布式表示”,至少保存一组正常样本和一组故意破坏轴、状态、采样或模式的失败样本。
先预测“第2章 自然语言和单词的分布式表示”改变后最早变化的是计数、shape、概率、隐藏状态、梯度还是对齐权重,再运行固定样本。若最终指标改善但第一条预期证据没有出现,应停止并从原始输入、参数、随机种子和空状态完整重放。
第3章 word2vec
把上下文ID、目标ID、输入权重和输出权重的shape写在每条边上。CBOW平均上下文后预测中心词,skip-gram反向预测上下文;两者目标不同,不能只凭词向量可视化判断实现正确。 本页验收合同是“复习答案必须同时说明对象、公式、shape、最小实验、失败样本和通过阈值;只会给模型名称或最终分数不算掌握。”针对“第3章 word2vec”,至少保存一组正常样本和一组故意破坏轴、状态、采样或模式的失败样本。
先预测“第3章 word2vec”改变后最早变化的是计数、shape、概率、隐藏状态、梯度还是对齐权重,再运行固定样本。若最终指标改善但第一条预期证据没有出现,应停止并从原始输入、参数、随机种子和空状态完整重放。
第4章 word2vec的高速化
把上下文ID、目标ID、输入权重和输出权重的shape写在每条边上。CBOW平均上下文后预测中心词,skip-gram反向预测上下文;两者目标不同,不能只凭词向量可视化判断实现正确。 本页验收合同是“复习答案必须同时说明对象、公式、shape、最小实验、失败样本和通过阈值;只会给模型名称或最终分数不算掌握。”针对“第4章 word2vec的高速化”,至少保存一组正常样本和一组故意破坏轴、状态、采样或模式的失败样本。
先预测“第4章 word2vec的高速化”改变后最早变化的是计数、shape、概率、隐藏状态、梯度还是对齐权重,再运行固定样本。若最终指标改善但第一条预期证据没有出现,应停止并从原始输入、参数、随机种子和空状态完整重放。
第5章 RNN
沿时间展开共享参数,逐步保存输入、隐藏状态、输出和局部梯度。Truncated BPTT只截断反向图而保留必要的前向状态;批量序列应从不同偏移连续读取,困惑度由平均负对数似然独立重算。 本页验收合同是“复习答案必须同时说明对象、公式、shape、最小实验、失败样本和通过阈值;只会给模型名称或最终分数不算掌握。”针对“第5章 RNN”,至少保存一组正常样本和一组故意破坏轴、状态、采样或模式的失败样本。
先预测“第5章 RNN”改变后最早变化的是计数、shape、概率、隐藏状态、梯度还是对齐权重,再运行固定样本。若最终指标改善但第一条预期证据没有出现,应停止并从原始输入、参数、随机种子和空状态完整重放。
第6章 Gated RNN
沿时间展开共享参数,逐步保存输入、隐藏状态、输出和局部梯度。Truncated BPTT只截断反向图而保留必要的前向状态;批量序列应从不同偏移连续读取,困惑度由平均负对数似然独立重算。 本页验收合同是“复习答案必须同时说明对象、公式、shape、最小实验、失败样本和通过阈值;只会给模型名称或最终分数不算掌握。”针对“第6章 Gated RNN”,至少保存一组正常样本和一组故意破坏轴、状态、采样或模式的失败样本。
先预测“第6章 Gated RNN”改变后最早变化的是计数、shape、概率、隐藏状态、梯度还是对齐权重,再运行固定样本。若最终指标改善但第一条预期证据没有出现,应停止并从原始输入、参数、随机种子和空状态完整重放。
第7章 基于RNN生成文本
沿时间展开共享参数,逐步保存输入、隐藏状态、输出和局部梯度。Truncated BPTT只截断反向图而保留必要的前向状态;批量序列应从不同偏移连续读取,困惑度由平均负对数似然独立重算。 本页验收合同是“复习答案必须同时说明对象、公式、shape、最小实验、失败样本和通过阈值;只会给模型名称或最终分数不算掌握。”针对“第7章 基于RNN生成文本”,至少保存一组正常样本和一组故意破坏轴、状态、采样或模式的失败样本。
先预测“第7章 基于RNN生成文本”改变后最早变化的是计数、shape、概率、隐藏状态、梯度还是对齐权重,再运行固定样本。若最终指标改善但第一条预期证据没有出现,应停止并从原始输入、参数、随机种子和空状态完整重放。
第8章 Attention
对每个解码步保存全部编码状态、分数、mask、softmax权重和加权上下文。先验证权重按源序列轴归一且padding为零,再把热力图逐列对应输出token,避免把漂亮图形误当成正确对齐。 本页验收合同是“复习答案必须同时说明对象、公式、shape、最小实验、失败样本和通过阈值;只会给模型名称或最终分数不算掌握。”针对“第8章 Attention”,至少保存一组正常样本和一组故意破坏轴、状态、采样或模式的失败样本。
先预测“第8章 Attention”改变后最早变化的是计数、shape、概率、隐藏状态、梯度还是对齐权重,再运行固定样本。若最终指标改善但第一条预期证据没有出现,应停止并从原始输入、参数、随机种子和空状态完整重放。
附录A sigmoid函数和tanh函数的导数
Embedding前向是按ID取行,反向必须用散射加法处理重复ID。负采样将一个全词表分类变成一正多负的Sigmoid损失,需记录采样分布、随机种子、负样本数和目标排除规则。 本页验收合同是“复习答案必须同时说明对象、公式、shape、最小实验、失败样本和通过阈值;只会给模型名称或最终分数不算掌握。”针对“附录A sigmoid函数和tanh函数的导数”,至少保存一组正常样本和一组故意破坏轴、状态、采样或模式的失败样本。
先预测“附录A sigmoid函数和tanh函数的导数”改变后最早变化的是计数、shape、概率、隐藏状态、梯度还是对齐权重,再运行固定样本。若最终指标改善但第一条预期证据没有出现,应停止并从原始输入、参数、随机种子和空状态完整重放。
附录B 运行WordNet
先冻结分词规则、大小写、标点、词ID映射和语料版本,再区分单词字符串、词义节点与上下文实例。规则知识库能给出显式关系,但覆盖、维护和语境消歧是它的边界。 本页验收合同是“复习答案必须同时说明对象、公式、shape、最小实验、失败样本和通过阈值;只会给模型名称或最终分数不算掌握。”针对“附录B 运行WordNet”,至少保存一组正常样本和一组故意破坏轴、状态、采样或模式的失败样本。
先预测“附录B 运行WordNet”改变后最早变化的是计数、shape、概率、隐藏状态、梯度还是对齐权重,再运行固定样本。若最终指标改善但第一条预期证据没有出现,应停止并从原始输入、参数、随机种子和空状态完整重放。
附录C GRU
GRU用更新门混合旧状态与候选状态,重置门只控制旧状态进入候选计算。先声明采用哪一种z方向约定,再从计算图核对逐元素乘法、矩阵乘法、时间缓存与参数梯度累加。 本页验收合同是“复习答案必须同时说明对象、公式、shape、最小实验、失败样本和通过阈值;只会给模型名称或最终分数不算掌握。”针对“附录C GRU”,至少保存一组正常样本和一组故意破坏轴、状态、采样或模式的失败样本。
先预测“附录C GRU”改变后最早变化的是计数、shape、概率、隐藏状态、梯度还是对齐权重,再运行固定样本。若最终指标改善但第一条预期证据没有出现,应停止并从原始输入、参数、随机种子和空状态完整重放。
常见失败与边界
本章回顾
以同一小语料贯通共现统计、CBOW、RNNLM、LSTM、seq2seq和Attention,逐阶段比较目标函数、状态与验证证据。 验收底线是:复习答案必须同时说明对象、公式、shape、最小实验、失败样本和通过阈值;只会给模型名称或最终分数不算掌握。。掌握标准不是记住模型名称,而是能预测首个变化、手算最小例、复现实验、解释失败样本,并证明修复没有污染其他阶段。