第3章 Transformer
从注意力、编码器—解码器、位置表示、长上下文、外部记忆到推理优化重建Transformer计算链;用上下文合同、计算轨迹和独立证据门交付shape账本、注意力矩阵、缓存轨迹、首差与优化误差
学习目标
- 能说明“第3章 Transformer”如何从注意力、编码器—解码器、位置表示、长上下文、外部记忆到推理优化重建Transformer计算链,并区分2024年原书目录、原始研究、当前实现和本站重写
- 能先预测“每个张量shape、掩码、位置关系、缓存和近似优化怎样影响同一输出?”会改变哪一个数据、表示、目标、计算、输出或评估状态,再操作三类交互证据
- 能只注入“因果掩码方向反转,注意力仍有数值却泄漏未来词元”,定位首个偏离“批次、头、序列、通道轴、因果掩码、位置、精度和缓存版本一致”的状态,并从同一快照完成恢复
为什么从这个问题开始
“第3章 Transformer”围绕“每个张量shape、掩码、位置关系、缓存和近似优化怎样影响同一输出?”建立贯穿任务:在一个可手算短序列上逐层追踪Transformer与推理解码。先写下哪个数据、表示、目标、计算、输出或评估状态会最先变化,再运行参考、故障和恢复路径;运行后补理由不算预测。只有守住“批次、头、序列、通道轴、因果掩码、位置、精度和缓存版本一致”并交付shape账本、注意力矩阵、缓存轨迹、首差与优化误差,困惑度、基准、偏好、检索、伤害或环境指标才构成机制证据。
原书书目、153个正式坐标与访问边界
“第3章 Transformer”以发行数字版核对熊涛著《大语言模型:基础与前沿》的前言、12章和参考文献,以馆藏书目核对人民邮电出版社、2024年4月、260页和ISBN 9787115634887,再以公开目录交叉核对全部节/小节。正式分母为前言1个、章标题12个、编号节/小节139个和参考文献1个,合计153个目录层级。
本书是熊涛原创中文专著,不是外文书的中译本;因此不存在可假定的英文“原版”供逐句对照。发行数字版可阅读不等于允许复制或改编,“第3章 Transformer”不复制、翻译或改写原书正文、图表和案例,只把目录与书目元数据作为范围坐标;中文讲解、计算轨迹、反例、交互、练习与答案均为独立教学重写。
本页独立核对 1只用于独立核对本页技术事实和实验边界,不能反向证明原书采用本站表述。2024年以后出现的模型、框架、政策或基准必须带当前时间标签,不能倒填为原书内容。
原书目录层级与可验证机制
第3章 Transformer
↡Transformer对应正式目录坐标“第3章 Transformer”,在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 1/21。 原书目录键 第3章 Transformer。在“第3章 Transformer”的第1个正式坐标中,「第3章 Transformer」通过追踪注意力shape、掩码、位置、缓存、近似和解码状态推进注意力计算、位置与推理状态;复核者保存shape账本、注意力矩阵、缓存轨迹、延迟、内存与误差,出现掩码、位置或缓存版本错位但输出仍看似合理就撤回结论。
3·1 Transformer编码器模块
↡Transformer编码器模块对应正式目录坐标“3.1 Transformer编码器模块”,在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 2/21。 原书目录键 3.1 Transformer编码器模块。围绕“每个张量shape、掩码、位置关系、缓存和近似优化怎样影响同一输出?”,“第3章 Transformer”在坐标2把「3·1 Transformer编码器模块」落实为追踪注意力shape、掩码、位置、缓存、近似和解码状态;只有shape账本、注意力矩阵、缓存轨迹、延迟、内存与误差可重放且反例排除掩码、位置或缓存版本错位但输出仍看似合理,本节点才算掌握。
3·2 编码器-解码器架构
↡编码器-解码器架构对应正式目录坐标“3.2 编码器-解码器架构”,在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 3/21。 原书目录键 3.2 编码器-解码器架构。“第3章 Transformer”的目录节点3「3·2 编码器-解码器架构」不能停在术语解释:它要追踪注意力shape、掩码、位置、缓存、近似和解码状态,交付shape账本、注意力矩阵、缓存轨迹、延迟、内存与误差,并把掩码、位置或缓存版本错位但输出仍看似合理设为单一反事实。
3·3 位置嵌入
↡位置嵌入对应正式目录坐标“3.3 位置嵌入”,在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 4/21。 原书目录键 3.3 位置嵌入。对“第3章 Transformer”而言,「3·3 位置嵌入」在第4次检查中改变可观察状态,因为它负责追踪注意力shape、掩码、位置、缓存、近似和解码状态;shape账本、注意力矩阵、缓存轨迹、延迟、内存与误差必须与“批次、头、序列、通道轴、因果掩码、位置、精度和缓存版本一致”对齐,不能接受掩码、位置或缓存版本错位但输出仍看似合理。
3·3·1 绝对位置编码
↡绝对位置编码对应正式目录坐标“3.3.1 绝对位置编码”,在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 5/21。 原书目录键 3.3.1 绝对位置编码。在“第3章 Transformer”的第5个正式坐标中,「3·3·1 绝对位置编码」通过追踪注意力shape、掩码、位置、缓存、近似和解码状态推进注意力计算、位置与推理状态;复核者保存shape账本、注意力矩阵、缓存轨迹、延迟、内存与误差,出现掩码、位置或缓存版本错位但输出仍看似合理就撤回结论。
3·3·2 相对位置编码
↡相对位置编码对应正式目录坐标“3.3.2 相对位置编码”,在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 6/21。 原书目录键 3.3.2 相对位置编码。围绕“每个张量shape、掩码、位置关系、缓存和近似优化怎样影响同一输出?”,“第3章 Transformer”在坐标6把「3·3·2 相对位置编码」落实为追踪注意力shape、掩码、位置、缓存、近似和解码状态;只有shape账本、注意力矩阵、缓存轨迹、延迟、内存与误差可重放且反例排除掩码、位置或缓存版本错位但输出仍看似合理,本节点才算掌握。
3·4 更长的上下文
↡更长的上下文对应正式目录坐标“3.4 更长的上下文”,在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 7/21。 原书目录键 3.4 更长的上下文。“第3章 Transformer”的目录节点7「3·4 更长的上下文」不能停在术语解释:它要追踪注意力shape、掩码、位置、缓存、近似和解码状态,交付shape账本、注意力矩阵、缓存轨迹、延迟、内存与误差,并把掩码、位置或缓存版本错位但输出仍看似合理设为单一反事实。
3·5 外部记忆
↡外部记忆对应正式目录坐标“3.5 外部记忆”,在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 8/21。 原书目录键 3.5 外部记忆。对“第3章 Transformer”而言,「3·5 外部记忆」在第8次检查中改变可观察状态,因为它负责追踪注意力shape、掩码、位置、缓存、近似和解码状态;shape账本、注意力矩阵、缓存轨迹、延迟、内存与误差必须与“批次、头、序列、通道轴、因果掩码、位置、精度和缓存版本一致”对齐,不能接受掩码、位置或缓存版本错位但输出仍看似合理。
3·6 更快、更小的Transformer
↡更快、更小的Transformer对应正式目录坐标“3.6 更快、更小的Transformer”,在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 9/21。 原书目录键 3.6 更快、更小的Transformer。在“第3章 Transformer”的第9个正式坐标中,「3·6 更快、更小的Transformer」通过追踪注意力shape、掩码、位置、缓存、近似和解码状态推进注意力计算、位置与推理状态;复核者保存shape账本、注意力矩阵、缓存轨迹、延迟、内存与误差,出现掩码、位置或缓存版本错位但输出仍看似合理就撤回结论。
3·6·1 高效注意力
↡高效注意力对应正式目录坐标“3.6.1 高效注意力”,在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 10/21。 原书目录键 3.6.1 高效注意力。围绕“每个张量shape、掩码、位置关系、缓存和近似优化怎样影响同一输出?”,“第3章 Transformer”在坐标10把「3·6·1 高效注意力」落实为追踪注意力shape、掩码、位置、缓存、近似和解码状态;只有shape账本、注意力矩阵、缓存轨迹、延迟、内存与误差可重放且反例排除掩码、位置或缓存版本错位但输出仍看似合理,本节点才算掌握。
3·6·2 条件计算
↡条件计算对应正式目录坐标“3.6.2 条件计算”,在“第3章 Transformer”中用于把“条件计算”放进注意力计算、位置与推理状态的数据—目标—计算—输出链,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 11/21。 原书目录键 3.6.2 条件计算。“第3章 Transformer”的目录节点11「3·6·2 条件计算」不能停在术语解释:它要把“条件计算”放进注意力计算、位置与推理状态的数据—目标—计算—输出链,交付第3章 Transformer的输入角色、中间状态、输出、反例与独立评估,并把只复述“条件计算”名称而没有可观察状态、单一故障和恢复证据设为单一反事实。
3·6·3 搜索高效Transformer
↡搜索高效Transformer对应正式目录坐标“3.6.3 搜索高效Transformer”,在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 12/21。 原书目录键 3.6.3 搜索高效Transformer。对“第3章 Transformer”而言,「3·6·3 搜索高效Transformer」在第12次检查中改变可观察状态,因为它负责追踪注意力shape、掩码、位置、缓存、近似和解码状态;shape账本、注意力矩阵、缓存轨迹、延迟、内存与误差必须与“批次、头、序列、通道轴、因果掩码、位置、精度和缓存版本一致”对齐,不能接受掩码、位置或缓存版本错位但输出仍看似合理。
3·6·4 在单个GPU上一天内训练一个语言模型
↡在单个GPU上一天内训练一个语言模型对应正式目录坐标“3.6.4 在单个GPU上一天内训练一个语言模型”,在“第3章 Transformer”中用于对齐文本规范化、词元边界、概率分解、序列长度和评估单位,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 13/21。 原书目录键 3.6.4 在单个GPU上一天内训练一个语言模型。在“第3章 Transformer”的第13个正式坐标中,「3·6·4 在单个GPU上一天内训练一个语言模型」通过对齐文本规范化、词元边界、概率分解、序列长度和评估单位推进注意力计算、位置与推理状态;复核者保存分词轨迹、词表覆盖、概率账本、序列长度和可比性说明,出现忽略不同分词器导致的概率单位与成本差异就撤回结论。
3·7 推理优化
↡推理优化对应正式目录坐标“3.7 推理优化”,在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 14/21。 原书目录键 3.7 推理优化。围绕“每个张量shape、掩码、位置关系、缓存和近似优化怎样影响同一输出?”,“第3章 Transformer”在坐标14把「3·7 推理优化」落实为追踪注意力shape、掩码、位置、缓存、近似和解码状态;只有shape账本、注意力矩阵、缓存轨迹、延迟、内存与误差可重放且反例排除掩码、位置或缓存版本错位但输出仍看似合理,本节点才算掌握。
3·7·1 推测解码
↡推测解码对应正式目录坐标“3.7.1 推测解码”,在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 15/21。 原书目录键 3.7.1 推测解码。“第3章 Transformer”的目录节点15「3·7·1 推测解码」不能停在术语解释:它要追踪注意力shape、掩码、位置、缓存、近似和解码状态,交付shape账本、注意力矩阵、缓存轨迹、延迟、内存与误差,并把掩码、位置或缓存版本错位但输出仍看似合理设为单一反事实。
3·7·2 简化Transformer
↡简化Transformer对应正式目录坐标“3.7.2 简化Transformer”,在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 16/21。 原书目录键 3.7.2 简化Transformer。对“第3章 Transformer”而言,「3·7·2 简化Transformer」在第16次检查中改变可观察状态,因为它负责追踪注意力shape、掩码、位置、缓存、近似和解码状态;shape账本、注意力矩阵、缓存轨迹、延迟、内存与误差必须与“批次、头、序列、通道轴、因果掩码、位置、精度和缓存版本一致”对齐,不能接受掩码、位置或缓存版本错位但输出仍看似合理。
3·7·3 修剪
↡修剪对应正式目录坐标“3.7.3 修剪”,在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 17/21。 原书目录键 3.7.3 修剪。在“第3章 Transformer”的第17个正式坐标中,「3·7·3 修剪」通过追踪注意力shape、掩码、位置、缓存、近似和解码状态推进注意力计算、位置与推理状态;复核者保存shape账本、注意力矩阵、缓存轨迹、延迟、内存与误差,出现掩码、位置或缓存版本错位但输出仍看似合理就撤回结论。
3·7·4 蒸馏
↡蒸馏对应正式目录坐标“3.7.4 蒸馏”,在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 18/21。 原书目录键 3.7.4 蒸馏。围绕“每个张量shape、掩码、位置关系、缓存和近似优化怎样影响同一输出?”,“第3章 Transformer”在坐标18把「3·7·4 蒸馏」落实为追踪注意力shape、掩码、位置、缓存、近似和解码状态;只有shape账本、注意力矩阵、缓存轨迹、延迟、内存与误差可重放且反例排除掩码、位置或缓存版本错位但输出仍看似合理,本节点才算掌握。
3·7·5 混合精度
↡混合精度对应正式目录坐标“3.7.5 混合精度”,在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 19/21。 原书目录键 3.7.5 混合精度。“第3章 Transformer”的目录节点19「3·7·5 混合精度」不能停在术语解释:它要追踪注意力shape、掩码、位置、缓存、近似和解码状态,交付shape账本、注意力矩阵、缓存轨迹、延迟、内存与误差,并把掩码、位置或缓存版本错位但输出仍看似合理设为单一反事实。
3·7·6 高效扩展Transformer推理
↡高效扩展Transformer推理对应正式目录坐标“3.7.6 高效扩展Transformer推理”,在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 20/21。 原书目录键 3.7.6 高效扩展Transformer推理。对“第3章 Transformer”而言,「3·7·6 高效扩展Transformer推理」在第20次检查中改变可观察状态,因为它负责追踪注意力shape、掩码、位置、缓存、近似和解码状态;shape账本、注意力矩阵、缓存轨迹、延迟、内存与误差必须与“批次、头、序列、通道轴、因果掩码、位置、精度和缓存版本一致”对齐,不能接受掩码、位置或缓存版本错位但输出仍看似合理。
3·8 小结
↡小结对应正式目录坐标“3.8 小结”,在“第3章 Transformer”中用于把本章主张、原始来源、版本、复核结论和未解决缺口双向连接,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 21/21。 原书目录键 3.8 小结。在“第3章 Transformer”的第21个正式坐标中,「3·8 小结」通过把本章主张、原始来源、版本、复核结论和未解决缺口双向连接推进注意力计算、位置与推理状态;复核者保存主张—来源矩阵、版本记录、支持/不支持裁决和缺口清单,出现二手来源或总结段被当作原始实验与普遍结论就撤回结论。
先预测,再操作三个章专属实验
1. 语料、上下文与输出合同
为“第3章 Transformer”选择正式目录坐标,在参考合同与单一反例间切换,逐阶段核对输入、操作、输出证据和裁决。
语料—上下文—输出合同
第3章 Transformer
选择正式目录坐标,再比较参考合同与单一反例如何改变同一条模型链。
阶段 1/4
第3章 Transformer · 数据与输入
- 输入
- 在一个可手算短序列上逐层追踪Transformer与推理解码
- 操作
- 冻结注意力计算、位置与推理状态所需的数据角色、版本、切分、模板和shape
- 输出证据
- 第3章 Transformer的输入合同、版本表与基线快照
- 裁决
- 第3章 Transformer的来源、许可、角色、单位、shape和可见性没有越界
第3章 Transformer的可重放协议
| 阶段 | 允许动作 | 必留证据 | 拒绝条件 |
|---|---|---|---|
| 第3章 Transformer · 数据与输入 | 冻结注意力计算、位置与推理状态所需的数据角色、版本、切分、模板和shape | 第3章 Transformer的输入合同、版本表与基线快照 | 未满足“第3章 Transformer的来源、许可、角色、单位、shape和可见性没有越界” |
| 第3章 Transformer · 目标与计算 | 执行从注意力、编码器—解码器、位置表示、长上下文、外部记忆到推理优化重建Transformer计算链的最小计算并保存中间状态 | 第3章 Transformer的目标分量、计算轨迹与单故障分岔 | 未满足“第3章 Transformer每一步可由同一输入、公式、版本和随机状态复算” |
| 第3章 Transformer · 输出与解码 | 比较输出、路由、检索、策略或资源估计的更新前后状态 | 第3章 Transformer的候选差、引用/策略/资源谱系与恢复路径 | 未满足“第3章 Transformer没有把代理目标、精选输出或训练内统计当作最终结论” |
| 第3章 Transformer · 独立评估 | 重放预测、单故障、恢复和不适用边界 | 第3章 Transformer的接受、回退或拒绝理由 | 未满足“第3章 Transformer满足“批次、头、序列、通道轴、因果掩码、位置、精度和缓存版本一致”” |
unit: "llm-03"
question: "每个张量shape、掩码、位置关系、缓存和近似优化怎样影响同一输出?"
scenario: "在一个可手算短序列上逐层追踪Transformer与推理解码"
invariant: "批次、头、序列、通道轴、因果掩码、位置、精度和缓存版本一致"
fault: "因果掩码方向反转,注意力仍有数值却泄漏未来词元"
evidence: "shape账本、注意力矩阵、缓存轨迹、首差与优化误差"
reset: restore_concept_mode_stage_trace_step_case_gates_and_artifact“第3章 Transformer”要求从同一数据、模型、模板、版本、预算和随机状态重放参考、故障与恢复路径。重置后若目录选择、模式、阶段、轨迹步骤、案例、证据门或交付包没有回到基线,本次比较已经混入状态泄漏。
本页回顾
掌握“第3章 Transformer”不是背模型名或复制提示,而是围绕“每个张量shape、掩码、位置关系、缓存和近似优化怎样影响同一输出?”重建数据、表示、目标、计算、输出、资源和独立评估,并用“批次、头、序列、通道轴、因果掩码、位置、精度和缓存版本一致”拒绝“因果掩码方向反转,注意力仍有数值却泄漏未来词元”。最终交付为shape账本、注意力矩阵、缓存轨迹、首差与优化误差。
练习与答案
练习
- 问题 1:实验合同。 “第3章 Transformer”为什么必须先冻结数据、模型、模板、版本、预算、随机性和评估口径?
- 问题 2:目录逐项覆盖。 怎样证明“第3章 Transformer”的正式目录坐标已经进入机制、交互和练习?
- 问题 3:故障恢复。 怎样证明“因果掩码方向反转,注意力仍有数值却泄漏未来词元”已经被修正?
名词解释
名词解释
本章出现的专业名词,用大白话再讲一遍。
- Transformer
检索键 llm-A 对应正式目录坐标「第3章 Transformer」;在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,需要连接原书范围、计算状态、独立证据和不适用边界。
- Transformer编码器模块
检索键 llm-B 对应正式目录坐标「3·1 Transformer编码器模块」;在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,需要连接原书范围、计算状态、独立证据和不适用边界。
- 编码器-解码器架构
检索键 llm-C 对应正式目录坐标「3·2 编码器-解码器架构」;在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,需要连接原书范围、计算状态、独立证据和不适用边界。
- 位置嵌入
检索键 llm-D 对应正式目录坐标「3·3 位置嵌入」;在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,需要连接原书范围、计算状态、独立证据和不适用边界。
- 绝对位置编码
检索键 llm-E 对应正式目录坐标「3·3·1 绝对位置编码」;在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,需要连接原书范围、计算状态、独立证据和不适用边界。
- 相对位置编码
检索键 llm-F 对应正式目录坐标「3·3·2 相对位置编码」;在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,需要连接原书范围、计算状态、独立证据和不适用边界。
- 更长的上下文
检索键 llm-G 对应正式目录坐标「3·4 更长的上下文」;在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,需要连接原书范围、计算状态、独立证据和不适用边界。
- 外部记忆
检索键 llm-H 对应正式目录坐标「3·5 外部记忆」;在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,需要连接原书范围、计算状态、独立证据和不适用边界。
- 更快、更小的Transformer
检索键 llm-I 对应正式目录坐标「3·6 更快、更小的Transformer」;在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,需要连接原书范围、计算状态、独立证据和不适用边界。
- 高效注意力
检索键 llm-J 对应正式目录坐标「3·6·1 高效注意力」;在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,需要连接原书范围、计算状态、独立证据和不适用边界。
- 条件计算
检索键 llm-K 对应正式目录坐标「3·6·2 条件计算」;在“第3章 Transformer”中用于把“条件计算”放进注意力计算、位置与推理状态的数据—目标—计算—输出链,需要连接原书范围、计算状态、独立证据和不适用边界。
- 搜索高效Transformer
检索键 llm-L 对应正式目录坐标「3·6·3 搜索高效Transformer」;在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,需要连接原书范围、计算状态、独立证据和不适用边界。
- 在单个GPU上一天内训练一个语言模型
检索键 llm-M 对应正式目录坐标「3·6·4 在单个GPU上一天内训练一个语言模型」;在“第3章 Transformer”中用于对齐文本规范化、词元边界、概率分解、序列长度和评估单位,需要连接原书范围、计算状态、独立证据和不适用边界。
- 推理优化
检索键 llm-N 对应正式目录坐标「3·7 推理优化」;在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,需要连接原书范围、计算状态、独立证据和不适用边界。
- 推测解码
检索键 llm-O 对应正式目录坐标「3·7·1 推测解码」;在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,需要连接原书范围、计算状态、独立证据和不适用边界。
- 简化Transformer
检索键 llm-P 对应正式目录坐标「3·7·2 简化Transformer」;在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,需要连接原书范围、计算状态、独立证据和不适用边界。
- 修剪
检索键 llm-Q 对应正式目录坐标「3·7·3 修剪」;在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,需要连接原书范围、计算状态、独立证据和不适用边界。
- 蒸馏
检索键 llm-R 对应正式目录坐标「3·7·4 蒸馏」;在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,需要连接原书范围、计算状态、独立证据和不适用边界。
- 混合精度
检索键 llm-S 对应正式目录坐标「3·7·5 混合精度」;在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,需要连接原书范围、计算状态、独立证据和不适用边界。
- 高效扩展Transformer推理
检索键 llm-T 对应正式目录坐标「3·7·6 高效扩展Transformer推理」;在“第3章 Transformer”中用于追踪注意力shape、掩码、位置、缓存、近似和解码状态,需要连接原书范围、计算状态、独立证据和不适用边界。
- 小结
检索键 llm-U 对应正式目录坐标「3·8 小结」;在“第3章 Transformer”中用于把本章主张、原始来源、版本、复核结论和未解决缺口双向连接,需要连接原书范围、计算状态、独立证据和不适用边界。