《大规模语言模型:从理论到实践》权威学习地图

按第一版前言、数学符号、8章、参考文献与索引冻结127个正式目录层级,建立从Transformer、数据和分布式训练到SFT、RLHF、应用与评估的完整依赖图。

为什么先冻结版本、对象与验收命题

、、、、、共同构成本页坐标。按第一版前言、数学符号、8章、参考文献与索引冻结127个正式目录层级,建立从Transformer、数据和分布式训练到SFT、RLHF、应用与评估的完整依赖图。 本页不是模型或工具名清单,而是从问题、数学、数据、实现、实验到失败回退的闭环;每项结论都要求找到可观察的中间对象。

本书严格采用2024年第一版:前言、数学符号、8章、参考文献和索引。2025年第二版扩展为12章且ISBN不同,不并入本页目录分母。模型库、框架接口和在线服务会继续变化,因此固定原理、原书历史坐标、本站复现实验与后续工程选择之间的边界。

每次实验保存来源版本、数据哈希与切分、词元器、模型配置、代码提交、依赖锁、种子、硬件、预算、阶段产物和逐样本评测。只有最终文本、训练损失或排行榜无法区分数据泄漏、mask错位、预算差异、奖励偏移和评测污染,也不能证明另一台机器可重放。

数学与资源骨架

p(x)=prodt=1Tp(xtmidx1:t1)p(x)=prod_{t=1}^{T}p(x_tmid x_{1:t-1}) A(Q,K,V)=operatorname{softmax}left( rac{QK^T}{sqrt{d_k}}+M ight)V hetak+1=hetaketa,widehatablahetamathcalL(hetak) heta_{k+1}= heta_k-eta,widehat{ abla}_{ heta}mathcal{L}( heta_k) E=sourceimesreproducibilityimesboundaryE=source imes reproducibility imes boundary

第一式固定自回归概率及条件上下文;比较困惑度时还要固定分词器或换成相同字符、字节、完整序列单位。第二式固定注意力形状、缩放与mask;被遮蔽位置的权重必须为零。第三式要求学习率、有效批量、梯度累积和数据顺序进入训练合同。第四式把来源、可复现性和边界同时作为强结论的必要条件。

公式不仅用于说明概念,还用于检查实现。先写每个张量的批量、序列、头和通道维度,逐元素验证mask,再记录前向值、损失、梯度范数和更新后参数。若使用混合精度、并行通信、低秩适配或PPO,继续记录缩放、分片、裁剪和KL项,不能把框架默认值当成数学定义。

三段可运行骨架

def freeze_run(source, data_hash, tokenizer, model, seed, config):
    return {"source": source, "data": data_hash, "tokenizer": tokenizer,
            "model": model, "seed": seed, "config": config}
def compare_controlled(baseline, candidate, changed):
    assert len(changed) == 1, "一次只改变一个可归因因素"
    return {key: candidate[key] - baseline[key] for key in baseline}
def evidence_gate(records):
    required = {"source", "inputs", "config", "outputs", "limits"}
    missing = [i for i, record in enumerate(records)
               if not required.issubset(record)]
    return {"pass": not missing, "missing_records": missing}

第一段产生不可变运行清单,第二段强制单变量对照,第三段在结论前检查证据。接入HuggingFace、DeepSpeed、MOSS、LangChain或vLLM时,只由薄适配器提供真实执行对象;清单字段、对照顺序和失败协议保持稳定,使库升级导致的默认值变化成为可见差异。

固定样例与手算

取三个目标词元的条件概率0.8、0.5和0.25,平均负对数似然约为0.998,困惑度约为2.71。若另一分词器把相同文本切为六个词元,词元级困惑度不能直接横比;应报告完整序列对数似然、字符或字节单位,并附切分结果和未知字符。

注意力例取二维查询q=(1,0),键k1=(1,0)、k2=(0,1),值v1=(2,0)、v2=(0,2)。缩放得分为1/根号2和0,softmax权重约0.67与0.33,输出约(1.34,0.66)。加入因果mask后,被遮蔽位置权重严格为0;否则损失下降可能来自未来信息泄漏。

训练例令标量参数为2、梯度为0.3、学习率为0.1,更新后参数应为1.97。若梯度累积四次却未除以累积步数,等效更新扩大四倍;若数据并行又做求和归约,世界规模也会改变有效梯度。资源账本必须同时记录全局批量、词元数、峰值显存、通信字节和每秒有效词元。

常见失败与回退

本章回顾

按第一版前言、数学符号、8章、参考文献与索引冻结127个正式目录层级,建立从Transformer、数据和分布式训练到SFT、RLHF、应用与评估的完整依赖图。 掌握标准不是记住术语或接口,而是能重建输入、假设、数学、数据、实现、对照、指标、限制与失败证据。通过标准为:能从任一正式目录项定位到页面、公式、代码、交互实验、失败样本、复习题与第一版来源。

前后导航

讨论

评论区加载中…