前进之路

前进之路逐项覆盖正式目录,以概率、向量、交互采样和工具证据重建原书论证。

为什么先冻结语料、模型版本与生成轨迹

、、、、、共同构成本页坐标。展望神经语言能力与计算语言、结构化知识和可验证工具的组合,而不是要求单一模型内部承担全部精确计算。

本书写于2023年初,主文用较小的GPT-2与Wolfram Language示例帮助读者观察机制,并以当时公开信息高层解释ChatGPT。阅读时必须分开作者亲自运行的示例、对已知神经网络结构的说明、对ChatGPT工程的合理概括,以及关于语言和意义空间的研究假设。模型产品后来更新,不会反向改变书中的论证分母。

每次实验保存原始文本、token序列、词表版本、模型标识、logit、归一化概率、温度、随机种子与采样token。涉及Wolfram|Alpha时,再保存形式查询、工具原始结果、单位、假设和最终回答。只有这些中间对象可重放,才能区分“模型生成了流畅句子”和“句子中的主张已由计算或来源验证”。

数学与计算骨架

system=LLM+tools+protocol+verificationsystem=LLM+tools+protocol+verification P(success)=P(parse)P(execute)P(integrate)P(success)=P(parse)P(execute)P(integrate) evidenceanswerevidence\subseteq answer failureexplicit statusfailure\Rightarrow explicit\ status

公式中的条件分布不代表主观信念,而是模型在固定参数和上下文下给出的数值输出。温度改变分布形状,随机种子决定一次采样路径;两者都不改变训练所得权重。向量投影、注意力热图与工具结果也必须带版本和坐标,不能只凭一张图或最终回答推断内部机制。

三段可运行骨架

def next_token_distribution(model, tokenizer, text, temperature):
    token_ids = tokenizer.encode(text)
    logits = model(token_ids)[-1]
    probabilities = softmax(logits / temperature)
    return token_ids, logits, probabilities
def generate_one_step(model, tokenizer, text, temperature, rng):
    token_ids, logits, probabilities = next_token_distribution(
        model, tokenizer, text, temperature
    )
    next_id = rng.categorical(probabilities)
    return tokenizer.decode(token_ids + [next_id]), next_id, probabilities
def answer_with_tool(question, translate, tool, compose):
    formal_query = translate(question)
    raw_result = tool(formal_query)
    assert raw_result.status == "ok"
    answer = compose(question, raw_result)
    return {"query": formal_query, "raw": raw_result, "answer": answer}

第一段暴露模型概率,第二段暴露自回归外层循环,第三段暴露语言模型与计算工具的责任边界。真实库接口可以不同,但不得把tokenization、概率归一化、采样或工具原始结果藏在无法审计的黑箱中。

固定样例与手算

设五个候选token的logit为2.4、1.8、1.15、0.45和负0.2。温度为1时,先减去最大logit避免指数溢出,再计算指数并除以总和;所有概率必须非负且相加为1。把温度降低到0.5,最高logit对应概率会集中;提高到1.5,尾部token获得更多质量。这个变化说明温度控制采样多样性,而不是让模型学到新知识。

用小语料“a b a c”建立bigram计数:a后面b与c各出现一次,因此经验概率各为二分之一;b后面只见过a。若查询从未出现的上下文,直接计数无法可靠续写。神经模型的任务正是从共享表示和参数中泛化,而不是无限扩大n-gram查表。对照实验应使用同一词表,防止未知token处理悄悄改变分母。

再取两个二维嵌入向量u=(1,0)、v=(0.8,0.6),余弦相似度是0.8。投影到一维后可能改变邻居次序,因此二维或一维图只能提出假设。工具增强实验同样需要对照:问题先转换成形式查询,工具返回带单位结果,最终文本必须逐项蕴含原始结果;若模型擅自改数值,审计应在整合阶段失败。

最后在全新进程重放同一文本、模型摘要、温度和随机种子。首步token序列、logit摘要、概率和采样结果必须一致;如果远程服务不能位级复现,至少固定服务版本并声明允许差异。任何不可重放部分都应作为限制,而不是用新的顺畅回答替代原证据。

常见失败与回退

本章回顾

展望神经语言能力与计算语言、结构化知识和可验证工具的组合,而不是要求单一模型内部承担全部精确计算。 掌握标准是能重建输入、计算、证据和边界,而不是复述“预测下一个词”这句口号。通过标准为:接口定义输入输出类型、权限、超时和证据;任何工具失败都有显式状态,最终回答不把失败包装成成功。

前后导航

讨论

评论区加载中…