LLM:Agent 的大脑
LLM:Agent 的大脑:理解 token、上下文、逐 token 生成和采样边界,避免把语言流畅误当事实检索,以架构、轨迹与故障重放完成工程验收。
学习目标
- 能解释“LLM:Agent 的大脑”如何理解 token、上下文、逐 token 生成和采样边界,避免把语言流畅误当事实检索
- 能区分token、上下文窗口、logits、temperature、幻觉,并标出控制权、状态和副作用边界
- 能冻结输入与版本,沿以下证据定位首个分叉:模型版本、消息、token 预算、采样参数、原始响应、来源检索与验证结果
- 能注入“模型以高置信语气编造不存在的接口,运行时未检索或校验就执行后续步骤”,完成阻断、恢复、复位和同输入重放
来源、课程身份与适用边界
“LLM:Agent 的大脑”以Anthropic 公开全文《Building effective agents》建立工程总纲,并用Anthropic《Effective context engineering for AI agents》核对本章机制。
这不是一本名为《AI Agent 开发实战》的官方出版物,也不存在官方十四章目录。平台把公开工程文章、官方开发文档和原始论文重组为 14 个工程单元;下列 112 个节点是站内课程地图。正文、代码、图表、实验与练习均为独立教学重写,模型、API、协议或安全边界变化时必须重新验证。
本单元的八个工程坐标
- LLM:Agent 的大脑:这是“理解 token、上下文、逐 token 生成和采样边界,避免把语言流畅误当事实检索”的第 1 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
- 小特的大脑,到底是怎么读你的话的:这是“理解 token、上下文、逐 token 生成和采样边界,避免把语言流畅误当事实检索”的第 2 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
- 大脑眼里没有「字」,只有 token:这是“理解 token、上下文、逐 token 生成和采样边界,避免把语言流畅误当事实检索”的第 3 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
- 一次能「看进」多少:上下文窗口:这是“理解 token、上下文、逐 token 生成和采样边界,避免把语言流畅误当事实检索”的第 4 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
- 它怎么「写」下一个字:采样与温度:这是“理解 token、上下文、逐 token 生成和采样边界,避免把语言流畅误当事实检索”的第 5 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
- 它不是在查事实,它在「续写」:幻觉:这是“理解 token、上下文、逐 token 生成和采样边界,避免把语言流畅误当事实检索”的第 6 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
- 承上启下:正因为大脑有这些短板,Agent 才要配工具和记忆:这是“理解 token、上下文、逐 token 生成和采样边界,避免把语言流畅误当事实检索”的第 7 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
- 动手一:把对话堆满,看大脑怎么忘事:这是“理解 token、上下文、逐 token 生成和采样边界,避免把语言流畅误当事实检索”的第 8 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
术语与运行合同
↡token:模型处理文本时使用的离散单元;在“LLM:Agent 的大脑”中按以下证据核对:模型版本、消息、token 预算、采样参数、原始响应、来源检索与验证结果。、↡上下文窗口:一次推理能接收的 token 集合与上限;在“LLM:Agent 的大脑”中按以下证据核对:模型版本、消息、token 预算、采样参数、原始响应、来源检索与验证结果。、↡logits:模型对候选下一 token 给出的未归一化分数;在“LLM:Agent 的大脑”中按以下证据核对:模型版本、消息、token 预算、采样参数、原始响应、来源检索与验证结果。、↡temperature:调节候选分布平坦程度的采样参数;在“LLM:Agent 的大脑”中按以下证据核对:模型版本、消息、token 预算、采样参数、原始响应、来源检索与验证结果。、↡幻觉:模型生成流畅但缺少可靠事实依据的内容;在“LLM:Agent 的大脑”中按以下证据核对:模型版本、消息、token 预算、采样参数、原始响应、来源检索与验证结果。。
本页不变量是:模型输出只能作为概率候选,事实、结构和副作用必须由外部证据或确定性校验确认。任何“成功”结论都要保存模型版本、消息、token 预算、采样参数、原始响应、来源检索与验证结果;模型自评、最终措辞和单次 demo 都不能替代环境事实。
工程机制与反证实验
模型处理 token 而不是人类字符
分词会影响长度、成本和边界,不能用字符数直接代替 token 预算。
动手验证:对中英混合、代码和 emoji 分词,比较字符数与 token 数。
上下文是有限工作区
窗口能装下不等于模型能同等利用所有信息,长上下文还会稀释注意。
动手验证:移动关键事实的位置,测量同一问题的召回变化。
采样改变分布而非知识
温度和 top-p 控制候选选择,不会把未知事实变成已知。
动手验证:固定提示多次采样,比较多样性与事实校验通过率。
流畅输出仍需验证
下一 token 预测可以生成貌似合理的接口和引用,Agent 必须用工具取得 ground truth。
动手验证:加入一个不存在的 API 名称,确认执行前被检索或注册表挡住。
从架构到故障重放
1. 架构复杂度实验
在“LLM:Agent 的大脑”中切换简单基线、受控工作流和自主循环,先判断“理解 token、上下文、逐 token 生成和采样边界,避免把语言流畅误当事实检索”是否真的需要更高自主性,再比较延迟、成本、可观测性与风险。
Architecture decision laboratory
LLM:Agent 的大脑
理解 token、上下文、逐 token 生成和采样边界,避免把语言流畅误当事实检索
不变量:模型输出只能作为概率候选,事实、结构和副作用必须由外部证据或确定性校验确认
最小可运行切片
const request = {
model: pinnedModel,
messages: fitContext(messages, tokenBudget),
temperature: 0.2,
};
const response = await model.generate(request);
const claims = extractVerifiableClaims(response);
const verified = await verifyWithTools(claims);
return attachEvidence(response, verified);切片只表达“理解 token、上下文、逐 token 生成和采样边界,避免把语言流畅误当事实检索”的核心合同。生产实现还要补齐持久化、超时、密钥隔离、结构化日志、幂等和批量评测;如果不能重新取得模型版本、消息、token 预算、采样参数、原始响应、来源检索与验证结果,代码跑通也不能证明机制正确。
小结
- LLM 处理 token 而非字符,上下文窗口是有限工作区
- 采样改变候选分布而非知识,温度不补未知事实
- 流畅输出可能是幻觉,事实须由工具取得 ground truth
- 核心不变量:模型输出仅为概率候选,须外部证据校验
- 最小证据含模型版本、消息、token 预算、采样参数与原始响应
练习与答案
练习
问题 1:最小证明。 怎样用正常、边界和单故障三类样本证明“模型输出只能作为概率候选,事实、结构和副作用必须由外部证据或确定性校验确认”?
问题 2:节点覆盖。 LLM:Agent 的大脑、小特的大脑,到底是怎么读你的话的、大脑眼里没有「字」,只有 token、一次能「看进」多少:上下文窗口、它怎么「写」下一个字:采样与温度、它不是在查事实,它在「续写」:幻觉、承上启下:正因为大脑有这些短板,Agent 才要配工具和记忆、动手一:把对话堆满,看大脑怎么忘事如何从目录词变成工程证据?
问题 3:恢复验收。 怎样证明“模型以高置信语气编造不存在的接口,运行时未检索或校验就执行后续步骤”已经修复?
本章回顾
- “LLM:Agent 的大脑”解决的是理解 token、上下文、逐 token 生成和采样边界,避免把语言流畅误当事实检索。
- 核心不变量是模型输出只能作为概率候选,事实、结构和副作用必须由外部证据或确定性校验确认。
- 首要反例是模型以高置信语气编造不存在的接口,运行时未检索或校验就执行后续步骤。
- 最小证据包包含模型版本、消息、token 预算、采样参数、原始响应、来源检索与验证结果。
名词解释
本章出现的专业名词,用大白话再讲一遍。
- token
模型处理文本时使用的离散单元。在“LLM:Agent 的大脑”中必须能按以下证据重新定位:模型版本、消息、token 预算、采样参数、原始响应、来源检索与验证结果。
- 上下文窗口
一次推理能接收的 token 集合与上限。在“LLM:Agent 的大脑”中必须能按以下证据重新定位:模型版本、消息、token 预算、采样参数、原始响应、来源检索与验证结果。
- logits
模型对候选下一 token 给出的未归一化分数。在“LLM:Agent 的大脑”中必须能按以下证据重新定位:模型版本、消息、token 预算、采样参数、原始响应、来源检索与验证结果。
- temperature
调节候选分布平坦程度的采样参数。在“LLM:Agent 的大脑”中必须能按以下证据重新定位:模型版本、消息、token 预算、采样参数、原始响应、来源检索与验证结果。
- 幻觉
模型生成流畅但缺少可靠事实依据的内容。在“LLM:Agent 的大脑”中必须能按以下证据重新定位:模型版本、消息、token 预算、采样参数、原始响应、来源检索与验证结果。