什么是 AI Agent
什么是 AI Agent:用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界,以架构、轨迹与故障重放完成工程验收。
学习目标
- 能解释“什么是 AI Agent”如何用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界
- 能区分Agent、感知、行动、观察、自主性,并标出控制权、状态和副作用边界
- 能冻结输入与版本,沿以下证据定位首个分叉:任务输入、控制权、动作请求、环境观察、轮次预算、最终状态与人工接管
- 能注入“系统把多轮聊天包装成 Agent,却没有工具执行、环境观察或可验证完成状态”,完成阻断、恢复、复位和同输入重放
来源、课程身份与适用边界
“什么是 AI Agent”以Anthropic 公开全文《Building effective agents》建立工程总纲,并用Anthropic《Building effective agents》核对本章机制。
这不是一本名为《AI Agent 开发实战》的官方出版物,也不存在官方十四章目录。平台把公开工程文章、官方开发文档和原始论文重组为 14 个工程单元;下列 112 个节点是站内课程地图。正文、代码、图表、实验与练习均为独立教学重写,模型、API、协议或安全边界变化时必须重新验证。
本单元的八个工程坐标
- 什么是 AI Agent:这是“用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界”的第 1 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
- 为什么我们需要一个会「自己办事」的程序:这是“用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界”的第 2 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
- 小特是怎么炼成的:Agent 的四要素:这是“用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界”的第 3 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
- 小特办一件事的一圈:感知 → 决策 → 行动 → 观察:这是“用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界”的第 4 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
- 同样是程序,凭什么它才叫 Agent:这是“用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界”的第 5 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
- 自治性:方向盘交给谁,是可以调的:这是“用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界”的第 6 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
- 动手:把方向盘一点点交出去:这是“用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界”的第 7 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
- 代码长什么样:一段 agent loop 骨架:这是“用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界”的第 8 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
术语与运行合同
↡Agent:模型在运行时依据环境反馈选择工具和后续步骤的系统;在“什么是 AI Agent”中按以下证据核对:任务输入、控制权、动作请求、环境观察、轮次预算、最终状态与人工接管。、↡感知:把用户输入和环境状态转成当前可用事实;在“什么是 AI Agent”中按以下证据核对:任务输入、控制权、动作请求、环境观察、轮次预算、最终状态与人工接管。、↡行动:通过受控工具读取或改变外部环境;在“什么是 AI Agent”中按以下证据核对:任务输入、控制权、动作请求、环境观察、轮次预算、最终状态与人工接管。、↡观察:行动执行后返回并进入下一轮决策的结果;在“什么是 AI Agent”中按以下证据核对:任务输入、控制权、动作请求、环境观察、轮次预算、最终状态与人工接管。、↡自主性:模型在权限和预算内自行决定路径的程度;在“什么是 AI Agent”中按以下证据核对:任务输入、控制权、动作请求、环境观察、轮次预算、最终状态与人工接管。。
本页不变量是:每一次行动都来自明确任务合同,并由新的环境观察推动下一步或停止。任何“成功”结论都要保存任务输入、控制权、动作请求、环境观察、轮次预算、最终状态与人工接管;模型自评、最终措辞和单次 demo 都不能替代环境事实。
工程机制与反证实验
四要素形成闭环
只有模型、工具、状态和运行时共同工作,系统才从文本生成走向可验证行动。
动手验证:删除其中一个要素,记录任务在哪个阶段失去闭环。
控制权决定系统类型
固定代码决定路径的是工作流,模型根据观察决定路径的才是 Agent。
动手验证:把同一任务分别实现为状态机和动态循环,标出决策主体。
自主性必须逐级放开
读权限、写权限和不可逆操作不应一次性全部交给模型。
动手验证:逐档开放权限,比较成功率、风险事件和接管率。
停止状态不能含糊
完成、阻塞、拒绝和人工接管需要不同状态与证据。
动手验证:让工具连续失败,确认预算耗尽不会被标为 done。
从架构到故障重放
1. 架构复杂度实验
在“什么是 AI Agent”中切换简单基线、受控工作流和自主循环,先判断“用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界”是否真的需要更高自主性,再比较延迟、成本、可观测性与风险。
Architecture decision laboratory
什么是 AI Agent
用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界
不变量:每一次行动都来自明确任务合同,并由新的环境观察推动下一步或停止
最小可运行切片
async function run(goal: Goal, runtime: Runtime) {
const trace: Event[] = [];
for (let step = 0; step < runtime.maxSteps; step += 1) {
const decision = await runtime.decide(goal, trace);
if (decision.kind === "final") return runtime.verify(decision, trace);
trace.push(await runtime.execute(decision));
}
return { status: "blocked", reason: "step_budget", trace };
}切片只表达“用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界”的核心合同。生产实现还要补齐持久化、超时、密钥隔离、结构化日志、幂等和批量评测;如果不能重新取得任务输入、控制权、动作请求、环境观察、轮次预算、最终状态与人工接管,代码跑通也不能证明机制正确。
小结
- Agent 用感知、决策、行动、观察与可调自主性定义可运行边界
- 工作流路径由代码固定,Agent 路径由模型依据观察决定
- 核心不变量:每次行动来自明确合同并由新观察推动停止
- 自主性须逐级放开,读、写与不可逆操作权限分层授予
- 最小证据含任务输入、控制权、动作、观察、预算、终态与接管
练习与答案
练习
问题 1:最小证明。 怎样用正常、边界和单故障三类样本证明“每一次行动都来自明确任务合同,并由新的环境观察推动下一步或停止”?
问题 2:节点覆盖。 什么是 AI Agent、为什么我们需要一个会「自己办事」的程序、小特是怎么炼成的:Agent 的四要素、小特办一件事的一圈:感知 → 决策 → 行动 → 观察、同样是程序,凭什么它才叫 Agent、自治性:方向盘交给谁,是可以调的、动手:把方向盘一点点交出去、代码长什么样:一段 agent loop 骨架如何从目录词变成工程证据?
问题 3:恢复验收。 怎样证明“系统把多轮聊天包装成 Agent,却没有工具执行、环境观察或可验证完成状态”已经修复?
本章回顾
- “什么是 AI Agent”解决的是用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界。
- 核心不变量是每一次行动都来自明确任务合同,并由新的环境观察推动下一步或停止。
- 首要反例是系统把多轮聊天包装成 Agent,却没有工具执行、环境观察或可验证完成状态。
- 最小证据包包含任务输入、控制权、动作请求、环境观察、轮次预算、最终状态与人工接管。
名词解释
本章出现的专业名词,用大白话再讲一遍。
- Agent
模型在运行时依据环境反馈选择工具和后续步骤的系统。在“什么是 AI Agent”中必须能按以下证据重新定位:任务输入、控制权、动作请求、环境观察、轮次预算、最终状态与人工接管。
- 感知
把用户输入和环境状态转成当前可用事实。在“什么是 AI Agent”中必须能按以下证据重新定位:任务输入、控制权、动作请求、环境观察、轮次预算、最终状态与人工接管。
- 行动
通过受控工具读取或改变外部环境。在“什么是 AI Agent”中必须能按以下证据重新定位:任务输入、控制权、动作请求、环境观察、轮次预算、最终状态与人工接管。
- 观察
行动执行后返回并进入下一轮决策的结果。在“什么是 AI Agent”中必须能按以下证据重新定位:任务输入、控制权、动作请求、环境观察、轮次预算、最终状态与人工接管。
- 自主性
模型在权限和预算内自行决定路径的程度。在“什么是 AI Agent”中必须能按以下证据重新定位:任务输入、控制权、动作请求、环境观察、轮次预算、最终状态与人工接管。
阅读导航
← 本课程起点 · LLM:Agent 的大脑 →