什么是 AI Agent

什么是 AI Agent:用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界,以架构、轨迹与故障重放完成工程验收。

学习目标

  • 能解释“什么是 AI Agent”如何用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界
  • 能区分Agent、感知、行动、观察、自主性,并标出控制权、状态和副作用边界
  • 能冻结输入与版本,沿以下证据定位首个分叉:任务输入、控制权、动作请求、环境观察、轮次预算、最终状态与人工接管
  • 能注入“系统把多轮聊天包装成 Agent,却没有工具执行、环境观察或可验证完成状态”,完成阻断、恢复、复位和同输入重放

来源、课程身份与适用边界

“什么是 AI Agent”以Anthropic 公开全文《Building effective agents》建立工程总纲,并用Anthropic《Building effective agents》核对本章机制。

这不是一本名为《AI Agent 开发实战》的官方出版物,也不存在官方十四章目录。平台把公开工程文章、官方开发文档和原始论文重组为 14 个工程单元;下列 112 个节点是站内课程地图。正文、代码、图表、实验与练习均为独立教学重写,模型、API、协议或安全边界变化时必须重新验证。

本单元的八个工程坐标

  • 什么是 AI Agent:这是“用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界”的第 1 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
  • 为什么我们需要一个会「自己办事」的程序:这是“用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界”的第 2 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
  • 小特是怎么炼成的:Agent 的四要素:这是“用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界”的第 3 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
  • 小特办一件事的一圈:感知 → 决策 → 行动 → 观察:这是“用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界”的第 4 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
  • 同样是程序,凭什么它才叫 Agent:这是“用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界”的第 5 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
  • 自治性:方向盘交给谁,是可以调的:这是“用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界”的第 6 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
  • 动手:把方向盘一点点交出去:这是“用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界”的第 7 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
  • 代码长什么样:一段 agent loop 骨架:这是“用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界”的第 8 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。

术语与运行合同

本页不变量是:每一次行动都来自明确任务合同,并由新的环境观察推动下一步或停止。任何“成功”结论都要保存任务输入、控制权、动作请求、环境观察、轮次预算、最终状态与人工接管;模型自评、最终措辞和单次 demo 都不能替代环境事实。

工程机制与反证实验

四要素形成闭环

只有模型、工具、状态和运行时共同工作,系统才从文本生成走向可验证行动。

动手验证:删除其中一个要素,记录任务在哪个阶段失去闭环。

控制权决定系统类型

固定代码决定路径的是工作流,模型根据观察决定路径的才是 Agent。

动手验证:把同一任务分别实现为状态机和动态循环,标出决策主体。

自主性必须逐级放开

读权限、写权限和不可逆操作不应一次性全部交给模型。

动手验证:逐档开放权限,比较成功率、风险事件和接管率。

停止状态不能含糊

完成、阻塞、拒绝和人工接管需要不同状态与证据。

动手验证:让工具连续失败,确认预算耗尽不会被标为 done。

从架构到故障重放

分步1 / 3

1. 架构复杂度实验

在“什么是 AI Agent”中切换简单基线、受控工作流和自主循环,先判断“用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界”是否真的需要更高自主性,再比较延迟、成本、可观测性与风险。

Architecture decision laboratory

什么是 AI Agent

用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界

复杂度档位

不变量:每一次行动都来自明确任务合同,并由新的环境观察推动下一步或停止

受控工作流:只激活能够由收益证明的阶段1接收目标2选择控制权3请求动作4读取观察5完成或接管蓝色表示当前方案承担的责任;虚线阶段仍留在系统边界外。关键证据:任务输入、控制权、…
自主性46
延迟52
成本48
可观测78

最小可运行切片

async function run(goal: Goal, runtime: Runtime) {
  const trace: Event[] = [];
  for (let step = 0; step < runtime.maxSteps; step += 1) {
    const decision = await runtime.decide(goal, trace);
    if (decision.kind === "final") return runtime.verify(decision, trace);
    trace.push(await runtime.execute(decision));
  }
  return { status: "blocked", reason: "step_budget", trace };
}

切片只表达“用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界”的核心合同。生产实现还要补齐持久化、超时、密钥隔离、结构化日志、幂等和批量评测;如果不能重新取得任务输入、控制权、动作请求、环境观察、轮次预算、最终状态与人工接管,代码跑通也不能证明机制正确。

小结

  • Agent 用感知、决策、行动、观察与可调自主性定义可运行边界
  • 工作流路径由代码固定,Agent 路径由模型依据观察决定
  • 核心不变量:每次行动来自明确合同并由新观察推动停止
  • 自主性须逐级放开,读、写与不可逆操作权限分层授予
  • 最小证据含任务输入、控制权、动作、观察、预算、终态与接管

练习与答案

练习

问题 1:最小证明。 怎样用正常、边界和单故障三类样本证明“每一次行动都来自明确任务合同,并由新的环境观察推动下一步或停止”?

问题 2:节点覆盖。 什么是 AI Agent、为什么我们需要一个会「自己办事」的程序、小特是怎么炼成的:Agent 的四要素、小特办一件事的一圈:感知 → 决策 → 行动 → 观察、同样是程序,凭什么它才叫 Agent、自治性:方向盘交给谁,是可以调的、动手:把方向盘一点点交出去、代码长什么样:一段 agent loop 骨架如何从目录词变成工程证据?

问题 3:恢复验收。 怎样证明“系统把多轮聊天包装成 Agent,却没有工具执行、环境观察或可验证完成状态”已经修复?

本章回顾

  • “什么是 AI Agent”解决的是用感知、决策、行动、观察和可调自主性定义可运行的 Agent 边界。
  • 核心不变量是每一次行动都来自明确任务合同,并由新的环境观察推动下一步或停止。
  • 首要反例是系统把多轮聊天包装成 Agent,却没有工具执行、环境观察或可验证完成状态。
  • 最小证据包包含任务输入、控制权、动作请求、环境观察、轮次预算、最终状态与人工接管。

名词解释

本章出现的专业名词,用大白话再讲一遍。

Agent

模型在运行时依据环境反馈选择工具和后续步骤的系统。在“什么是 AI Agent”中必须能按以下证据重新定位:任务输入、控制权、动作请求、环境观察、轮次预算、最终状态与人工接管。

感知

把用户输入和环境状态转成当前可用事实。在“什么是 AI Agent”中必须能按以下证据重新定位:任务输入、控制权、动作请求、环境观察、轮次预算、最终状态与人工接管。

行动

通过受控工具读取或改变外部环境。在“什么是 AI Agent”中必须能按以下证据重新定位:任务输入、控制权、动作请求、环境观察、轮次预算、最终状态与人工接管。

观察

行动执行后返回并进入下一轮决策的结果。在“什么是 AI Agent”中必须能按以下证据重新定位:任务输入、控制权、动作请求、环境观察、轮次预算、最终状态与人工接管。

自主性

模型在权限和预算内自行决定路径的程度。在“什么是 AI Agent”中必须能按以下证据重新定位:任务输入、控制权、动作请求、环境观察、轮次预算、最终状态与人工接管。

阅读导航

← 本课程起点 · LLM:Agent 的大脑 →

讨论

评论区加载中…