什么是 AI Agent

读完能用「私人助理小特」的比喻说清 Agent 是什么、它和纯 LLM/固定工作流的区别,并指出感知-决策-行动-观察循环的四个环节。

为什么只记结论不足以掌握什么是 AI Agent

学习“什么是 AI Agent”时,第一步不是记住结论,而是冻结输入、上下文、版本和成功标准。只有这些条件明确,什么是 AI Agent的含义才不会随着样例变化。正文已有的概念说明要与结构图、运行轨迹和失败样本互相印证,不能只凭最终输出看似正确就宣布完成。

结构分析从为什么我们需要一个会「自己办事」的程序开始:列出参与者、职责、连接方向、生命周期和所有权,再沿正常路径追踪数据或控制流。每一条边都要说明为什么存在、谁创建、谁消费、谁负责清理;如果边界被跨越,必须能在证据中找到第一处异常。

机制验证要把小特是怎么炼成的:Agent 的四要素写成可以执行的条件。正常样本证明主路径,恰好边界样本验证等号和空值,单故障样本只破坏一个假设。三类样本使用同一份观察指标,避免因为测试口径变化而把偶然结果误认成规律。

成本分析同时记录时间、空间、延迟、耦合、可维护性和不可逆操作。小特办一件事的一圈:感知 → 决策 → 行动 → 观察不是一句“可能失败”,而是可复现输入、预期停点、实际轨迹、错误分类与清理步骤。任何自动重试都要有次数、预算和幂等边界。

方案比较不能只列优点。需要给出直接实现、当前方案和至少一个替代方案,逐项比较复杂度、扩展点、故障隔离和团队认知成本。当问题规模很小或变化轴稳定时,更简单的实现往往更好;模式与框架必须由真实变化压力证明。

实现阶段把大结论拆成可检查的中间产物:配置快照、结构清单、状态转移、输入输出样本、日志摘要和测试结果。每个产物带来源与生成命令,下一阶段只消费已通过门禁的版本,避免旧缓存或隐式默认值污染结论。

解释结果时必须区分相关性与因果性、接口承诺与实现细节、设计意图与运行事实。对“同样是程序,凭什么它才叫 Agent”的判断要由独立证据支持,并明确适用范围;一旦输入分布、版本、硬件或组织边界改变,就重新运行最小实验。

复盘从首个分叉开始,而不是从最后一个报错倒推。先比较冻结输入,再比较第一份结构化中间产物,随后检查状态、约束和副作用。这样可以把复杂系统的排错范围收缩到一个阶段,避免在多个层次同时修改造成新的不确定性。

迁移到真实项目时,先选择一个最小但有代表性的切片,保存改造前基线,再逐步引入“什么是 AI Agent”中的机制。每一步只改变一个变量并保留回滚点;性能、正确性、安全性和可理解性至少各有一项可量化指标。

最终验收要求读者能脱离页面重新画出结构、口述关键链路、实现最小版本、构造一个反例并解释失败位置。若只能复述名词而不能预测中间状态,说明知识仍停留在识记层,需要回到图示和实验重新验证。

本页用、

、、、建立统一坐标。先预测这些概念在结构图和运行轨迹中的位置,再操作实验控件;如果结果与预测不一致,停止在首个分叉,不要用后续补丁掩盖早期错误。

权威目录与核心概念逐项对照

  • 什么是 AI Agent
  • 为什么我们需要一个会「自己办事」的程序
  • 小特是怎么炼成的:Agent 的四要素
  • 小特办一件事的一圈:感知 → 决策 → 行动 → 观察
  • 同样是程序,凭什么它才叫 Agent
  • 自治性:方向盘交给谁,是可以调的
  • 动手:把方向盘一点点交出去
  • 代码长什么样:一段 agent loop 骨架

可复现的最小实现

先把决策记录写成机器可读结构:

{
  "unit": "什么是 AI Agent",
  "inputFrozen": true,
  "scenario": "normal | boundary | single-fault",
  "firstDivergence": null,
  "cleanupRequired": true
}

再用同一条执行链处理三类样本:

type Evidence = { stage: string; expected: string; actual: string };
 
function verify(sample: unknown, expected: readonly Evidence[]) {
  const trace = runFromCleanState(sample);
  return expected.find((item, index) => trace[index]?.actual !== item.expected);
}

最后保存回归门禁,禁止失败样本静默通过:

normal      -> complete, invariant preserved
boundary    -> complete or explicit rejection
singleFault -> stop at first divergence, no stale output

用统一评分解释实验结果:

Q=Ccorrect+Ctrace+CrecoverRresidualQ = C_{correct} + C_{trace} + C_{recover} - R_{residual} Ccoverage=NverifiedNofficialC_{coverage} = \frac{N_{verified}}{N_{official}} Rresidual=P(failure)×I(impact)R_{residual} = P(failure) \times I(impact) Accept=(Ccoverage0.90)(RresidualRbudget)Accept = (C_{coverage} \ge 0.90) \land (R_{residual} \le R_{budget})

本章回顾

  • 什么是 AI Agent必须绑定冻结输入和明确成功标准。
  • 为什么我们需要一个会「自己办事」的程序必须能画成结构并沿边追踪责任。
  • 小特是怎么炼成的:Agent 的四要素要由正常、边界和单故障样本共同验证。
  • 小特办一件事的一圈:感知 → 决策 → 行动 → 观察必须保存第一处偏离和清理重建步骤。
  • 同样是程序,凭什么它才叫 Agent决定方案是否可以进入下一阶段。

术语表

为什么我们需要一个会「自己办事」的程序

你给一个特别能干的私人助理——我们叫他小特——发条消息:「帮我订明天去上海的高铁票,上午到,预算 500。」然后你就去忙别的了。小特自己去比价、挑车次、下单、确认出票,办完才回你一句「订好了,G1 次 7:30」。

注意小特做的,不是「回答你一个问题」,而是替你把一件事从头办到尾。中间他要查信息、做判断、动手操作、看结果对不对——你只交代了目标,过程全是他自己张罗。

这一章就讲清:能像小特这样「自己把差事办完」的程序,就叫 AI Agent。没有它会怎样?你只能得到一个「问一句答一句」的工具,每一步都得你亲自盯着、亲自点确认,它永远不会自己往前走一步。

动手:把方向盘一点点交出去

上一节说自治性是一条谱系。光读不够,自己拖一拖才有感觉。下面这个 Demo 有 5 个级别 L1→L5,拖滑块或点按钮切级别,看下方「决策权」那条分裂条怎么变——人占多少、Agent 占多少。

猜一猜:把级别调到 L5(全自治),方向盘交给谁?人还剩多少决策权?先猜一个数,再拖滑块验证。

可交互自治性谱系:级别越高,方向盘越多地交给 Agent
L1L2L3L4L5← 人主导Agent 主导 →决策权:谁做主(L3 半自治)人 45%Agent 55%Agent 自己跑多数步骤,遇到关键决策才找人例:小特自己比价、下单,只在超预算时才问你
L3

调到 L5 你会看到:决策权几乎全归 Agent,人只剩一条缝。这正是「全自治」——把整件事丢给小特,办完才告诉你结果。对照一下 L2,你就明白为什么说「自治性是可调的,要按场景配」。

代码长什么样:一段 agent loop 骨架

上面那张循环图,翻译成代码,核心就是一个 while 循环——感知、决策、行动、观察,转一圈,没办成就再转。下面这段 Python 骨架(把工具细节都省了)就是 Agent 的心脏:

def run_agent(goal):
    done = False
    while not done:                     # 一圈一圈转,直到差事办成
        obs = perceive()                # ① 感知:看清现在的处境
        thought = llm.think(obs, goal)  # ② 决策:大脑想清楚下一步
        action = thought.next_action    # 从想法里取出要做的动作
        result = act(action)            # ③ 行动:调工具真的去做
        done = goal_reached(result)     # ④ 观察:办成了吗?没成就再转一圈
    return result

四行核心语句正好对应图里四个环节:perceive 是感知、llm.think 是决策、act 是行动、goal_reached 是观察。注意 act() 这一步——它会真的去调外部工具、改变世界,这就是 Agent 和「只在脑子里想」的纯 LLM 的分水岭。

而那个 while not done 就是图里的「再转一圈」。把它去掉、只跑一次,Agent 立刻退化成「问一句答一句」的纯 LLM。所以这个循环,才是它之所以是 Agent 的根本。

容易踩的坑

小结

  • AI Agent = 替你把差事从头办到尾的程序,四要素:大脑(LLM)、手(工具)、本子(记忆)、差事(目标)
  • 它一圈圈转着办事:感知 → 决策 → 行动 → 观察,办不成就带新信息再转一圈
  • 纯 LLM 只答一次、固定工作流照编死的链走,只有 Agent 有那条「自主决定下一步」的反馈循环
  • 自治性是一条 L1→L5 的谱系,方向盘多少交给 Agent 可调;不是越高越好,关键决策留人工确认
  • 判断一个程序是不是 Agent,就看它有没有「LLM 自主决策 + 调工具 + 看结果再决定」的循环

讨论

评论区加载中…