评估与可观测性
评估与可观测性:用 trace、span、环境状态、确定性 grader 与校准后的模型 grader 建立回归和生产监控,以架构、轨迹与故障重放完成工程验收。
学习目标
- 能解释“评估与可观测性”如何用 trace、span、环境状态、确定性 grader 与校准后的模型 grader 建立回归和生产监控
- 能区分trace、span、grader、回归集、在线监控,并标出控制权、状态和副作用边界
- 能冻结输入与版本,沿以下证据定位首个分叉:eval case、模型版本、完整 messages、tool events、环境快照、grader、分数、延迟与成本
- 能注入“只评价最终回答是否顺眼,忽略越权工具调用、绕路、成本和错误恢复”,完成阻断、恢复、复位和同输入重放
来源、课程身份与适用边界
“评估与可观测性”以Anthropic 公开全文《Building effective agents》建立工程总纲,并用Anthropic《Demystifying evals for AI agents》核对本章机制。
这不是一本名为《AI Agent 开发实战》的官方出版物,也不存在官方十四章目录。平台把公开工程文章、官方开发文档和原始论文重组为 14 个工程单元;下列 112 个节点是站内课程地图。正文、代码、图表、实验与练习均为独立教学重写,模型、API、协议或安全边界变化时必须重新验证。
本单元的八个工程坐标
- 评估与可观测性:这是“用 trace、span、环境状态、确定性 grader 与校准后的模型 grader 建立回归和生产监控”的第 1 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
- 小特上岗了,可你看不见它在干什么:这是“用 trace、span、环境状态、确定性 grader 与校准后的模型 grader 建立回归和生产监控”的第 2 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
- 为什么 Agent 上线后必须能「看见」和「量得出」:这是“用 trace、span、环境状态、确定性 grader 与校准后的模型 grader 建立回归和生产监控”的第 3 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
- trace 与 span:把一次运行的每一步都记下来:这是“用 trace、span、环境状态、确定性 grader 与校准后的模型 grader 建立回归和生产监控”的第 4 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
- 三种评估方法:怎么判断 Agent 答得好不好(对比取舍):这是“用 trace、span、环境状态、确定性 grader 与校准后的模型 grader 建立回归和生产监控”的第 5 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
- 回归与监控:改完一版,怎么确认没把别的地方改坏:这是“用 trace、span、环境状态、确定性 grader 与校准后的模型 grader 建立回归和生产监控”的第 6 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
- 动手玩:当一回裁判,再当一回回归探长:这是“用 trace、span、环境状态、确定性 grader 与校准后的模型 grader 建立回归和生产监控”的第 7 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
- 动手一:答得准,就一定得高分吗:这是“用 trace、span、环境状态、确定性 grader 与校准后的模型 grader 建立回归和生产监控”的第 8 个工程坐标;必须进入机制解释、运行轨迹或故障证据,不能只停在目录。
术语与运行合同
↡trace:一次 Agent 运行的完整事件链;在“评估与可观测性”中按以下证据核对:eval case、模型版本、完整 messages、tool events、环境快照、grader、分数、延迟与成本。、↡span:trace 中一个模型、工具或业务步骤的时间区间;在“评估与可观测性”中按以下证据核对:eval case、模型版本、完整 messages、tool events、环境快照、grader、分数、延迟与成本。、↡grader:对结果、轨迹或环境状态进行评分的函数;在“评估与可观测性”中按以下证据核对:eval case、模型版本、完整 messages、tool events、环境快照、grader、分数、延迟与成本。、↡回归集:用于比较版本变化的冻结代表任务集合;在“评估与可观测性”中按以下证据核对:eval case、模型版本、完整 messages、tool events、环境快照、grader、分数、延迟与成本。、↡在线监控:生产流量中持续观察质量、延迟、成本和风险信号;在“评估与可观测性”中按以下证据核对:eval case、模型版本、完整 messages、tool events、环境快照、grader、分数、延迟与成本。。
本页不变量是:每个评分都能回到输入、完整轨迹、环境结果、grader 版本和可复跑样本。任何“成功”结论都要保存eval case、模型版本、完整 messages、tool events、环境快照、grader、分数、延迟与成本;模型自评、最终措辞和单次 demo 都不能替代环境事实。
工程机制与反证实验
任务定义先于指标
没有明确输入、环境和成功状态,单个分数无法解释。
动手验证:把“回答得好”改写为可验证任务与结果。
结果与轨迹都要评分
最终正确但调用越权、成本异常或走了脆弱路径仍应失败。
动手验证:加入工具次数、权限和首错 grader。
模型 grader 需要校准
主观维度可用模型评审,但要与人工标签对齐并监控漂移。
动手验证:计算 grader 与双人标注的一致率。
生产反馈回流离线集
线上新失败簇应脱敏后进入回归集,避免只优化旧样本。
动手验证:从告警中抽样、分类并新增最小复现用例。
从架构到故障重放
1. 架构复杂度实验
在“评估与可观测性”中切换简单基线、受控工作流和自主循环,先判断“用 trace、span、环境状态、确定性 grader 与校准后的模型 grader 建立回归和生产监控”是否真的需要更高自主性,再比较延迟、成本、可观测性与风险。
Architecture decision laboratory
评估与可观测性
用 trace、span、环境状态、确定性 grader 与校准后的模型 grader 建立回归和生产监控
不变量:每个评分都能回到输入、完整轨迹、环境结果、grader 版本和可复跑样本
最小可运行切片
const run = await harness.execute(evalCase);
const scores = await Promise.all([
taskResultGrader(run.environment),
toolPolicyGrader(run.trace),
latencyCostGrader(run.metrics),
calibratedModelGrader(run.messages),
]);
storeEval({ evalCase, run, scores, versions });
assertNoRegression(scores, baseline);切片只表达“用 trace、span、环境状态、确定性 grader 与校准后的模型 grader 建立回归和生产监控”的核心合同。生产实现还要补齐持久化、超时、密钥隔离、结构化日志、幂等和批量评测;如果不能重新取得eval case、模型版本、完整 messages、tool events、环境快照、grader、分数、延迟与成本,代码跑通也不能证明机制正确。
练习与答案
练习
问题 1:最小证明。 怎样用正常、边界和单故障三类样本证明“每个评分都能回到输入、完整轨迹、环境结果、grader 版本和可复跑样本”?
问题 2:节点覆盖。 评估与可观测性、小特上岗了,可你看不见它在干什么、为什么 Agent 上线后必须能「看见」和「量得出」、trace 与 span:把一次运行的每一步都记下来、三种评估方法:怎么判断 Agent 答得好不好(对比取舍)、回归与监控:改完一版,怎么确认没把别的地方改坏、动手玩:当一回裁判,再当一回回归探长、动手一:答得准,就一定得高分吗如何从目录词变成工程证据?
问题 3:恢复验收。 怎样证明“只评价最终回答是否顺眼,忽略越权工具调用、绕路、成本和错误恢复”已经修复?
本章回顾
- “评估与可观测性”解决的是用 trace、span、环境状态、确定性 grader 与校准后的模型 grader 建立回归和生产监控。
- 核心不变量是每个评分都能回到输入、完整轨迹、环境结果、grader 版本和可复跑样本。
- 首要反例是只评价最终回答是否顺眼,忽略越权工具调用、绕路、成本和错误恢复。
- 最小证据包包含eval case、模型版本、完整 messages、tool events、环境快照、grader、分数、延迟与成本。
名词解释
本章出现的专业名词,用大白话再讲一遍。
- trace
一次 Agent 运行的完整事件链。在“评估与可观测性”中必须能按以下证据重新定位:eval case、模型版本、完整 messages、tool events、环境快照、grader、分数、延迟与成本。
- span
trace 中一个模型、工具或业务步骤的时间区间。在“评估与可观测性”中必须能按以下证据重新定位:eval case、模型版本、完整 messages、tool events、环境快照、grader、分数、延迟与成本。
- grader
对结果、轨迹或环境状态进行评分的函数。在“评估与可观测性”中必须能按以下证据重新定位:eval case、模型版本、完整 messages、tool events、环境快照、grader、分数、延迟与成本。
- 回归集
用于比较版本变化的冻结代表任务集合。在“评估与可观测性”中必须能按以下证据重新定位:eval case、模型版本、完整 messages、tool events、环境快照、grader、分数、延迟与成本。
- 在线监控
生产流量中持续观察质量、延迟、成本和风险信号。在“评估与可观测性”中必须能按以下证据重新定位:eval case、模型版本、完整 messages、tool events、环境快照、grader、分数、延迟与成本。