评估-优化:什么时候该先出稿,再迭代打磨
评估-优化:什么时候该先出稿,再迭代打磨:在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环,通过架构、轨迹和故障重放完成验收。
学习目标
- 能解释“评估-优化:什么时候该先出稿,再迭代打磨”如何在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环
- 能区分evaluator、optimizer、rubric、改进增量、停止规则,并指出控制权、数据与副作用边界
- 能固定输入与版本,沿以下证据定位首个分叉:rubric 版本、初稿、逐项评分、反馈、修订差异、轮次成本与停止原因
- 能注入“评价器每轮改变标准,优化器只追逐措辞而质量指标没有提升”,完成阻断、恢复、复位和同输入重放
来源、课程编排与适用边界
“评估-优化:什么时候该先出稿,再迭代打磨”以Anthropic 公开全文《Building effective agents》为总纲,并用Anthropic《Building effective agents》核对本单元机制;涉及 MCP 的控制权边界再由MCP 2025-06-18 官方规范交叉检查。
这不是 Anthropic 出版的“19 章教材”。平台把公开文章、官方工具文档与协议规范重组为 19 个应用单元;下列 152 个节点是站内课程地图,不冒充原文目录。正文、代码、图表、实验和练习均为独立教学重写;产品接口、模型行为或协议版本变化时必须重新验证。
本单元的八个课程坐标
- 评估-优化:什么时候该先出稿,再迭代打磨:这是“在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环”的第 1 个课程坐标;必须进入机制解释、实验观察或练习证据,不能只停在目录。
- 先打个比方:这是“在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环”的第 2 个课程坐标;必须进入机制解释、实验观察或练习证据,不能只停在目录。
- 这种模式在做什么:先出一版,再按标准返工:这是“在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环”的第 3 个课程坐标;必须进入机制解释、实验观察或练习证据,不能只停在目录。
- 它仍是工作流,不是自主 agent:这是“在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环”的第 4 个课程坐标;必须进入机制解释、实验观察或练习证据,不能只停在目录。
- 两个适配信号:标准清楚 + 返工真能变好:这是“在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环”的第 5 个课程坐标;必须进入机制解释、实验观察或练习证据,不能只停在目录。
- 信号一:标准清楚,能说出“好稿子长什么样”:这是“在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环”的第 6 个课程坐标;必须进入机制解释、实验观察或练习证据,不能只停在目录。
- 信号二:返工真的能让结果变好,而不是只会重写:这是“在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环”的第 7 个课程坐标;必须进入机制解释、实验观察或练习证据,不能只停在目录。
- 动手看:这个任务该不该上评估-优化?:这是“在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环”的第 8 个课程坐标;必须进入机制解释、实验观察或练习证据,不能只停在目录。
术语与运行合同
↡evaluator:按明确标准审查候选并给出反馈的模型或程序;在“评估-优化:什么时候该先出稿,再迭代打磨”中按以下证据核对:rubric 版本、初稿、逐项评分、反馈、修订差异、轮次成本与停止原因。、↡optimizer:根据反馈定向修订候选的模型调用;在“评估-优化:什么时候该先出稿,再迭代打磨”中按以下证据核对:rubric 版本、初稿、逐项评分、反馈、修订差异、轮次成本与停止原因。、↡rubric:列出评价维度、等级和通过阈值的固定标准;在“评估-优化:什么时候该先出稿,再迭代打磨”中按以下证据核对:rubric 版本、初稿、逐项评分、反馈、修订差异、轮次成本与停止原因。、↡改进增量:相邻两轮在冻结指标上的质量变化;在“评估-优化:什么时候该先出稿,再迭代打磨”中按以下证据核对:rubric 版本、初稿、逐项评分、反馈、修订差异、轮次成本与停止原因。、↡停止规则:达标、无改进、轮次或预算耗尽时退出的条件;在“评估-优化:什么时候该先出稿,再迭代打磨”中按以下证据核对:rubric 版本、初稿、逐项评分、反馈、修订差异、轮次成本与停止原因。。
本页不变量是:评价器必须依据冻结 rubric 给出可执行反馈,并由预算和达标条件终止循环。任何“成功”结论都要保存以下证据:rubric 版本、初稿、逐项评分、反馈、修订差异、轮次成本与停止原因,模型生成的计划或自信不能替代环境事实。
关键机制与可推翻实验
适配信号有两个
人能清楚给反馈,且候选根据反馈确实可改进,二者缺一都不适合循环。
动手验证:先用少量样本验证人工反馈能否带来稳定增益。
评价标准必须冻结
每轮改 rubric 会让分数不可比较,也可能让系统无限追逐新要求。
动手验证:保存 rubric 哈希并拒绝循环内静默变更。
反馈要可执行
“不够好”无法指导修订;应定位维度、证据和期望变化。
动手验证:比较泛化反馈与逐项反馈的下一轮增量。
无改进就停止
重复改写不是优化;连续低增益时应保留最佳版本并退出。
动手验证:注入两轮同分结果,确认系统触发 plateau。
先预测,再操作三类证据
1. 架构与复杂度边界
在“评估-优化:什么时候该先出稿,再迭代打磨”中切换简单基线、受控工作流与自主循环,先预测“在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环”在哪个阶段需要增加控制权,再比较延迟、成本、可观测性和自主性。
Architecture decision laboratory
评估-优化:什么时候该先出稿,再迭代打磨
在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环
不变量:评价器必须依据冻结 rubric 给出可执行反馈,并由预算和达标条件终止循环
最小可运行实现
let best = await generate(task);
for (let round = 0; round < 3; round += 1) {
const review = await evaluate(best, frozenRubric);
if (review.score >= 0.9) return { best, reason: "threshold" };
const next = await revise(best, review.actionableFeedback);
if ((await score(next)) <= (await score(best))) break;
best = next;
}
return { best, reason: "plateau_or_budget" };这段切片只暴露“在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环”的最小运行合同。交付版本还要补齐超时、密钥隔离、结构化日志、幂等和批量评测;缺少rubric 版本、初稿、逐项评分、反馈、修订差异、轮次成本与停止原因时,代码能运行也不代表本章结论成立。
练习与答案
练习
问题 1:最小证明。 怎样用最少样本证明“评价器必须依据冻结 rubric 给出可执行反馈,并由预算和达标条件终止循环”?
问题 2:课程覆盖。 评估-优化:什么时候该先出稿,再迭代打磨、先打个比方、这种模式在做什么:先出一版,再按标准返工、它仍是工作流,不是自主 agent、两个适配信号:标准清楚 + 返工真能变好、信号一:标准清楚,能说出“好稿子长什么样”、信号二:返工真的能让结果变好,而不是只会重写、动手看:这个任务该不该上评估-优化?如何进入可操作验证?
问题 3:恢复闭环。 怎样证明“评价器每轮改变标准,优化器只追逐措辞而质量指标没有提升”已经修复?
本章回顾
- “评估-优化:什么时候该先出稿,再迭代打磨”的主问题是在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环。
- 核心不变量是评价器必须依据冻结 rubric 给出可执行反馈,并由预算和达标条件终止循环。
- 首要反例是评价器每轮改变标准,优化器只追逐措辞而质量指标没有提升。
- 最小证据包包含rubric 版本、初稿、逐项评分、反馈、修订差异、轮次成本与停止原因。
名词解释
本章出现的专业名词,用大白话再讲一遍。
- evaluator
按明确标准审查候选并给出反馈的模型或程序。在“评估-优化:什么时候该先出稿,再迭代打磨”中必须能按以下证据重新定位:rubric 版本、初稿、逐项评分、反馈、修订差异、轮次成本与停止原因。
- optimizer
根据反馈定向修订候选的模型调用。在“评估-优化:什么时候该先出稿,再迭代打磨”中必须能按以下证据重新定位:rubric 版本、初稿、逐项评分、反馈、修订差异、轮次成本与停止原因。
- rubric
列出评价维度、等级和通过阈值的固定标准。在“评估-优化:什么时候该先出稿,再迭代打磨”中必须能按以下证据重新定位:rubric 版本、初稿、逐项评分、反馈、修订差异、轮次成本与停止原因。
- 改进增量
相邻两轮在冻结指标上的质量变化。在“评估-优化:什么时候该先出稿,再迭代打磨”中必须能按以下证据重新定位:rubric 版本、初稿、逐项评分、反馈、修订差异、轮次成本与停止原因。
- 停止规则
达标、无改进、轮次或预算耗尽时退出的条件。在“评估-优化:什么时候该先出稿,再迭代打磨”中必须能按以下证据重新定位:rubric 版本、初稿、逐项评分、反馈、修订差异、轮次成本与停止原因。