评估-优化:什么时候该先出稿,再迭代打磨

评估-优化:什么时候该先出稿,再迭代打磨:在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环,通过架构、轨迹和故障重放完成验收。

学习目标

  • 能解释“评估-优化:什么时候该先出稿,再迭代打磨”如何在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环
  • 能区分evaluator、optimizer、rubric、改进增量、停止规则,并指出控制权、数据与副作用边界
  • 能固定输入与版本,沿以下证据定位首个分叉:rubric 版本、初稿、逐项评分、反馈、修订差异、轮次成本与停止原因
  • 能注入“评价器每轮改变标准,优化器只追逐措辞而质量指标没有提升”,完成阻断、恢复、复位和同输入重放

来源、课程编排与适用边界

“评估-优化:什么时候该先出稿,再迭代打磨”以Anthropic 公开全文《Building effective agents》为总纲,并用Anthropic《Building effective agents》核对本单元机制;涉及 MCP 的控制权边界再由MCP 2025-06-18 官方规范交叉检查。

这不是 Anthropic 出版的“19 章教材”。平台把公开文章、官方工具文档与协议规范重组为 19 个应用单元;下列 152 个节点是站内课程地图,不冒充原文目录。正文、代码、图表、实验和练习均为独立教学重写;产品接口、模型行为或协议版本变化时必须重新验证。

本单元的八个课程坐标

  • 评估-优化:什么时候该先出稿,再迭代打磨:这是“在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环”的第 1 个课程坐标;必须进入机制解释、实验观察或练习证据,不能只停在目录。
  • 先打个比方:这是“在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环”的第 2 个课程坐标;必须进入机制解释、实验观察或练习证据,不能只停在目录。
  • 这种模式在做什么:先出一版,再按标准返工:这是“在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环”的第 3 个课程坐标;必须进入机制解释、实验观察或练习证据,不能只停在目录。
  • 它仍是工作流,不是自主 agent:这是“在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环”的第 4 个课程坐标;必须进入机制解释、实验观察或练习证据,不能只停在目录。
  • 两个适配信号:标准清楚 + 返工真能变好:这是“在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环”的第 5 个课程坐标;必须进入机制解释、实验观察或练习证据,不能只停在目录。
  • 信号一:标准清楚,能说出“好稿子长什么样”:这是“在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环”的第 6 个课程坐标;必须进入机制解释、实验观察或练习证据,不能只停在目录。
  • 信号二:返工真的能让结果变好,而不是只会重写:这是“在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环”的第 7 个课程坐标;必须进入机制解释、实验观察或练习证据,不能只停在目录。
  • 动手看:这个任务该不该上评估-优化?:这是“在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环”的第 8 个课程坐标;必须进入机制解释、实验观察或练习证据,不能只停在目录。

术语与运行合同

本页不变量是:评价器必须依据冻结 rubric 给出可执行反馈,并由预算和达标条件终止循环。任何“成功”结论都要保存以下证据:rubric 版本、初稿、逐项评分、反馈、修订差异、轮次成本与停止原因,模型生成的计划或自信不能替代环境事实。

关键机制与可推翻实验

适配信号有两个

人能清楚给反馈,且候选根据反馈确实可改进,二者缺一都不适合循环。

动手验证:先用少量样本验证人工反馈能否带来稳定增益。

评价标准必须冻结

每轮改 rubric 会让分数不可比较,也可能让系统无限追逐新要求。

动手验证:保存 rubric 哈希并拒绝循环内静默变更。

反馈要可执行

“不够好”无法指导修订;应定位维度、证据和期望变化。

动手验证:比较泛化反馈与逐项反馈的下一轮增量。

无改进就停止

重复改写不是优化;连续低增益时应保留最佳版本并退出。

动手验证:注入两轮同分结果,确认系统触发 plateau。

先预测,再操作三类证据

分步1 / 3

1. 架构与复杂度边界

在“评估-优化:什么时候该先出稿,再迭代打磨”中切换简单基线、受控工作流与自主循环,先预测“在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环”在哪个阶段需要增加控制权,再比较延迟、成本、可观测性和自主性。

Architecture decision laboratory

评估-优化:什么时候该先出稿,再迭代打磨

在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环

复杂度档位

不变量:评价器必须依据冻结 rubric 给出可执行反馈,并由预算和达标条件终止循环

受控工作流:只激活能够由收益证明的阶段1生成初稿2按 rubric …3定位差距4定向修订5达标或停止蓝色表示当前方案承担的责任;虚线阶段仍留在系统边界外。关键证据:rubric 版本…
自主性46
延迟52
成本48
可观测78

最小可运行实现

let best = await generate(task);
for (let round = 0; round < 3; round += 1) {
  const review = await evaluate(best, frozenRubric);
  if (review.score >= 0.9) return { best, reason: "threshold" };
  const next = await revise(best, review.actionableFeedback);
  if ((await score(next)) <= (await score(best))) break;
  best = next;
}
return { best, reason: "plateau_or_budget" };

这段切片只暴露“在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环”的最小运行合同。交付版本还要补齐超时、密钥隔离、结构化日志、幂等和批量评测;缺少rubric 版本、初稿、逐项评分、反馈、修订差异、轮次成本与停止原因时,代码能运行也不代表本章结论成立。

练习与答案

练习

问题 1:最小证明。 怎样用最少样本证明“评价器必须依据冻结 rubric 给出可执行反馈,并由预算和达标条件终止循环”?

问题 2:课程覆盖。 评估-优化:什么时候该先出稿,再迭代打磨、先打个比方、这种模式在做什么:先出一版,再按标准返工、它仍是工作流,不是自主 agent、两个适配信号:标准清楚 + 返工真能变好、信号一:标准清楚,能说出“好稿子长什么样”、信号二:返工真的能让结果变好,而不是只会重写、动手看:这个任务该不该上评估-优化?如何进入可操作验证?

问题 3:恢复闭环。 怎样证明“评价器每轮改变标准,优化器只追逐措辞而质量指标没有提升”已经修复?

本章回顾

  • “评估-优化:什么时候该先出稿,再迭代打磨”的主问题是在评价标准清晰且反馈能带来可测改进时运行生成—评价—修订循环。
  • 核心不变量是评价器必须依据冻结 rubric 给出可执行反馈,并由预算和达标条件终止循环。
  • 首要反例是评价器每轮改变标准,优化器只追逐措辞而质量指标没有提升。
  • 最小证据包包含rubric 版本、初稿、逐项评分、反馈、修订差异、轮次成本与停止原因。

名词解释

本章出现的专业名词,用大白话再讲一遍。

evaluator

按明确标准审查候选并给出反馈的模型或程序。在“评估-优化:什么时候该先出稿,再迭代打磨”中必须能按以下证据重新定位:rubric 版本、初稿、逐项评分、反馈、修订差异、轮次成本与停止原因。

optimizer

根据反馈定向修订候选的模型调用。在“评估-优化:什么时候该先出稿,再迭代打磨”中必须能按以下证据重新定位:rubric 版本、初稿、逐项评分、反馈、修订差异、轮次成本与停止原因。

rubric

列出评价维度、等级和通过阈值的固定标准。在“评估-优化:什么时候该先出稿,再迭代打磨”中必须能按以下证据重新定位:rubric 版本、初稿、逐项评分、反馈、修订差异、轮次成本与停止原因。

改进增量

相邻两轮在冻结指标上的质量变化。在“评估-优化:什么时候该先出稿,再迭代打磨”中必须能按以下证据重新定位:rubric 版本、初稿、逐项评分、反馈、修订差异、轮次成本与停止原因。

停止规则

达标、无改进、轮次或预算耗尽时退出的条件。在“评估-优化:什么时候该先出稿,再迭代打磨”中必须能按以下证据重新定位:rubric 版本、初稿、逐项评分、反馈、修订差异、轮次成本与停止原因。

阅读导航

← 并行与编排-工作者:什么时候同时做,什么时候先拆再派 · 自主智能体:让模型在环境反馈里自己推进任务 →

讨论

评论区加载中…