第 3 课:检查结果
本课目标:
- 根据你之前写好的验收标准验证 agent 的交付物。
- 区分“看起来不错”和“通过检查清单”。
- 为一个新任务写三行验收检查清单。
先修条件:第 2 课 | 上一篇 << 02 把需求写清楚 | 下一篇 04 找出错误 >>
agent 说做完了,不等于真的做完了
agent 很自信。即使报告缺了一列、日期错了,或者悄悄忽略了你一半指令,它也会说“这是已完成的报告”。最常见的错误不是 agent 的错,而是你自己忘了检查12。
验证和阅读输出不一样。阅读是被动的,验证是按验收标准逐项检查证据。
讲解
验证时,你把结果和 agent 开始工作前你写的验收标准对比。这能保护你避开两个陷阱:被自信语气骗过的陷阱,以及觉得输出“差不多对”就继续的陷阱。Anthropic 关于构建 agent 的指南建议设计清晰的评估标准,并在检查点引入人工反馈;你作为这个人的时候,原则也一样2。
一个简单的验证表格有三列:标准、证据、通过或不通过。
你不需要复杂工具。一张便签、一个电子表格或一张纸就够了。关键是你在用自己的标准检查 agent 的输出,而不是用它自己的说法。
这张图展示了循环:结果先交给标准,而不是直接使用。如果不通过,就发回要求具体修改。
完整示例(跟着做)
Priya 让 agent 把会议记录转成一份带负责人和截止日期的行动项列表。agent 返回:
Priya 的验收标准是:每个行动项都有具体负责人(不能是团队)、每个截止日期都是日历日期、每个项都只有一行。
她逐行检查:
- “重新设计注册页”的负责人是“设计团队”,不是具体的人。不通过。
- “跟进供应商”的截止日期是“尽快”,不是日期。不通过。
- “审阅预算”没有年份。不通过。
因为她先写了标准,所以可以发回精确修改:“把团队负责人换成个人,把‘尽快’和‘下个阶段’换成日历日期,给每个日期加上年份。”
你来试试(填空示例)
你让 agent 用三句话总结一份合同。你的验收标准是:恰好三句话、提到价格、提到期限、提到取消条款。agent 返回:
“这是一份软件服务合同。期限为一年,可以取消。价格很有竞争力,详见附件文件。”
填写验证表格。
答案:
- 三句话:通过。
- 价格:不通过(“价格很有竞争力”没有说明价格)。
- 期限:通过。
- 取消条款:不通过(“可以取消”含糊,条款本身没有提到)。
小结 + 下节课预告
验证是清单,不是感觉。你之前写的验收标准变成了测试。如果不通过,就发回具体修改。下节课,你将学习 agent 最可能出错的四种方式,这样在验证前就知道该找什么。
Footnotes
-
OpenAI Academy: Agents and Workflows — https://academy.openai.com/public/courses/agents-and-workflows-bieml ↩
-
Anthropic: Building Effective AI Agents — https://www.anthropic.com/engineering/building-effective-agents ↩ ↩2