本文总结了Google AI团队在构建Agent Skill
AIAI Summary (BLUF)
本文总结了Google AI团队在构建Agent Skills时,为LLM-as-a-Judge评估编写可靠评分标准的四个关键经验:评分问题要保持原子性、只评估客观事实、只考核提示中明确要求的输出,并通过人类专家进行校准。采用严格的布尔问题能减少模型幻觉和评分噪音,使评估更加可重复、节省Token,并有效衡量AI工具的性能改进。
核心洞察
盯住一个点就够:别让裁判模型在打分时替你做主观判断,只给它事实判断题。文章里第四步校准最容易被人跳过,但这步不补,前面三条写得再细,跑真实数据还是会翻车。
这篇是上一篇《如何设计可信的人工智能评估》的续篇。我们团队在谷歌维护了一批面向谷歌产品和技术的智能体技能,代码发布在 GitHub 上。团队想知道这些技能的实际表现。像“生成的代码能不能编译”这种确定性测试当然好办,但开放式问答、信息检索这些生成式输出很难靠同一种方式规模化验证。
上一篇聊的是测什么,也就是你要让智能体执行哪些评估任务。这次重点看怎么判断它成功了,也就是对智能体的回复做出稳定、准确的评价。
复杂输出想大规模评估,尤其内容涉及面广、细节要求多的时候,我们通常让大模型当裁判。具体做法是给回复套一份结构化评分表,裁判模型照着表打钩。表里的每一道题都要求判真或假,汇总以后就是一个准确度分数。
给大模型一个含糊的提示词,或者让它回答主观问题,结果必然也是含糊的。同一个回复可能这次算合格,下次又不合格。这种噪声会把评估数据搅浑,最后一想,除了多花了钱,什么可靠指标都没拿到。
想让评估结果稳定,得把评分表当成正式规格书来写。裁判只做严格、客观的真假判断,发挥空间就小很多。判断题本身也简单,你甚至可以让更小更快的模型来当裁判。
下面是我们学到的四件事。
核心结论
复杂输出要规模化评估时,应把评分表拆成原子级、互不重叠的真假判断题,每道题只验证一个独立事实,避免让裁判模型在多条件之间猜测,从而降低打分波动。
评分项只能基于可观察的客观事实,不要评“回答够不够全面”“意图是否合理”等需要主观推理的内容;建议用“必须/禁止”式规范表述,并让裁判模型只做严格真假判断。
评分表必须与任务提示词中明确提出的要求严格对齐,不能顺手追加提示词里没要求的扣分点;如果确实要评过程,需要先让智能体输出可检查的执行计划,再针对该计划打分。
裁判模型上线前必须做校准:由领域专家手工给一批金标样本打分,再用裁判模型对同一批样本打分,对比差异并迭代评分表和打分指令,直到机器打分稳定贴合人类专家判断。这一步最容易跳过,但不校准,前面的评分表设计得再细也无法保证真实评估结果可靠。
把题目拆到原子级,题目之间不重叠
一道题里塞进多个条件,比如“回复是否包含元数据属性,并且输出是 JSON 格式”,裁判模型就得猜哪半句更重要。猜就会带来不稳定。
- 复合题拆开写。别搞一个大检查,把需求拆成互相独立的真假题。检查一:有没有元数据属性?检查二:输出是不是 JSON?
- 题目不要重叠。同一个意思别在评分表里重复出现,否则一个错会被扣两次分,准确率也就失真了。
- 压缩裁判的推理量。它不需要在几个条件之间做权衡。每道题只验证一个独立事实,打分就会更一致。
限制裁判:找客观事实,不看主观推理
我们当初用评分表,就是不放心让大模型拿一整段自然语言提示去评价复杂回复。你要是问“这个回答够不够全面”,或者让它解释“智能体为什么要这么做”,它只能自己猜。猜出来的结论带着噪声,很难重复。
- 只看能观察到的事实。意图、质量、推理链条这类需要解读的东西,别写进评分表。
- 用规范文风写评分项。类似 RFC 2119 里那种“必须”“禁止”“要求”的说法,直接检查可观察结果。裁判不应该猜你的意思。
- 也测“不该做什么”。与其问“有没有遵循最佳实践”,不如查“有没有提到某个应当废弃的功能”。
- 答案严格限定真假。把问题锁在客观事实上,模型推理负担变轻,分数波动也会变小。
- 别给智能体留刷分空间。测试条件如果跟任务提示放一起,模型会照着条件生成答案。评分表应该放在独立的系统里,考核点写具体功能结果或主题,而不是宽泛的关键词。
只给提示词里明确要求过的内容打分
写评分表的时候很容易顺手加进一些提示词里根本没提过的要求。提示没让模型列引用,它就没列,我们却因为缺引用扣分,这是误伤。
- 评分表要和提示词对齐。只评明确要求的内容。
- 评结果,不评过程。别写“有没有用某个工具”“有没有按固定顺序执行”这种检查项。预训练模型要是本来就知道答案,完全可能绕过自定义工具直接答。
- 要评过程,就让过程可见。如果确实需要检查分步执行,先让智能体输出执行计划,然后评那份计划。
校准裁判:和人类专家的判断对齐
前面几条都做到了,裁判模型还是可能理解错评分表或打分指令。想让整套流程输出稳定成绩,得证明机器打分和人类专家打分是一致的。这一步叫校准。
- 建人工基线。让领域专家手工给一组金标样本打分。
- 跑自动对比。把金标样本交给裁判模型打分,再将结果和专家分数放一起看。
- 找差距。两边对不上,通常说明评分表或打分指令还有歧义。
- 迭代到对齐。调整问题、修正指令,再跑,直到机器判断稳定贴合专家判断。做到这里,裁判才算准备好。
小结
拿到可靠数据以后,下一步是让它被看见。Google 的同事 Joe Spiro 写过一篇评估可视化文章,讲怎么把原始得分变成给相关方看的热力图。
我们构建这些技能时最大的感受是:评分表含糊,评估系统就是在拿噪声当信号。让裁判模型只判断严格的真假事实,噪声就会消失。测试开始可复现,预算花得值,也能放心地说这个人工智能工具确实在变好。
常见问题(FAQ)
如何为LLM裁判编写可靠的评分标准?
编写评分标准需遵循四点:评分问题保持原子性,只评估客观事实,只考核提示中明确要求的输出,并通过人类专家校准。采用严格布尔问题减少幻觉和噪音,使评估可重复并节省Token。
为什么LLM裁判评分出现噪声或不稳定?
评分模糊或包含主观判断会导致噪声。复合题和重叠题让模型猜测重点;主观问题如“是否全面”引发推理不确定性。应拆成独立真假题,只检查客观事实,确保稳定可重复。
校准LLM裁判与人类判断需要什么步骤?
先由专家手工给金标样本打分,再让裁判模型评分对比。若偏差大则修订评分表和指令,迭代至一致。这一步不可省略,否则规则再细也可能在真实数据上失效。
版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。
文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。
若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。



