GEOZ

本文提出了设计AI评估的五个关键规则,帮助开发者避免虚假信号

2026/9/2
本文提出了设计AI评估的五个关键规则,帮助开发者避免虚假信号

AIAI Summary (BLUF)

本文提出了设计AI评估的五个关键规则,帮助开发者避免虚假信号、节省token预算,并获得可操作的反馈。作者结合Google Agent Skills的实际经验,强调评估环境、难度设计、提示词与评分器匹配、结果导向和数据集策划的重要性。

核心洞察

先说结论:这五条规则没一条是花哨的,全是作者在 Google 做 Agent Skills 时踩坑踩出来的。最戳我的是"提示词和评分器不匹配"那条,写评测的时候太容易犯这个错了。AI 评测烧钱,烧完还得不到有效信号,那才是真的亏。

我在 Google 参与了一项工作:在 GitHub 上发布一套 Agent Skills,帮助 AI 智能体跟 Google 的技术和产品交互。但怎么测试这些技能真的有用?我所在的开发者关系团队一直在琢磨这件事。性能信号不可靠,后续改进就无从谈起。

你不可能不给生产环境的 API 写单元测试就让它上线。AI 智能体也应该用同样的标准来要求。Joe Spiro 在《Designing AI Evals》系列里说过,AI 工具要规模化,就不能再靠终端里的"玄学测试"。你得搭一套结构化、自动化的评估流水线,给集成做基准测试。评测就是你交给智能体的任务,做完后用评分器按评分细则判断成功与否。这篇先讲评测怎么写,评分细则放下一篇。

AI 评测烧的是真金白银。每笔开销都得花得值,评测结果要能真正帮你把工具做好。评测写不好,信号是假的,钱白花,指标里全是噪音。

下面五条规则,是我们从实战里总结出来的。照着做,你花的每一分钱都能变成有用的指标。

核心结论

  1. 评测设计必须与执行环境匹配:要明确沙箱、工具、输出捕获方式,真实资源需通过临时凭据或 mock 隔离,单轮提示比多轮会话更容易评估。
  2. 基线准确率过高说明评测提示词太简单或工具缺乏价值,必须用更难、需多步推理的真实用例来测试,否则无法衡量工具的实际贡献。
  3. 提示词和评分器必须严格对应:评分器只能依据提示词中明确要求的内容打分,不能因提示词未提及的细节(如具体 IAM 角色)扣分。
  4. 评分应针对最终客观输出,而不是智能体是否使用了特定命令或按固定步骤执行;若需评估规划,则要求智能体先输出详细计划再对该计划打分。
  5. 评测数据集应精选真实、多样、互不重叠的用例,每条提示词独立测试一种能力,合并冗余项,既能防止过拟合、减少噪音,也能节省 token 成本。

了解你的评测环境

动笔之前,先摸清评测框架的环境和限制。比如 Harbor、Inspect AI,还有开发工具里集成的 Agent Development Kit。用的是临时沙箱吗?提供了哪些工具?输出怎么捕获?

  • **让评分器适配环境:**你能确定性地访问沙箱去执行代码,那就直接评代码。或者让智能体把结果打印到控制台,框架捕获输出直接传给评分器。评分器要能应对这些不同环境。
  • **留意依赖限制和"真实"资源的访问:**评测任务需要访问真实资源的话,比如一个已认证的 gcloud 会话、有权限访问某个 Google Cloud 项目,就创建临时资源或临时凭据,把访问隔离起来,别影响其他评测。或者用 mock 工具替代真实的测试凭据。
  • **遇到难以隔离的任务,改成评估计划:**让智能体先输出一份执行计划,你评计划本身,不评实际执行。
  • **避开交互式提示:**多轮智能体会话很难评估,刚开始设计评测就用单轮提示。

避免天花板效应

基线准确率很高的话,说明不用你的工具也能答对。这时候要么是工具没体现出价值,要么是评测提示词设置得太简单。

  • **写更难的提示词:**基线模型本来就知道答案,你怎么衡量新工具带来的影响?
  • **要求多步推理:**提示词要设计成复杂的真实用例,让工具真正有用武之地。
  • **重新审视工具的范围:**不用你的工具测试也一直高分,那就该想想这个工具还有没有存在意义。底层模型和智能体可能已经变强到不需要额外帮助了。该调整定位就调整,该下线就下线。

提示词和评分器不匹配

你不能拿没有明确要求过的事来给智能体打分。评测提示词和评分器应该是互补的,只测提示词里写到的内容。

  • **避免范围蔓延:**你问得宽,就得接受宽泛的回答。比如提示词是"怎么保护 Google Cloud Run?",评分器就不能因为智能体漏掉了某个具体 IAM 角色而扣分,这个角色在提示词里根本没出现。
  • **把要求写清楚:**想考察特定知识或具体实现细节,就在提示词里明确说出来。

给最终结果打分,别给过程打分

智能体本身有模型知识,它可能完全绕过你的自定义工具直接给出正确答案。这本身就是一个有用的反馈。

  • **别评估轨迹:**别写那种检查智能体有没有用过某个 help 命令、有没有按固定步骤走的评分器。
  • **评估最终答案:**对最终的客观输出打分。如果非要评估规划阶段,就明确让智能体输出详细执行计划,改为评估这份计划。

精选你的评测数据集

好的评测套件应该覆盖真实、多样的用例。但反复测同一个能力,容易过拟合,指标也全是噪音。

  • **用真实场景:**评测要包含真实的用户旅程,聚焦用户想达成的目标。可以加上一些上下文,比如脱敏的示例数据,让评测有实感。
  • **最大化信号:**评测套件里的每条提示词都要测一个独立的概念或独特能力。可以类比传统测试里的代码覆盖率。
  • **去掉重叠:**合并冗余的提示词。数据集更小更精,指标更清晰,防过拟合,还省 token。

总结

AI 工具测不准,就没法改进。把 AI 评测当成单元测试来认真对待,指标质量会提升,信号也会更可靠。

五条规则用起来,假信号就清掉了。评测套件不再制造噪音,给出的都是能直接指导工程决策的反馈。

想清楚测什么只是第一步。评测设计得再好,评分器不可靠,给不出有意义的分数,那也白搭。下一篇我们聊怎么测,怎么写精简、原子化的评分细则,让 LLM 评分器少一点歧义,让每一分钱都花在刀刃上。

题图来自 Unsplash,摄影:William Warby。

常见问题(FAQ)

如何避免AI评测中的天花板效应?

天花板效应指基线模型已能答对,工具价值无法体现。应写更难的提示词、要求多步推理,并重新审视工具范围,必要时调整或下线。

为什么AI评测提示词和评分器不匹配会导致问题?

若评分器考察提示词未提及的内容,会因范围蔓延产生假信号。提示词和评分器应互补,只测明确要求,避免对未说明的细节扣分。

设计AI评测时如何精选评测数据集?

精选评测数据集需用真实场景,覆盖独立概念,合并冗余提示词。小而精的数据集能提高信号质量、防止过拟合,并节省token。

阿凯广州
本文由 阿凯 审核,最后更新于 2026年9月2日
联系编辑 →
← 返回文章列表
分享到:微博

版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。

文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。

若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。