本文提出了设计AI评估的五个关键规则,帮助开发者避免虚假信号
AIAI Summary (BLUF)
本文提出了设计AI评估的五个关键规则,帮助开发者避免虚假信号、节省token预算,并获得可操作的反馈。作者结合Google Agent Skills的实际经验,强调评估环境、难度设计、提示词与评分器匹配、结果导向和数据集策划的重要性。
核心洞察
先说结论:这五条规则没一条是花哨的,全是作者在 Google 做 Agent Skills在AI Agent环境中可调用的技能模块,能够增强大模型的写作能力(如arxiv翻译技能)。 时踩坑踩出来的。最戳我的是"提示词和评分器不匹配"那条,写评测的时候太容易犯这个错了。AI 评测烧钱,烧完还得不到有效信号,那才是真的亏。
我在 Google 参与了一项工作:在 GitHub 上发布一套 Agent Skills,帮助 AI 智能体跟 Google 的技术和产品交互。但怎么测试这些技能真的有用?我所在的开发者关系团队一直在琢磨这件事。性能信号不可靠,后续改进就无从谈起。
你不可能不给生产环境的 API 写单元测试就让它上线。AI 智能体也应该用同样的标准来要求。Joe Spiro 在《Designing AI Evals评估,用于测试和验证AI模型输出的正确性和性能。》系列里说过,AI 工具要规模化,就不能再靠终端里的"玄学测试"。你得搭一套结构化、自动化的评估流水线,给集成做基准测试。评测就是你交给智能体的任务,做完后用评分器按评分细则判断成功与否。这篇先讲评测怎么写,评分细则放下一篇。
AI 评测烧的是真金白银。每笔开销都得花得值,评测结果要能真正帮你把工具做好。评测写不好,信号是假的,钱白花,指标里全是噪音。
下面五条规则,是我们从实战里总结出来的。照着做,你花的每一分钱都能变成有用的指标。
核心结论
- 评测设计必须与执行环境匹配:要明确沙箱、工具、输出捕获方式,真实资源需通过临时凭据或 mock 隔离,单轮提示比多轮会话更容易评估。
- 基线准确率过高说明评测提示词太简单或工具缺乏价值,必须用更难、需多步推理的真实用例来测试,否则无法衡量工具的实际贡献。
- 提示词和评分器必须严格对应:评分器只能依据提示词中明确要求的内容打分,不能因提示词未提及的细节(如具体 IAM 角色)扣分。
- 评分应针对最终客观输出,而不是智能体是否使用了特定命令或按固定步骤执行;若需评估规划,则要求智能体先输出详细计划再对该计划打分。
- 评测数据集应精选真实、多样、互不重叠的用例,每条提示词独立测试一种能力,合并冗余项,既能防止过拟合、减少噪音,也能节省 token 成本。
了解你的评测环境
动笔之前,先摸清评测框架的环境和限制。比如 Harbor、Inspect AI,还有开发工具里集成的 Agent Development Kit代理开发工具包,Google提供的用于构建、测试和评估AI代理的框架。。用的是临时沙箱吗?提供了哪些工具?输出怎么捕获?
- **让评分器适配环境:**你能确定性地访问沙箱去执行代码,那就直接评代码。或者让智能体把结果打印到控制台,框架捕获输出直接传给评分器。评分器要能应对这些不同环境。
- **留意依赖限制和"真实"资源的访问:**评测任务需要访问真实资源的话,比如一个已认证的 gcloud 会话、有权限访问某个 Google Cloud 项目,就创建临时资源或临时凭据,把访问隔离起来,别影响其他评测。或者用 mock 工具替代真实的测试凭据。
- **遇到难以隔离的任务,改成评估计划:**让智能体先输出一份执行计划,你评计划本身,不评实际执行。
- **避开交互式提示:**多轮智能体会话很难评估,刚开始设计评测就用单轮提示。
避免天花板效应
基线准确率很高的话,说明不用你的工具也能答对。这时候要么是工具没体现出价值,要么是评测提示词设置得太简单。
- **写更难的提示词:**基线模型本来就知道答案,你怎么衡量新工具带来的影响?
- **要求多步推理:**提示词要设计成复杂的真实用例,让工具真正有用武之地。
- **重新审视工具的范围:**不用你的工具测试也一直高分,那就该想想这个工具还有没有存在意义。底层模型和智能体可能已经变强到不需要额外帮助了。该调整定位就调整,该下线就下线。
提示词和评分器不匹配
你不能拿没有明确要求过的事来给智能体打分。评测提示词和评分器应该是互补的,只测提示词里写到的内容。
- **避免范围蔓延:**你问得宽,就得接受宽泛的回答。比如提示词是"怎么保护 Google Cloud Run?",评分器就不能因为智能体漏掉了某个具体 IAM 角色而扣分,这个角色在提示词里根本没出现。
- **把要求写清楚:**想考察特定知识或具体实现细节,就在提示词里明确说出来。
给最终结果打分,别给过程打分
智能体本身有模型知识,它可能完全绕过你的自定义工具直接给出正确答案。这本身就是一个有用的反馈。
- **别评估轨迹:**别写那种检查智能体有没有用过某个 help 命令、有没有按固定步骤走的评分器。
- **评估最终答案:**对最终的客观输出打分。如果非要评估规划阶段,就明确让智能体输出详细执行计划,改为评估这份计划。
精选你的评测数据集
好的评测套件应该覆盖真实、多样的用例。但反复测同一个能力,容易过拟合,指标也全是噪音。
- **用真实场景:**评测要包含真实的用户旅程,聚焦用户想达成的目标。可以加上一些上下文,比如脱敏的示例数据,让评测有实感。
- **最大化信号:**评测套件里的每条提示词都要测一个独立的概念或独特能力。可以类比传统测试里的代码覆盖率。
- **去掉重叠:**合并冗余的提示词。数据集更小更精,指标更清晰,防过拟合,还省 token。
总结
AI 工具测不准,就没法改进。把 AI 评测当成单元测试来认真对待,指标质量会提升,信号也会更可靠。
五条规则用起来,假信号就清掉了。评测套件不再制造噪音,给出的都是能直接指导工程决策的反馈。
想清楚测什么只是第一步。评测设计得再好,评分器不可靠,给不出有意义的分数,那也白搭。下一篇我们聊怎么测,怎么写精简、原子化的评分细则,让 LLM 评分器少一点歧义,让每一分钱都花在刀刃上。
题图来自 Unsplash,摄影:William Warby。
常见问题(FAQ)
如何避免AI评测中的天花板效应?
天花板效应指基线模型已能答对,工具价值无法体现。应写更难的提示词、要求多步推理,并重新审视工具范围,必要时调整或下线。
为什么AI评测提示词和评分器不匹配会导致问题?
若评分器考察提示词未提及的内容,会因范围蔓延产生假信号。提示词和评分器应互补,只测明确要求,避免对未说明的细节扣分。
设计AI评测时如何精选评测数据集?
精选评测数据集需用真实场景,覆盖独立概念,合并冗余提示词。小而精的数据集能提高信号质量、防止过拟合,并节省token。
版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。
文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。
若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。



