Agent 评测的数据飞轮:如何把 Good Case 和 Bad Case 变成回归资产

发布时间:2026/8/14 16:22:45

Agent 评测的数据飞轮:如何把 Good Case 和 Bad Case 变成回归资产
个人主页zzz_2368 系列主题Agent 评测从结果、轨迹到持续迭代 热门专栏Agent | 小z的碎碎念 | Java后端 本系列内容评测体系、Rubric、Good Case、Bad Case、Trace 与长程 Agent系列第 3 篇上一篇如何从 0 搭建 Agent 评测体系本文参考《Agent 评测漫谈》、OpenAI Evals 和 Anthropic 的 Agent 评测文章。本文不声称拥有真实生产数据示例中的任务和字段是用于说明流程的抽象示例。一、为什么平均分不够用一个 Agent 的总体通过率是 90%听起来不错但这个数字可能掩盖了三种完全不同的情况低风险任务稳定通过高风险任务偶尔越权所有任务都小幅波动没有明显短板常见任务表现很好但少数关键客户任务全部失败。因此评测结果不能只保存一个总分。至少还要保留任务类型、失败原因、风险等级、执行版本和相关 Trace才能回答“哪里变差了”。二、从线上问题到评测样本一个 Bad Case 不应只是截图或一句“效果不好”。建议整理成结构化记录case_id:support-2026-001source:production-feedbacktask:用户要求取消订单并查询退款进度input_context:已登录订单状态为配送中observed_result:Agent 只解释了退款规则没有执行查询expected_behavior:-识别查询与取消两个子任务-先确认取消操作的风险-返回真实订单状态failure_category:planningseverity:mediumregression:true这里要区分三个概念现象用户看到了什么根因假设可能是规划、工具、权限、上下文还是评测规则问题回归标准下一次怎样证明问题已经修复。如果只有现象没有成功标准样本就很难进入自动回归。三、Good Case 和 Bad Case 各自解决什么问题Bad Case 用来暴露能力边界和系统短板例如工具参数错误、循环调用、权限越界和最终状态不一致。Good Case 则用来定义“什么叫高质量完成”。它不只是用来展示 Demo也可以帮助团队明确哪些步骤是必要的哪些额外解释是有价值的哪些简化路径可以接受哪些结果虽然正确但成本过高。需要注意Good Case 不等于唯一标准答案。对于复杂任务可能存在多条满足约束的成功路径。评测更适合检查必要条件、禁止条件和最终状态而不是强制 Agent 复刻某一条轨迹。四、一个可执行的数据飞轮可以把闭环分为六个阶段采集 - 清洗与脱敏 - 标注成功标准 - 执行与评分 - 失败归因 - 回归与发布门禁 ↑ ↓ └── 新的线上 Case ──┘1. 采集来源可以包括线上 Trace、用户反馈、人工抽检、客服升级和开发测试。采集时应保留必要上下文但不能为了方便把密钥、个人信息或完整业务数据直接复制进公共评测集。2. 清洗与脱敏处理重复样本、无效输入、缺失上下文和敏感字段。脱敏不能破坏任务语义。例如订单号可以替换成稳定的占位符但订单状态关系仍要保留。3. 标注成功标准把用户的自然语言诉求转成可检查的expected_behavior、outcome和约束条件。Anthropic 的 Agent 评测说明将任务、试验、评分器、记录和结果分开描述这种拆分很适合用来设计样本字段。参考原文。4. 执行与评分确定性规则优先例如最终状态、Schema、权限和文件存在性语义质量再使用人工或 LLM Judge。不要让一个模糊的总分遮住确定性失败。5. 失败归因建议至少设置以下分类分类例子规划没有拆分依赖任务工具参数错误、没有处理错误返回上下文读取了错误或过期信息环境沙箱、网络或外部系统不可用Skill/Prompt规则缺失或表达冲突评测成功标准本身不清楚最后一类很重要。若大量评测员无法判断问题可能不在 Agent而在评测集设计。6. 回归与发布门禁模型、Prompt、Tool、Skill 或编排逻辑变更后重新执行历史样本。对高风险任务可以把“任何越权失败”设为阻断条件对低风险语言风格可以设置观察阈值。门禁应该和风险等级绑定而不是所有指标都采用同一阈值。五、评测集也会老化评测集不是永久真理至少有四类老化风险样本被反复优化Agent 只学会了固定套路用户分布变化旧样本不再代表真实流量工具和业务规则变化旧成功标准失效评测样本过于简单无法发现长尾失败。所以应保留训练集、回归集和探索集的边界定期检查样本覆盖面。对于尚未稳定的业务不要只追求历史回归分数上涨还要保留一部分新任务用于发现未知问题。六、结论数据飞轮的核心不是“收集更多案例”而是把案例转成可执行、可复现、可归因的评测资产线上现象 → 结构化 Case → 成功标准 → 评分 → 根因 → 修复 → 回归。OpenAI Evals 提供了面向 LLM 和 LLM 系统的评测框架思路但具体数据字段和门禁标准仍要由业务场景决定。真正成熟的体系应该能让一次线上失败减少下一次同类失败的概率。下一篇将进一步讨论如果没有完整 Trace为什么很多归因只能停留在猜测。一个 Bad Case 如何进入回归本地 Demo 使用 order-query-empty-result 作为模拟 Bad Case版本结果失败归因v1失败tool-error-handlingv2通过已增加工具空结果的失败分支运行本地 Demo可以得到这组结果。重点不是版本号或成功率而是把“工具返回空结果后 Agent 没有处理”从一次现象变成可重复的回归样本。七、回归资产的发布门禁一个新 Case 是否进入正式回归集可以用以下门禁判断输入上下文已经脱敏且可重放预期行为和最终状态已经定义至少有一个确定性 Grader失败归因不是空值该 Case 能说明一个真实风险或能力边界。修复后的版本不能只在新增 Case 上通过还应重新运行历史回归集并检查是否引入新的工具调用、成本或安全问题。若业务规则发生变化应给样本标记版本不要静默修改旧标准。数据飞轮的成功标准不是“Case 数量越来越多”而是失败能够被复现、修复能够被验证、历史问题能够被持续拦截。参考资料《Agent 评测漫谈》AnthropicDemystifying evals for AI agentsOpenAI Evals GitHub 仓库感谢阅读记得点赞、关注、收藏欢迎各位评论区交流

相关新闻

同城中台系统核心表设计与模块启用状态机(代码深讲)

同城中台系统核心表设计与模块启用状态机(代码深讲)

2026/8/14 16:22:45

县城创业者评估「同城中台系统」时,技术侧常纠结功能捆绑:是否必须一次启用全部业务域?下文用模块注册表、启用状态机与 Service 伪代码说明「统一中台 按需启用模块」如何落地,并给出低成本试水期的联调验收点。示例为教学示意。…

Kimi    LeetCode 3906. 统计网格路径中好整数的数目 Python3实现

Kimi LeetCode 3906. 统计网格路径中好整数的数目 Python3实现

2026/8/14 16:12:45

根据搜索结果,LeetCode 3906「统计网格路径中好整数的数目」的 Python3 实现如下:---思路1. 预处理关键位置:directions 包含 3 个 D 和 3 个 R,从 (0,0) 出发,共经过 7 个格子(含起点)。将这些…

Windows系统文件spwizimg.dll丢失找不到问题解决

Windows系统文件spwizimg.dll丢失找不到问题解决

2026/8/14 16:12:45

在使用电脑系统时经常会出现丢失找不到某些文件的情况,由于很多常用软件都是采用 Microsoft Visual Studio 编写的,所以这类软件的运行需要依赖微软Visual C运行库,比如像 QQ、迅雷、Adobe 软件等等,如果没有安装VC运行库或者安装…

5步搞定BetterNCM安装难题:从环境自检到插件生效的完整实战指南

5步搞定BetterNCM安装难题:从环境自检到插件生效的完整实战指南

2026/8/14 17:32:48

5步搞定BetterNCM安装难题:从环境自检到插件生效的完整实战指南 【免费下载链接】BetterNCM-Installer 一键安装 Better 系软件 项目地址: https://gitcode.com/gh_mirrors/be/BetterNCM-Installer BetterNCM-Installer 是一款专为 PC 版网易云音乐打造的插件…

Blender骨骼动画复制插件 BoneAnimCopy:把一套动作“穿“到任何角色身上

Blender骨骼动画复制插件 BoneAnimCopy:把一套动作“穿“到任何角色身上

2026/8/14 17:32:48

Blender骨骼动画复制插件 BoneAnimCopy:把一套动作"穿"到任何角色身上 【免费下载链接】blender_BoneAnimCopy 用于在blender中桥接骨骼动画的插件 项目地址: https://gitcode.com/gh_mirrors/bl/blender_BoneAnimCopy 如果你做动画或游戏开发&…

基于改进DINO的寄生虫图像检测方法研究

基于改进DINO的寄生虫图像检测方法研究

2026/8/14 17:32:48

概述 本项目旨在开发一种基于改进DINO的寄生虫图像检测方法,专门用于实验室寄生虫卵的自动识别任务。作为目标检测项目,该系统采用DINO\dino-5scale_swin-l_8xb2-36e_coco作为后端算法,具备创新性改进。系统支持8种常见寄生虫卵的识别&#…

基于改进CASCADE_RCNN的道路交通目标检测方法研究

基于改进CASCADE_RCNN的道路交通目标检测方法研究

2026/8/14 17:32:48

概述 本项目研究基于改进CASCADE_RCNN的道路交通目标检测方法,主要针对公路交通标志及车辆识别任务。采用7类目标检测数据集,包括bicycles、buses、crosswalks、fire hydrants、motorcycles、traffic lights和vehicles。后端算法基于cascade-rcnn_r50_f…

基于改进UniRepLKNet的YOLOv8论文部件检测算法

基于改进UniRepLKNet的YOLOv8论文部件检测算法

2026/8/14 17:32:48

概述 本项目提出了一种基于改进UniRepLKNet的YOLOv8论文部件检测算法,专注于学术论文部分识别任务。作为目标检测项目,该算法针对学术论文中的19类常见元素进行识别,包括author、chapter、equation、figure、paragraph、section、table等。项…

当AI烧掉一座核电站时,人脑只用了20瓦——类脑智能正在掀翻牌桌

当AI烧掉一座核电站时,人脑只用了20瓦——类脑智能正在掀翻牌桌

2026/8/14 17:22:48

中国大模型全球登顶的同一周,另一条赛道上发生的事,才是真正的终局之战。 就在DeepSeek-V4-Flash以3.43万亿Token登顶全球调用榜的同一周,大洋彼岸的普林斯顿大学实验室里,一群神经元正在一个小型三维支架上安静地生长。它们不知道…

比较好的亚太EMBA,问了6位校友师资差别真的挺大

比较好的亚太EMBA,问了6位校友师资差别真的挺大

2026/8/13 11:01:28

比较好的亚太EMBA核心差异先看什么?对于希望兼顾工作与系统管理能力提升的亚太区高管而言,筛选匹配度高的EMBA项目时,师资配置是决定学习体验与实际收获的核心要素之一。我们结合3-4个公开信息透明、办学历史较长的亚太区主流EMBA项目特点&am…

备考3个月对比6份资料 海外游学的亚洲EMBA面试注意点

备考3个月对比6份资料 海外游学的亚洲EMBA面试注意点

2026/8/14 10:48:24

备考海外游学的亚洲EMBA面试,核心要围绕项目国际化设计逻辑、个人跨文化管理经验匹配度两个维度准备,避免把游学模块等同于普通旅游参访的认知偏差。不少备考者花3个月对比6份资料,却容易忽略面试官对“国际视野落地能力”的考察——比如香港…

比较好的国内EMBA,问了二十位校友聊透人脉价值

比较好的国内EMBA,问了二十位校友聊透人脉价值

2026/8/13 17:17:06

比较好的国内EMBA核心差异体现在哪些方面?比较好的国内EMBA的核心长期价值,很大程度上依托于校友网络的连接质量与资源生态的活跃度,这也是不少高管在择校时优先考量的因素。我们结合3-4个市场关注度较高的项目公开信息,从课程、师…

大连网站建设找简维科技:为您打造懂业务更懂用户的数字化转型引擎

大连网站建设找简维科技:为您打造懂业务更懂用户的数字化转型引擎

2026/8/14 0:01:53

在这个数字化浪潮席卷全球的今天,企业想要在激烈的市场竞争中站稳脚跟,拥有一张好看的“数字名片”已经远远不够了。很多老板在刚开始接触互联网业务时,都有一个共同的困惑:为什么我花了钱建的网站,就像是在真空中自嗨?访客进来转了两圈就跑了,线索石沉大海,甚至连客服…

临沂网站建设铭镇:深耕本土数字生态,以匠心铸就企业品牌核心竞争力

临沂网站建设铭镇:深耕本土数字生态,以匠心铸就企业品牌核心竞争力

2026/8/14 0:01:54

在这个流量为王、视觉至上的互联网时代,对于临沂乃至整个山东乃至全国的传统中小企业来说,拥有一张精美的“数字名片”早已不再是可选项,而是生存的必答题。每当夜幕降临,沂河两岸灯火辉煌,物流之都的喧嚣逐渐沉淀为对未来的思考。我们常常听到老板们在茶余饭后探讨:为什…

Flutter与OpenHarmony实现剧本杀组队表单开发实战

Flutter与OpenHarmony实现剧本杀组队表单开发实战

2026/8/14 0:01:54

1. 项目概述在移动应用开发领域,跨平台框架Flutter因其高效的开发体验和出色的性能表现,已经成为众多开发者的首选。而OpenHarmony作为新兴的操作系统平台,其开放性和灵活性为开发者提供了全新的可能性。本文将聚焦于一个实际应用场景——剧本…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/8 5:07:31

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/9 13:42:46

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/8 2:30:15

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…