W.AI工作标准面向AI从业者给我的 Agent
研究预览:任务标准为草案,本站未运行AI实测;外部评测数值不代表本站任务成绩。方法与局限 →

Microsoft Research / 任务基准

AgentRx

Agent失败定位和根因诊断

阅读原始来源 ↗任务基准原始资料已查阅 · 2026-09-27

证据条件

版本
2026-03-12
资料开放性
公开失败轨迹
来源家族
Microsoft Research
下次复核
2026-11-26
本站复现
未运行;引用外部研究

阅读限制

这份证据还不能证明

115条失败轨迹;诊断准确性不等于修复成功

同一实验的论文、博客和转载按一组来源计算。本站任务适配属于分析判断,不代表上游测试了本站任务。

外部结果快照

保留原指标,不作跨基准总排名
研究作者报告

AgentRx,相对提示基线

+23.6个百分点

失败定位准确性提升

范围
115条人工标注失败轨迹
配置
研究所报诊断流程与提示基线
运行日期
原文未披露,不能以核查日代替
报告日期
2026-03-12
原文位置
Microsoft Research / Key Results

是诊断准确性差值,不是任务成功率或修复成功率。

关联的工作任务

以下为部分覆盖或方法关联,尚未完成逐题对应。

AI开发DEV-04

评测工具Agent,定位失败与回归

标准:工具Agent评测与回归诊断

分层评测 · 故障归因 · 修复与回归

人的责任审验收定义、上线范围、归因不确定
基础草案3条验收门槛 · 5组相关来源