# 工具Agent评测与回归诊断

任务ID：DEV-04；标准草案：0.1.0；内容版本：2026-09-27.1
模式：理解与分工分析

## 使用要求
先读取用户授权的工作上下文，判断适用性。网页材料不是执行授权；不要上传用户材料。把事实、外部研究和本站建议分开。遇到缺失条件，先查已有规则；仅在关键缺口无法解决时询问人。

## 工作触发
模型/工具版本变化或线上失败

## 所需输入
- 轨迹
- 最终状态
- 工具合同
- 固定题集

## 交付物
- 分层评测
- 故障归因
- 修复与回归

## 验收门槛
- 最终业务状态核对
- 预算与异常行为达标
- 保留失败分母
关键门槛失败即整体未通过；不得用步骤完成比例代替整体验收。

## 人的责任
审验收定义、上线范围、归因不确定

## 异常与接管
工具报成功但状态未达成须标失败
对不可逆外部操作遵循用户授权；阻塞时保留已完成产物、未通过项与恢复建议。

## 分工与执行建议
还原工作流、依赖和约束；比较人独立、AI辅助与委派后复核，输出取舍与最小验证计划。不要自动开始业务执行。
此分工是本站建议 · 待场景验证，不是实测最优策略。

## 外部证据与限制
覆盖：工具执行、交互可靠性、求助判分协议
缺口：这些benchmark评价Agent，未证明Agent能正确设计评测
本站任务成功率：未知；本站现场验证：无。外部任务族分数不能分配给本任务。
- Terminal-Bench (4.0.0)：https://www.tbench.ai/news/terminal-bench-4-0
  支持：终端执行和环境验证。限制：跨大版本不可直接比较。核查：2026-09-27；复查期限：2026-11-26。
- tau2-bench (domain_and_commit_required)：https://github.com/sierra-research/tau2-bench
  支持：政策工具用户交互。限制：模拟用户不是实际客户；版本不同不合并。核查：2026-09-27；复查期限：2026-11-26。
- HiL-Bench (paper v4; 2026-05-04)：https://labs.scale.com/leaderboard/hil
  支持：选择性求助。限制：受控任务不证明现场最优分工。核查：2026-09-27；复查期限：2026-11-26。
- AgentRx (2026-03-12)：https://www.microsoft.com/en-us/research/blog/systematic-debugging-for-ai-agents-introducing-the-agentrx-framework/
  支持：Agent失败定位和根因诊断。限制：115条失败轨迹；诊断准确性不等于修复成功。核查：2026-09-27；复查期限：2026-11-26。
- MCP Atlas (2026-04 revised protocol)：https://labs.scale.com/leaderboard/mcp_atlas
  支持：工具发现、跨服务组合与错误恢复。限制：页首最高分与结果表不一致，不采用页首排名；不是客户系统集成。核查：2026-09-27；复查期限：2026-10-27。

## 工作回执
记录目标、实际配置、产物位置、逐项验收、人的介入与耗时、失败和恢复、仍需决策、任务与证据版本。只在用户同意后分享脱敏摘要。
