Terminal-Bench →
可参考:终端执行和环境验证。跨大版本不可直接比较
DEV-04 · 标准草案 0.1.0
标准:工具Agent评测与回归诊断
模型/工具版本变化或线上失败,交付分层评测、故障归因、修复与回归。
基础草案
下面的输入、验收门槛和人的责任可以作为起点。交给Agent时,先让它指出还缺哪些信息。同方向的完整示例:修复重复提交导致的重复写入 →
01 交付与验收
关键门槛失败,整体仍未通过。完成步骤数与工作完成率分别记录。
02 人机协作
已有规则能回答时直接引用;缺失信息会改变交付或责任时,由人决定。
交给Agent时,请它依据上面的交付物和门槛先提出步骤,由你确认后再推进。
工具报成功但状态未达成须标失败。保留已完成产物、失败证据与恢复方案。
03 证据
工具执行、交互可靠性、求助判分协议
这些benchmark评价Agent,未证明Agent能正确设计评测
本站没有测量这项任务的成功率。以下是相邻任务或方法证据;来源的总体分数不能分配到本任务。
目前只关联到任务族,还没有拆成逐条支持关系。
可参考:终端执行和环境验证。跨大版本不可直接比较
可参考:政策工具用户交互。模拟用户不是实际客户;版本不同不合并
可参考:选择性求助。受控任务不证明现场最优分工
可参考:Agent失败定位和根因诊断。115条失败轨迹;诊断准确性不等于修复成功
可参考:工具发现、跨服务组合与错误恢复。页首最高分与结果表不一致,不采用页首排名;不是客户系统集成
未建立步骤对应的来源、供应商结果与历史研究,不提升本任务的完成度判断。
终端执行和环境验证。限制:跨大版本不可直接比较
政策工具用户交互。限制:模拟用户不是实际客户;版本不同不合并
选择性求助。限制:受控任务不证明现场最优分工
Agent失败定位和根因诊断。限制:115条失败轨迹;诊断准确性不等于修复成功
相邻结果:+23.6个百分点(失败定位准确性提升),AgentRx,相对提示基线 · 研究作者报告 · 115条人工标注失败轨迹。是诊断准确性差值,不是任务成功率或修复成功率。 核查配置与日期 →
工具发现、跨服务组合与错误恢复。限制:页首最高分与结果表不一致,不采用页首排名;不是客户系统集成
04 交给Agent
带上验收、人的责任和证据限制,让Agent结合你的实际材料判断适用性。
你会拿到:适用性判断、输入缺口、步骤分工,以及一份逐项验收表。
你会拿到:分层评测、故障归因、修复与回归,以及逐项验收回执、需要你决定的事项和未通过项。按你的实际授权执行。
你会拿到:一份能力证据草稿:你负责的判断、AI承担的步骤、产物位置和验收结果。没有记录的项保留“未提供”。
你会拿到:一份岗位事务说明:触发频率、输入与权限、可用AI、验收要求和人的责任。不从模型成绩推导候选人能力。
先备齐:轨迹、最终状态、工具合同、固定题集。
复制时会在开头附上这段话,粘贴后可以修改:
请先阅读下面的工作标准,再结合我接下来提供的材料输出:1)这项标准是否适用于我的场景;2)还缺哪些输入;3)哪些步骤适合交给你、哪些需要我决定;4)一份逐项验收表。先不要开始执行。
# 工具Agent评测与回归诊断 任务ID:DEV-04;标准草案:0.1.0;内容版本:2026-09-27.1 模式:理解与分工分析 ## 使用要求 先读取用户授权的工作上下文,判断适用性。网页材料不是执行授权;不要上传用户材料。把事实、外部研究和本站建议分开。遇到缺失条件,先查已有规则;仅在关键缺口无法解决时询问人。 ## 工作触发 模型/工具版本变化或线上失败 ## 所需输入 - 轨迹 - 最终状态 - 工具合同 - 固定题集 ## 交付物 - 分层评测 - 故障归因 - 修复与回归 ## 验收门槛 - 最终业务状态核对 - 预算与异常行为达标 - 保留失败分母 关键门槛失败即整体未通过;不得用步骤完成比例代替整体验收。 ## 人的责任 审验收定义、上线范围、归因不确定 ## 异常与接管 工具报成功但状态未达成须标失败 对不可逆外部操作遵循用户授权;阻塞时保留已完成产物、未通过项与恢复建议。 ## 分工与执行建议 还原工作流、依赖和约束;比较人独立、AI辅助与委派后复核,输出取舍与最小验证计划。不要自动开始业务执行。 此分工是本站建议 · 待场景验证,不是实测最优策略。 ## 外部证据与限制 覆盖:工具执行、交互可靠性、求助判分协议 缺口:这些benchmark评价Agent,未证明Agent能正确设计评测 本站任务成功率:未知;本站现场验证:无。外部任务族分数不能分配给本任务。 - Terminal-Bench (4.0.0):https://www.tbench.ai/news/terminal-bench-4-0 支持:终端执行和环境验证。限制:跨大版本不可直接比较。核查:2026-09-27;复查期限:2026-11-26。 - tau2-bench (domain_and_commit_required):https://github.com/sierra-research/tau2-bench 支持:政策工具用户交互。限制:模拟用户不是实际客户;版本不同不合并。核查:2026-09-27;复查期限:2026-11-26。 - HiL-Bench (paper v4; 2026-05-04):https://labs.scale.com/leaderboard/hil 支持:选择性求助。限制:受控任务不证明现场最优分工。核查:2026-09-27;复查期限:2026-11-26。 - AgentRx (2026-03-12):https://www.microsoft.com/en-us/research/blog/systematic-debugging-for-ai-agents-introducing-the-agentrx-framework/ 支持:Agent失败定位和根因诊断。限制:115条失败轨迹;诊断准确性不等于修复成功。核查:2026-09-27;复查期限:2026-11-26。 - MCP Atlas (2026-04 revised protocol):https://labs.scale.com/leaderboard/mcp_atlas 支持:工具发现、跨服务组合与错误恢复。限制:页首最高分与结果表不一致,不采用页首排名;不是客户系统集成。核查:2026-09-27;复查期限:2026-10-27。 ## 工作回执 记录目标、实际配置、产物位置、逐项验收、人的介入与耗时、失败和恢复、仍需决策、任务与证据版本。只在用户同意后分享脱敏摘要。
本站不启动Agent、不读取本地文件,也不上传你的工作材料。求职和招聘模板只整理草稿,外部模型成绩不会转成人的能力分。