W.AI工作标准面向AI从业者给我的 Agent
研究预览:任务标准为草案,本站未运行AI实测;外部评测数值不代表本站任务成绩。方法与局限 →

Sierra研究团队 / 任务基准

tau2-bench

政策工具用户交互

阅读原始来源 ↗任务基准原始资料已查阅 · 2026-09-27

证据条件

版本
domain_and_commit_required
资料开放性
公开模拟环境
来源家族
Sierra研究团队
下次复核
2026-11-26
本站复现
未运行;引用外部研究

阅读限制

这份证据还不能证明

模拟用户不是实际客户;版本不同不合并

同一实验的论文、博客和转载按一组来源计算。本站任务适配属于分析判断,不代表上游测试了本站任务。

外部结果快照

保留原指标,不作跨基准总排名
本页暂未摘录可解释的数值快照

可查原始结果入口。没有记录的分数保持未知,不以旧数字补齐。

关联的工作任务

以下为部分覆盖或方法关联,尚未完成逐题对应。

AI开发DEV-03

按版本和权限检索知识、回答问题

标准:版本与权限约束的检索回答

回答服务 · 引用 · 拒绝/升级记录

人的责任定义授权、知识有效性及可接受错误
基础草案3条验收门槛 · 2组相关来源
AI开发DEV-04

评测工具Agent,定位失败与回归

标准:工具Agent评测与回归诊断

分层评测 · 故障归因 · 修复与回归

人的责任审验收定义、上线范围、归因不确定
基础草案3条验收门槛 · 5组相关来源
AI产品PM-02

设计AI失败时可恢复、可接管的交互

标准:带失败恢复的人机交互规格

原型 · 验收 · 纠错/撤销/升级说明

人的责任设定用户控制和组织责任
完整示例3条验收门槛 · 2组相关来源
企业交付 / FDEFDE-02

连接业务系统,交付可恢复的流程

标准:受限业务系统集成与交接

集成 · 对账 · 故障/撤销 · 运维交接

人的责任客户系统所有者批准上线;FDE负责交付事实
完整示例4条验收门槛 · 7组相关来源
企业交付 / FDEFDE-03

用设备知识辅助维护判断

标准:设备知识维护辅助

有出处且限定适用性的建议或澄清

人的责任负责适用性审核和现场操作决定
基础草案2条验收门槛 · 2组相关来源