W.AI工作标准面向AI从业者给我的 Agent
研究预览:任务标准为草案,本站未运行AI实测;外部评测数值不代表本站任务成绩。方法与局限 →

证据库

依据公开,判断有边界

把任务基准、对照研究、实际使用观察与供应商自测分开看。结果连同测试条件一起引用。

业务职能的公开研究:AutomationBench、Anthropic职业数据与GDPval →

24组来源原始来源核查 · 未经本站复现
任务基准E01

SWE-Bench Pro V2

修复与回归

不能把聚合分数下放到幂等任务
Scale / Reflection关联3项任务
任务基准E02

SWE-Lancer

开发交付与技术方案选择

历史结果,非完整产品管理
OpenAI关联1项任务
任务基准E03

Terminal-Bench

终端执行和环境验证

跨大版本不可直接比较
Terminal-Bench / Harbor关联4项任务
任务基准E04

GDPval

专业产物验收

一次性交付,不能全岗外推
OpenAI关联2项任务
任务基准E05

Remote Labor Index

完整项目产物

排除直接客户互动和长期效果
Scale / CAIS关联1项任务
任务基准E06

DABstep

多源业务数据分析

Validated和Unvalidated分开,未抄取当前完整数值表
Adyen / Hugging Face关联3项任务
任务基准E07

Spider 2.0

企业SQL工作流

输出正确不等于业务口径合理
Spider研究团队关联2项任务
任务基准E08

WorkArena / WorkArena++

企业UI和组合流程

不证明客户发现或现场采用
ServiceNow研究团队关联3项任务
任务基准E09

tau2-bench

政策工具用户交互

模拟用户不是实际客户;版本不同不合并
Sierra研究团队关联5项任务
任务基准E10

CRMArena-Pro

CRM业务与多轮交互

仓库限定研究用途,GUI需申请
Salesforce研究团队关联1项任务
对照研究E11

Voice of Customer

客户需求抽取

抽取不等于优先级;未确认完整数据开放
Voice of Customer研究团队关联2项任务
任务基准E12

AD-Bench

广告分析正确性与轨迹

非实际广告增量;旧资产核验显示数据未开放
AD-Bench研究团队关联2项任务
观察与历史数据E13

Upworthy Research Archive

真实实验结果与可靠性

非当前AI评测;随机化异常需筛选
Upworthy档案研究团队关联4项任务
供应商自测E14

Marketing Benchmark

营销产物与分析任务

单次尝试,自测,judge与holdout限制
Magister供应商关联6项任务
任务基准E15

HiL-Bench

选择性求助

受控任务不证明现场最优分工
Scale研究团队关联6项任务
观察与历史数据E16

Anthropic Agent autonomy

授权打断澄清模式

观察相关性及厂商用户样本
Anthropic关联1项任务
对照研究E18

HBS BCG jagged frontier

不同任务的辅助效果

历史模型和咨询任务
HBS / BCG关联3项任务
任务基准E19

AgentRx

Agent失败定位和根因诊断

115条失败轨迹;诊断准确性不等于修复成功
Microsoft Research关联1项任务
任务基准E20

SpreadsheetBench 2

工作簿生成、修复与可视化交付

V1和V2分开;复杂环境及模型配置影响结果
SpreadsheetBench研究团队关联2项任务
任务基准E21

MCP Atlas

工具发现、跨服务组合与错误恢复

页首最高分与结果表不一致,不采用页首排名;不是客户系统集成
Scale研究团队关联2项任务
任务基准E22

TheAgentCompany

企业多应用和同事交互任务

模拟公司及同事,非真人组织采用;未取当前榜单数值
TheAgentCompany研究团队关联1项任务
任务基准E23

OSWorld 2.0

长流程、跨应用、状态与核对

108任务及500步协议,不能与V1直接比较
OSWorld研究团队关联2项任务
任务基准E24

SentinelBench

长期监测、等待、条件触发与不行动

100个合成网页任务,事件时间人工设置;非生产稳定性证明
Microsoft Research监测专题 · 未绑定任务