证据库
依据公开,判断有边界
把任务基准、对照研究、实际使用观察与供应商自测分开看。结果连同测试条件一起引用。
任务基准E01
修复与回归
不能把聚合分数下放到幂等任务
Scale / Reflection关联3项任务
任务基准E02
开发交付与技术方案选择
历史结果,非完整产品管理
OpenAI关联1项任务
任务基准E03
终端执行和环境验证
跨大版本不可直接比较
Terminal-Bench / Harbor关联4项任务
任务基准E04
专业产物验收
一次性交付,不能全岗外推
OpenAI关联2项任务
任务基准E05
完整项目产物
排除直接客户互动和长期效果
Scale / CAIS关联1项任务
任务基准E06
多源业务数据分析
Validated和Unvalidated分开,未抄取当前完整数值表
Adyen / Hugging Face关联3项任务
任务基准E07
企业SQL工作流
输出正确不等于业务口径合理
Spider研究团队关联2项任务
任务基准E08
企业UI和组合流程
不证明客户发现或现场采用
ServiceNow研究团队关联3项任务
任务基准E09
政策工具用户交互
模拟用户不是实际客户;版本不同不合并
Sierra研究团队关联5项任务
任务基准E10
CRM业务与多轮交互
仓库限定研究用途,GUI需申请
Salesforce研究团队关联1项任务
对照研究E11
客户需求抽取
抽取不等于优先级;未确认完整数据开放
Voice of Customer研究团队关联2项任务
任务基准E12
广告分析正确性与轨迹
非实际广告增量;旧资产核验显示数据未开放
AD-Bench研究团队关联2项任务
观察与历史数据E13
真实实验结果与可靠性
非当前AI评测;随机化异常需筛选
Upworthy档案研究团队关联4项任务
供应商自测E14
营销产物与分析任务
单次尝试,自测,judge与holdout限制
Magister供应商关联6项任务
任务基准E15
选择性求助
受控任务不证明现场最优分工
Scale研究团队关联6项任务
观察与历史数据E16
授权打断澄清模式
观察相关性及厂商用户样本
Anthropic关联1项任务
对照研究E17
协作总时间与实验选择偏差
后续结果不是可靠当前收益估计
METR监测专题 · 未绑定任务
对照研究E18
不同任务的辅助效果
历史模型和咨询任务
HBS / BCG关联3项任务
任务基准E19
Agent失败定位和根因诊断
115条失败轨迹;诊断准确性不等于修复成功
Microsoft Research关联1项任务
任务基准E20
工作簿生成、修复与可视化交付
V1和V2分开;复杂环境及模型配置影响结果
SpreadsheetBench研究团队关联2项任务
任务基准E21
工具发现、跨服务组合与错误恢复
页首最高分与结果表不一致,不采用页首排名;不是客户系统集成
Scale研究团队关联2项任务
任务基准E22
企业多应用和同事交互任务
模拟公司及同事,非真人组织采用;未取当前榜单数值
TheAgentCompany研究团队关联1项任务
任务基准E23
长流程、跨应用、状态与核对
108任务及500步协议,不能与V1直接比较
OSWorld研究团队关联2项任务
任务基准E24
长期监测、等待、条件触发与不行动
100个合成网页任务,事件时间人工设置;非生产稳定性证明
Microsoft Research监测专题 · 未绑定任务