W.AI工作标准面向AI从业者给我的 Agent
研究预览:任务标准为草案,本站未运行AI实测;外部评测数值不代表本站任务成绩。方法与局限 →

变化记录

记录改变,也记录为什么改变

工作建议变化和资料维护分开记录。没有可比运行时,不把页面更新称为AI能力进步。

订阅:Atom · JSON

资料维护来源核查

DABstep区分已验证与未验证结果

对工作的影响

使用数据分析证据时,先核对榜单验证状态;继续按本地业务门槛验收,不因榜单维护状态改变委派范围。

原依据 / 条件

介绍页的早期结果容易被误作当前能力

新依据 / 条件

已验证榜单暂停新增验证;v2待发布

只引用具体结果状态和日期;没有取到可靠最新数值时保留原始入口。日期为本站核查日。

查看原始依据与限制 →
资料维护来源核查

营销自测保留可复核性缺口

对工作的影响

将营销供应商自测作为补充线索;验收标准不因自报分数而降低。等待可访问的任务和运行记录再评估支持力度。

原依据 / 条件

官网宣称任务、评分与原始运行已公开

新依据 / 条件

本轮访问所链仓库返回404

自测结果附明显限制,不升级为独立验证;后续重查公开资产。日期为本站核查日。

查看原始依据与限制 →
资料维护评测修订

SWE-Bench Pro修订任务与运行协议

对工作的影响

在软件回执中记录V2与运行协议;与旧版比较前先检查任务集合和配置。

原依据 / 条件

旧公开集731题

新依据 / 条件

V2为642题,修正任务并锁定协议

开发任务保留基准版本。旧版与新版成绩分开解释,不自动认定能力回退或进步。

查看原始依据与限制 →
工作建议变化新增工作流

OSWorld 2.0补充长流程与跨应用证据

对工作的影响

系统交接增加跨应用状态核对、部分失败与恢复检查;这是方法建议,不是现场成功率提升。

原依据 / 条件

主要参考单应用或较短操作任务

新依据 / 条件

新增108个长流程任务与整题/部分评分

企业交付页加入状态恢复、跨来源核对和最终验收要求,仍不宣称现场采用已验证。

查看原始依据与限制 →
工作建议变化新增方法

失败诊断也有可引用的评测

对工作的影响

Agent失败后保留轨迹与根因判断,分别验收诊断是否正确、修复是否有效。

原依据 / 条件

仅从是否完成观察Agent表现

新依据 / 条件

引入失败定位与根因分类证据

DEV-04增加失败轨迹审查;诊断增益与修复完成度分开展示。

查看原始依据与限制 →