W.AI工作标准面向AI从业者给我的 Agent
研究预览:任务标准为草案,本站未运行AI实测;外部评测数值不代表本站任务成绩。方法与局限 →

OpenAI / 任务基准

GDPval

专业产物验收

阅读原始来源 ↗任务基准原始资料已查阅 · 2026-09-27

证据条件

版本
2025-09-25 introduction
资料开放性
部分任务公开
来源家族
OpenAI
下次复核
2026-11-26
本站复现
未运行;引用外部研究

阅读限制

这份证据还不能证明

一次性交付,不能全岗外推

同一实验的论文、博客和转载按一组来源计算。本站任务适配属于分析判断,不代表上游测试了本站任务。

外部结果快照

保留原指标,不作跨基准总排名
本页暂未摘录可解释的数值快照

可查原始结果入口。没有记录的分数保持未知,不以旧数字补齐。

关联的工作任务

以下为部分覆盖或方法关联,尚未完成逐题对应。

AI产品PM-01

判断一个业务问题是否值得用AI解决

标准:有证据的AI机会判断

证据矩阵 · 备选方案 · 可证伪试点假设

人的责任选择目标和取舍,不编造用户需求
基础草案3条验收门槛 · 3组相关来源
内容与增长GROW-01

按人群制作有事实依据的内容

标准:证据驱动的分群内容

内容草稿 · 主张台账 · 来源与限制

人的责任保证产品事实和发布责任
完整示例3条验收门槛 · 3组相关来源