核对订单收入,找出差异
标准:订单净额查询与对账SQL · 逐单对账与数据质量记录
面向AI从业者 · 研究预览
覆盖AI开发、AI产品、企业交付、数据分析与内容增长。把一项具体工作拆成AI能推进的步骤、人的判断和验收标准,再交给你的Agent。
5个方向 · 20项标准草案 · 5项完整示例
先找到你要完成的工作
把一个岗位拆成任务
每一行是本站一个方向的参照职业,每一段是它在O*NET中的一项任务。悬停或点击一段查看任务,点击职业名看逐项明细。
宽度:O*NET任务重要度(不是工时);颜色:Anthropic经济指数中2026-05全球Claude聊天里该任务的交互方式。显示人们怎样用AI,不是AI完成率或岗位可替代比例。
每个方向一项完整示例
完整示例包含输入说明、分工步骤、常见失败和人工构造的产物样例。其余任务是基础草案,可作为起点交给Agent补全。
SQL · 逐单对账与数据质量记录
补丁 · 反例与回归 · 影响和恢复说明
集成 · 对账 · 故障/撤销 · 运维交接
原型 · 验收 · 纠错/撤销/升级说明
内容草稿 · 主张台账 · 来源与限制
公开评测覆盖
按本站任务关联的外部评测整理。数值是评测作者在各自任务集上的结果,不是本站任务的成绩。
业务职能方向(销售、客服、财务等)的公开研究见 AutomationBench、Anthropic职业数据与GDPval →
怎样核查
机构名称仅标识资料出处,不代表对本站背书;来源多也不自动构成交叉验证。同一实验的论文与博客只算一组证据。
专业产物验收
OpenAI
回答:交付物是否满足专业要求?
一次性交付无法代表整个岗位。
软件任务与回归测试
Scale / Reflection
回答:代码修改能否通过指定验收?
任务集与协议版本影响可比性。
业务数据分析评测
Adyen / Hugging Face
回答:多来源数据能否得到正确答案?
已验证与未验证提交需分开看。
人在环中的求助评测
Scale研究团队
回答:Agent何时需要人的帮助?
受控任务无法证明现场最优分工。
真实使用观察
Anthropic
回答:实际使用中怎样授权、澄清与介入?
观察相关性不能证明因果和完成率。
生产率实验与方法复查
METR
回答:人机协作是否节省总时间?
样本与选择偏差限制收益外推。
使用数据分析证据时,先核对榜单验证状态;继续按本地业务门槛验收,不因榜单维护状态改变委派范围。
将营销供应商自测作为补充线索;验收标准不因自报分数而降低。等待可访问的任务和运行记录再评估支持力度。