W.AI工作标准面向AI从业者给我的 Agent
研究预览:任务标准为草案,本站未运行AI实测;外部评测数值不代表本站任务成绩。方法与局限 →

方法

标准说明结果,证据说明边界

我们组织可查证的工作要求与外部评测,帮助人和Agent做有条件的接管判断。

两层标准,分别维护

交付与验收要求

任务目标、输入、产物、质量门槛与人的责任。由具体业务需求决定;本站当前内容为研究草案。

AI接管建议

模型、Agent、工具、上下文与人的参与方式。随外部测试与产品变化修订,并保留适用条件。

完整示例的最低要求

任务标为“完整示例”前,须具备以下内容;达不到的保持“基础草案”。

  1. 输入说明:每项写明形态与来源,而不只是名词。
  2. 分工步骤:2–4步,每步写明Agent做什么、人决定什么、用什么门槛验收。
  3. 常见失败:至少一条真实会发生的失败方式。
  4. 产物样例:标明人工构造、未执行的交付格式示例。
  5. 证据对应:每条结论注明来源、支持关系与限制;供应商自测和背景资料不进入主证据区。

当前5项完整示例、15项基础草案。

怎样使用公开评测

  1. 先定位具体任务和交付要求。
  2. 核查原始方法、版本、任务范围、配置与判分。
  3. 区分直接证据、部分覆盖、方法参考与未覆盖。
  4. 交叉核对独立来源,保留反例、利益关系和条件差异。
  5. 来源变化触发复核;核查日期不改写为实验日期。

本地复现不是引用的前置条件。所有结果标记外部执行方,本站没有运行这些AI任务。

完成度的几个不同含义

整体验收
关键门槛是否通过,产物是否可接收。
部分得分
一部分验收项或检查点得到分数,不等于整体完成。
Pass@k
k次尝试中至少一次成功;不能当作每次都可靠。
Pass^k
重复k次均成功的可靠性口径,须以来源定义为准。
人的参与
目标与口径确认、复核、接管及其时间成本;外部未测时保持未知。

岗位任务图的数据与口径

首页和方向页的任务条,把一个参照职业拆成O*NET 31.0中的全部任务陈述,再合并Anthropic经济指数 release-2026-06-26 中 2026-05-01 至 2026-06-01(不含)全球Claude聊天的任务级数据。

段宽
O*NET任务重要度(IM,1–5)在该职业内的占比;不是工时占比。
委派为主
自动化交互占比 ≥ 50%:委派不少于协作。
协作为主
自动化交互占比 < 50%:协作多于委派。
未公布
该月未公布该任务的使用数据(样本未达公布门槛,不等于零)。
耗时
“人独立/借助AI”的耗时是Anthropic用模型对对话做的估计,不是计时实验。

这些数据描述人们在Claude中如何使用AI处理某类任务,不是AI完成率、质量或岗位可替代比例;也只覆盖一个产品的用户。O*NET没有产品经理和FDE职业,本站用最接近的职业作参照,并在图中注明。任务译名为本站翻译,原文随明细展示。数据许可:Anthropic CC-BY;O*NET CC BY 4.0(O*NET® 是美国劳工部就业与培训管理局的注册商标)。

下载任务图数据 JSON →

“理想边界”是条件化的选择

在质量与责任门槛下,比较人独立、AI辅助、委派后复核等方式的时间、成本和失败风险。外部证据支持局部判断;目前不声称所有工作存在唯一最优分工。

模型分数不能转成人的能力分。候选人需要工作证据,用人方需要业务条件与责任要求,两侧都应保留具体上下文。

持续维护与纠错

来源有版本、核查时间和复核期限:榜单和供应商页面30天,其他任务基准60天,研究与历史档案90天。监测变化只产生待审线索,内容需核对后更新;目前没有已部署的自动调度。

引用原则:优先一手研究;供应商自测明确标识;同研究的转载不增加独立性;不对不可比条件投票平均。

编辑责任由AI工作标准观察站维护者承担,本站由AINativeMatch项目维护。机构名称仅标识引用来源,不代表背书。本站分工建议与上游研究结论分别标记;当前没有本站独立复现。纠错时,在任务页底部“发现问题?”复制纠错记录,其中包含任务ID和版本。公开提交渠道尚未配置,请先复制纠错记录。

变化可通过 Atom 或 JSON 订阅。

从结论追到原始资料

任务页先说明每个结论借鉴了哪个任务族、步骤或方法,再进入证据页查指标、配置、日期与原始资料。关联资料并不自动支持当前任务。完整示例有逐条编辑对应,基础草案只保留任务族层面的关联。

查看编辑对应、说明示例与版本 →

当前覆盖与限制

20项任务草案、24组外部来源、5条结果快照。任务映射为初步语义覆盖,未完成全部逐题审查;没有现场画像效度,也没有全行业代表性保证。本站所有任务成功率均为未知,协作建议待场景验证。

查看公开数据与版本