方法
标准说明结果,证据说明边界
我们组织可查证的工作要求与外部评测,帮助人和Agent做有条件的接管判断。
两层标准,分别维护
交付与验收要求
任务目标、输入、产物、质量门槛与人的责任。由具体业务需求决定;本站当前内容为研究草案。
AI接管建议
模型、Agent、工具、上下文与人的参与方式。随外部测试与产品变化修订,并保留适用条件。
完整示例的最低要求
任务标为“完整示例”前,须具备以下内容;达不到的保持“基础草案”。
- 输入说明:每项写明形态与来源,而不只是名词。
- 分工步骤:2–4步,每步写明Agent做什么、人决定什么、用什么门槛验收。
- 常见失败:至少一条真实会发生的失败方式。
- 产物样例:标明人工构造、未执行的交付格式示例。
- 证据对应:每条结论注明来源、支持关系与限制;供应商自测和背景资料不进入主证据区。
当前5项完整示例、15项基础草案。
怎样使用公开评测
- 先定位具体任务和交付要求。
- 核查原始方法、版本、任务范围、配置与判分。
- 区分直接证据、部分覆盖、方法参考与未覆盖。
- 交叉核对独立来源,保留反例、利益关系和条件差异。
- 来源变化触发复核;核查日期不改写为实验日期。
本地复现不是引用的前置条件。所有结果标记外部执行方,本站没有运行这些AI任务。
完成度的几个不同含义
- 整体验收
- 关键门槛是否通过,产物是否可接收。
- 部分得分
- 一部分验收项或检查点得到分数,不等于整体完成。
- Pass@k
- k次尝试中至少一次成功;不能当作每次都可靠。
- Pass^k
- 重复k次均成功的可靠性口径,须以来源定义为准。
- 人的参与
- 目标与口径确认、复核、接管及其时间成本;外部未测时保持未知。
岗位任务图的数据与口径
首页和方向页的任务条,把一个参照职业拆成O*NET 31.0中的全部任务陈述,再合并Anthropic经济指数 release-2026-06-26 中 2026-05-01 至 2026-06-01(不含)全球Claude聊天的任务级数据。
- 段宽
- O*NET任务重要度(IM,1–5)在该职业内的占比;不是工时占比。
- 委派为主
- 自动化交互占比 ≥ 50%:委派不少于协作。
- 协作为主
- 自动化交互占比 < 50%:协作多于委派。
- 未公布
- 该月未公布该任务的使用数据(样本未达公布门槛,不等于零)。
- 耗时
- “人独立/借助AI”的耗时是Anthropic用模型对对话做的估计,不是计时实验。
这些数据描述人们在Claude中如何使用AI处理某类任务,不是AI完成率、质量或岗位可替代比例;也只覆盖一个产品的用户。O*NET没有产品经理和FDE职业,本站用最接近的职业作参照,并在图中注明。任务译名为本站翻译,原文随明细展示。数据许可:Anthropic CC-BY;O*NET CC BY 4.0(O*NET® 是美国劳工部就业与培训管理局的注册商标)。
下载任务图数据 JSON →“理想边界”是条件化的选择
在质量与责任门槛下,比较人独立、AI辅助、委派后复核等方式的时间、成本和失败风险。外部证据支持局部判断;目前不声称所有工作存在唯一最优分工。
模型分数不能转成人的能力分。候选人需要工作证据,用人方需要业务条件与责任要求,两侧都应保留具体上下文。
持续维护与纠错
来源有版本、核查时间和复核期限:榜单和供应商页面30天,其他任务基准60天,研究与历史档案90天。监测变化只产生待审线索,内容需核对后更新;目前没有已部署的自动调度。
引用原则:优先一手研究;供应商自测明确标识;同研究的转载不增加独立性;不对不可比条件投票平均。
编辑责任由AI工作标准观察站维护者承担,本站由AINativeMatch项目维护。机构名称仅标识引用来源,不代表背书。本站分工建议与上游研究结论分别标记;当前没有本站独立复现。纠错时,在任务页底部“发现问题?”复制纠错记录,其中包含任务ID和版本。公开提交渠道尚未配置,请先复制纠错记录。
从结论追到原始资料
任务页先说明每个结论借鉴了哪个任务族、步骤或方法,再进入证据页查指标、配置、日期与原始资料。关联资料并不自动支持当前任务。完整示例有逐条编辑对应,基础草案只保留任务族层面的关联。
查看编辑对应、说明示例与版本 →当前覆盖与限制
20项任务草案、24组外部来源、5条结果快照。任务映射为初步语义覆盖,未完成全部逐题审查;没有现场画像效度,也没有全行业代表性保证。本站所有任务成功率均为未知,协作建议待场景验证。
查看公开数据与版本