W.AI工作标准面向AI从业者给我的 Agent
研究预览:任务标准为草案,本站未运行AI实测;外部评测数值不代表本站任务成绩。方法与局限 →

研究来源与口径

业务职能的公开研究

这些研究按销售、客服、财务等业务职能分类,与本站的AI岗位方向不同,作为背景参考。数据快照核查于 2026-09-27;本站重绘公开数值,保留原指标和适用边界。

下载结构化图表数据 JSON →

业务职能的公开研究

公开测试中,AI完成到了哪一步?

来源核查 2026-09-27

三种证据回答不同问题:业务流程能否完成、人怎样参与、交付质量能否达到专业水平。它们按业务职能分类,与本站AI岗位方向不同。

使用观察 · 非完成率

不同职业相关使用中,有多少采用任务委派?

Anthropic · 2026-05全球样本。自动化交互占比:聊天与Cowork对比1P API(API排除Claude Code)。

纵轴:自动化交互占比(0–100%) · 横轴:SOC职业大类
聊天与Cowork1P API

Anthropic Economic Index · 发布 2026-06-26 · 数据CC-BY,本站按官方CSV重绘 · 原始来源 ↗

这张图显示人怎样使用AI。自动化包含直接委派和反馈循环;高占比不代表相同比例的工作通过了验收。

把结果对应到具体工作

不同图表使用不同分类与指标。先找到场景,再核对输入、验收和人的责任。

01 / AutomationBench:独立执行到业务验收

全部计分断言通过,整题才计为成功;检查最终业务状态。API模式,最多50步,无人在环;按各方向的最优模型与推理档位展示。

模拟业务环境;各柱可能对应不同模型,不是同一Agent的全岗表现。公开600题不是官方榜单的分母。 榜单未逐项披露本次运行日期及各方向私有样本数,本站不反推或补写。

v1.0.6各方向前两名;最高档位不固定
业务方向最高成绩/模型配置第二名/模型配置关联工作
销售CRM、线索和跨应用流程45.3%
Claude Opus 5.5
Max + default fallbacks
40.17%
GPT-6 Astra
Max
任务与分类映射 →
营销营销活动、广告分析和内容运营50%
GPT-6 Astra
Max
48%
Claude Opus 5.5
Max + default fallbacks
任务与分类映射 →
运营项目、供应商和业务流程65%
Claude Opus 5.5
Max + default fallbacks
62%
GPT-6 Astra
Max
任务与分类映射 →
客服工单、SLA与知识库39%
GPT-6 Astra
XHigh
38%
Claude Opus 5.5
Max + default fallbacks
任务与分类映射 →
财务应收应付、费用和报表43.33%
GPT-6 Astra
High
37.5%
Claude Opus 5.5
Max + default fallbacks
任务与分类映射 →
HR招聘、入职与薪酬流程26.67%
Gemini 3.8 Flash
Medium
25%
Claude Opus 5.5
Max + default fallbacks
任务与分类映射 →

Claude Opus 5.5的default fallbacks会把被拒绝的步骤交给供应商默认后备模型。分方向按最佳档位取值;这是不同配置达到的边界,不是统一模型、成本或无后备模型的公平排名。

全任务集结果(原始配置)

各方向成绩不是全任务集成绩的简单平均。

交叉核查结果

OpenAI 2026-09-22发布表中的GPT-6 Sol (xhigh) 33.2%与Zapier官方表一致。OpenAI发布表与Zapier榜单数值一致;属于同一评测的引用核对,不是两次独立复现。公开仓库的600题成绩属于另一任务集,不能混入本图。

关联任务仅提供场景入口;本站任务未被该评测逐题测量。

02 / Anthropic:职业相关交互中的自动化比例

数据期:2026-05-01至2026-06-01(不含结束日);发布 2026-06-26。全球SOC职业大类,按原始CSV直接取值,不按本站五个方向重分配。自动化与协作是交互分类,不是验收结果。

六个与知识工作相关的职业大类;未按得分挑选
职业/SOC聊天自动化聊天协作API自动化API协作
计算机与数学 / 1563.9%36.1%94.58%5.42%
商业与财务 / 1342.61%57.39%94.92%5.08%
管理 / 1143.9%56.1%95.58%4.42%
艺术与传媒 / 2735.85%64.15%94.83%5.17%
销售 / 4143.79%56.21%90.78%9.22%
办公与行政 / 4356.02%43.98%94.41%5.59%

职业相关使用中的交互分类;不是该职业所有任务的自动化率或验收成功率。1P API排除Claude Code;聊天样本含Chat与Cowork。 缺失单元格不当作零;本图六类的两项指标均已公布。数据包没有task_success字段,因此没有从自动化比例推导成功率。

提取规则与可复核性

源文件:aei_claude_ai_2026-06-26.csv、aei_1p_api_2026-06-26.csv。筛选GLOBAL / soc_occupation / hierarchy_level=1、2026-05-01,SOC为15/13/11/27/41/43,指标为collaboration_bucket_automation_pct与collaboration_bucket_augmentation_pct。保留官方两位小数。

官方zip SHA-256:9be20dd451b91e4d59bd605528a8d5e55f6a182c1d280172f303f871553236da

来源Anthropic,CC-BY。本站翻译标签、重绘;无模型能力实测。

03 / OpenAI GDPval:与专业产物比较

44个职业的明确知识工作任务;与专业人员产物比较。专家偏好比较的胜或平,不是业务流程严格通过率。此处为4月历史结果,不声称当前SOTA。

2026-04-23发布表内:GPT-5.5 84.9%,GPT-5.4 83%,Claude Opus 4.7 80.3%。均为wins or ties。保留这份历史快照说明产物质量维度,不冒充当前模型榜单。

更新与局限

本次查阅Anthropic六月Economic Index、三月任务数据,OpenAI四月GDPval及九月模型报告,并沿引用核对Zapier官方结果和评分仓库。六月经济数据是本轮找到的最近公开发布,九月OpenAI报告没有GDPval新表。未来更新按数据集与协议分别归档,不用页面访问日覆盖采样或运行日期。

返回首页 →

从研究到工作

图表里的业务方向,怎样对应本站任务?

外部评测按业务职能分类,本站按AI岗位方向组织。以下只是场景关联,没有逐题对应;研究成绩不分配到关联任务。