研究来源与口径
业务职能的公开研究
这些研究按销售、客服、财务等业务职能分类,与本站的AI岗位方向不同,作为背景参考。数据快照核查于 2026-09-27;本站重绘公开数值,保留原指标和适用边界。
下载结构化图表数据 JSON →业务职能的公开研究
公开测试中,AI完成到了哪一步?
三种证据回答不同问题:业务流程能否完成、人怎样参与、交付质量能否达到专业水平。它们按业务职能分类,与本站AI岗位方向不同。
六类业务方向的最高报告通过率:26.67%–65%
AutomationBench 1.0.6 · 各方向最高已公布成绩。各柱采用不同模型与推理档位,不构成同一模型下的方向难度排名。
Zapier官方榜单 · v1.0.6 · 2026-09-27快照 · 原始来源 ↗
这里的“完成”要求所有计分断言通过。测试运行在模拟业务系统中,不能解释为同等比例的岗位可被替代。Claude Opus 5.5的default fallbacks会把被拒绝的步骤交给供应商默认后备模型。
不同职业相关使用中,有多少采用任务委派?
Anthropic · 2026-05全球样本。自动化交互占比:聊天与Cowork对比1P API(API排除Claude Code)。
Anthropic Economic Index · 发布 2026-06-26 · 数据CC-BY,本站按官方CSV重绘 · 原始来源 ↗
这张图显示人怎样使用AI。自动化包含直接委派和反馈循环;高占比不代表相同比例的工作通过了验收。
专业交付物与人工产物比较,结果如何?
GDPval · 44个职业 · 胜过或持平专业人员产物的比较占比(含持平)。
OpenAI发布表 · 2026-04-23 · 历史结果,不代表当前SOTA · 原始来源 ↗
GDPval衡量产物的专家比较结果;它与多应用流程的严格成功率口径不同,因此不与AutomationBench合成总分。
01 / AutomationBench:独立执行到业务验收
全部计分断言通过,整题才计为成功;检查最终业务状态。API模式,最多50步,无人在环;按各方向的最优模型与推理档位展示。
模拟业务环境;各柱可能对应不同模型,不是同一Agent的全岗表现。公开600题不是官方榜单的分母。 榜单未逐项披露本次运行日期及各方向私有样本数,本站不反推或补写。
| 业务方向 | 最高成绩/模型配置 | 第二名/模型配置 | 关联工作 |
|---|---|---|---|
| 销售CRM、线索和跨应用流程 | 45.3% Claude Opus 5.5 Max + default fallbacks | 40.17% GPT-6 Astra Max | 任务与分类映射 → |
| 营销营销活动、广告分析和内容运营 | 50% GPT-6 Astra Max | 48% Claude Opus 5.5 Max + default fallbacks | 任务与分类映射 → |
| 运营项目、供应商和业务流程 | 65% Claude Opus 5.5 Max + default fallbacks | 62% GPT-6 Astra Max | 任务与分类映射 → |
| 客服工单、SLA与知识库 | 39% GPT-6 Astra XHigh | 38% Claude Opus 5.5 Max + default fallbacks | 任务与分类映射 → |
| 财务应收应付、费用和报表 | 43.33% GPT-6 Astra High | 37.5% Claude Opus 5.5 Max + default fallbacks | 任务与分类映射 → |
| HR招聘、入职与薪酬流程 | 26.67% Gemini 3.8 Flash Medium | 25% Claude Opus 5.5 Max + default fallbacks | 任务与分类映射 → |
Claude Opus 5.5的default fallbacks会把被拒绝的步骤交给供应商默认后备模型。分方向按最佳档位取值;这是不同配置达到的边界,不是统一模型、成本或无后备模型的公平排名。
全任务集结果(原始配置)
- Claude Opus 5.5 · Max + default fallbacks:42.47%
- GPT-6 Astra · Max:41.4%
- GPT-6 Sol · XHigh:33.2%
各方向成绩不是全任务集成绩的简单平均。
交叉核查结果
OpenAI 2026-09-22发布表中的GPT-6 Sol (xhigh) 33.2%与Zapier官方表一致。OpenAI发布表与Zapier榜单数值一致;属于同一评测的引用核对,不是两次独立复现。公开仓库的600题成绩属于另一任务集,不能混入本图。
关联任务仅提供场景入口;本站任务未被该评测逐题测量。
02 / Anthropic:职业相关交互中的自动化比例
数据期:2026-05-01至2026-06-01(不含结束日);发布 2026-06-26。全球SOC职业大类,按原始CSV直接取值,不按本站五个方向重分配。自动化与协作是交互分类,不是验收结果。
| 职业/SOC | 聊天自动化 | 聊天协作 | API自动化 | API协作 |
|---|---|---|---|---|
| 计算机与数学 / 15 | 63.9% | 36.1% | 94.58% | 5.42% |
| 商业与财务 / 13 | 42.61% | 57.39% | 94.92% | 5.08% |
| 管理 / 11 | 43.9% | 56.1% | 95.58% | 4.42% |
| 艺术与传媒 / 27 | 35.85% | 64.15% | 94.83% | 5.17% |
| 销售 / 41 | 43.79% | 56.21% | 90.78% | 9.22% |
| 办公与行政 / 43 | 56.02% | 43.98% | 94.41% | 5.59% |
职业相关使用中的交互分类;不是该职业所有任务的自动化率或验收成功率。1P API排除Claude Code;聊天样本含Chat与Cowork。 缺失单元格不当作零;本图六类的两项指标均已公布。数据包没有task_success字段,因此没有从自动化比例推导成功率。
提取规则与可复核性
源文件:aei_claude_ai_2026-06-26.csv、aei_1p_api_2026-06-26.csv。筛选GLOBAL / soc_occupation / hierarchy_level=1、2026-05-01,SOC为15/13/11/27/41/43,指标为collaboration_bucket_automation_pct与collaboration_bucket_augmentation_pct。保留官方两位小数。
官方zip SHA-256:9be20dd451b91e4d59bd605528a8d5e55f6a182c1d280172f303f871553236da
来源Anthropic,CC-BY。本站翻译标签、重绘;无模型能力实测。
03 / OpenAI GDPval:与专业产物比较
44个职业的明确知识工作任务;与专业人员产物比较。专家偏好比较的胜或平,不是业务流程严格通过率。此处为4月历史结果,不声称当前SOTA。
2026-04-23发布表内:GPT-5.5 84.9%,GPT-5.4 83%,Claude Opus 4.7 80.3%。均为wins or ties。保留这份历史快照说明产物质量维度,不冒充当前模型榜单。
更新与局限
本次查阅Anthropic六月Economic Index、三月任务数据,OpenAI四月GDPval及九月模型报告,并沿引用核对Zapier官方结果和评分仓库。六月经济数据是本轮找到的最近公开发布,九月OpenAI报告没有GDPval新表。未来更新按数据集与协议分别归档,不用页面访问日覆盖采样或运行日期。
返回首页 →从研究到工作
图表里的业务方向,怎样对应本站任务?
外部评测按业务职能分类,本站按AI岗位方向组织。以下只是场景关联,没有逐题对应;研究成绩不分配到关联任务。
销售
本站以企业交付方向组织系统集成与流程发现;尚无销售专属标准。
查看CRM更新与客户跟进类公开任务与依据 →营销
关联内容与增长方向,任务条件仍需逐项对照。
查看营销内容与活动操作类公开任务与依据 →运营
关联流程集成与指标契约,不能代表全部运营工作。
查看跨系统业务操作类公开任务与依据 →客服
关联知识检索与业务系统操作;尚无客服专属标准。
查看客户支持与工单类公开任务与依据 →财务
关联订单对账;本站示例没有被该基准逐题测量。
查看财务业务操作类公开任务与依据 →人力资源
当前任务库尚无人力资源专属标准,可先查官方公开样例与评分方式。
本站暂无对应任务。
查看人力资源流程类公开任务与依据 →