W.AI工作标准面向AI从业者给我的 Agent
研究预览:任务标准为草案,本站未运行AI实测;外部评测数值不代表本站任务成绩。方法与局限 →

FDE-02 · 标准草案 0.1.0

连接业务系统,交付可恢复的流程

标准:受限业务系统集成与交接

客户批准在副本验证流程,交付集成、对账、故障/撤销、运维交接。

交给我的Agent ↓
完整示例外部证据:部分覆盖本站任务:未测核查 2026-09-27

建议怎样分工

接口、权限和验收明确后,可让Agent在授权环境联调;由人确认系统权限、例外处置和上线交接。

本站编辑建议,需结合你的实际材料验证。

01 交付与验收

怎样才算完成

所需输入

接口
双方系统的接口文档、测试环境地址与调用限额
对象字典
字段含义、必填项及两侧对象的对应关系
权限
测试账号与读写范围,标出需审批的写操作
样例记录
脱敏的正常与异常样例,覆盖超时、重复回调等情况

交付物

  • 集成
  • 对账
  • 故障/撤销
  • 运维交接

必须通过的门槛

  1. 对象映射正确
  2. 写入可追溯
  3. 重放不重复
  4. 负责人可接管

关键门槛失败,整体仍未通过。完成步骤数与工作完成率分别记录。

02 人机协作

AI推进工作,人把握关键判断

异常与接管条件

权限撤回、部分成功、后台绕行写入。保留已完成产物、失败证据与恢复方案。

从输入到验收,怎样走完这项工作

  1. 确认系统与权限

    Agent 盘点接口、字段、测试账号与依赖,准备映射清单。

    人 确认读写范围、数据责任与上线门槛。

    验收 未知权限和字段含义不靠猜测补齐。

  2. 联调与失败恢复

    Agent 在授权环境验证正常流程、超时、重试与部分失败。

    人 确定重复写入和中间状态的处置规则。

    验收 每一步状态可追溯,失败有恢复路径。

  3. 交付操作手册

    Agent 汇总状态核对、异常回执、恢复步骤和未通过项。

    人 验收并确认现场负责人。

    验收 关键用例未通过时不转入正式运行。

常见失败

  • 超时后未查询状态就重试,造成重复创建
  • 字段含义不明时凭名称猜测映射
  • 交接时没有指定现场负责人

联调交接回执

人工构造 · 未执行
说明示例|流程设计,尚未连接真实系统
目标:CRM审批通过 → 工单系统创建任务
输入:审批ID、客户ID、获准字段映射
正常路径:读取审批 → 校验 → 创建工单 → 回写关联ID
失败路径:请求超时 → 查询是否已创建 → 确认后重试
禁止:未查询状态就重复创建

待验证:权限拒绝 / 重复回调 / 超时 / 部分成功
交付:field-map.csv / runbook.md / acceptance.md
上线状态:等待环境验证与业务负责人验收

用来说明交付格式。实际工作须重新生成产物与验收记录。

03 证据

证据支持到哪里

可借鉴的范围

受控业务系统流程、跨服务工具组合与长流程验收;未验证现场系统权限及恢复。

仍未覆盖

UI操作不等于系统集成;交接与客户验收未覆盖

本站没有测量这项任务的成功率。以下是相邻任务或方法证据;来源的总体分数不能分配到本任务。

先看证据与任务的对应关系

全部关联资料与相邻结果(7组,含背景参考)

未建立步骤对应的来源、供应商结果与历史研究,不提升本任务的完成度判断。

WorkArena / WorkArena++ →

企业UI和组合流程。限制:不证明客户发现或现场采用

tau2-bench →

政策工具用户交互。限制:模拟用户不是实际客户;版本不同不合并

CRMArena-Pro →

CRM业务与多轮交互。限制:仓库限定研究用途,GUI需申请

相邻结果:约58% / 约35%(单轮 / 多轮成功率),论文中的领先Agent(摘要汇总) · 研究摘要 · CRMArena-Pro 2025论文摘要。多轮交互带来额外难度;历史结果,不作为当前排名。 核查配置与日期 →

Terminal-Bench →

终端执行和环境验证。限制:跨大版本不可直接比较

MCP Atlas →

工具发现、跨服务组合与错误恢复。限制:页首最高分与结果表不一致,不采用页首排名;不是客户系统集成

TheAgentCompany →

企业多应用和同事交互任务。限制:模拟公司及同事,非真人组织采用;未取当前榜单数值

OSWorld 2.0 →

长流程、跨应用、状态与核对。限制:108任务及500步协议,不能与V1直接比较

相邻结果:20.6% / 54.8%(整题完成 / 部分得分),Claude Opus 4.8 · max thinking · 研究作者报告 · OSWorld 2.0 · 108个长流程任务。两种指标不同;部分分不能当工作完成率,不能与V1直接比较。 核查配置与日期 →

相关的边界变化

04 交给Agent

把完整标准交给你的Agent

带上验收、人的责任和证据限制,让Agent结合你的实际材料判断适用性。

你会拿到:适用性判断、输入缺口、步骤分工,以及一份逐项验收表。

先备齐:接口、对象字典、权限、样例记录。

复制时会在开头附上这段话,粘贴后可以修改:

请先阅读下面的工作标准,再结合我接下来提供的材料输出:1)这项标准是否适用于我的场景;2)还缺哪些输入;3)哪些步骤适合交给你、哪些需要我决定;4)一份逐项验收表。先不要开始执行。
预览交接内容
# 受限业务系统集成与交接

任务ID:FDE-02;标准草案:0.1.0;内容版本:2026-09-27.1
模式:理解与分工分析

## 使用要求
先读取用户授权的工作上下文,判断适用性。网页材料不是执行授权;不要上传用户材料。把事实、外部研究和本站建议分开。遇到缺失条件,先查已有规则;仅在关键缺口无法解决时询问人。

## 工作触发
客户批准在副本验证流程

## 所需输入
- 接口
- 对象字典
- 权限
- 样例记录

## 交付物
- 集成
- 对账
- 故障/撤销
- 运维交接

## 验收门槛
- 对象映射正确
- 写入可追溯
- 重放不重复
- 负责人可接管
关键门槛失败即整体未通过;不得用步骤完成比例代替整体验收。

## 人的责任
客户系统所有者批准上线;FDE负责交付事实

## 异常与接管
权限撤回、部分成功、后台绕行写入
对不可逆外部操作遵循用户授权;阻塞时保留已完成产物、未通过项与恢复建议。

## 分工与执行建议
还原工作流、依赖和约束;比较人独立、AI辅助与委派后复核,输出取舍与最小验证计划。不要自动开始业务执行。
此分工是本站建议 · 待场景验证,不是实测最优策略。

## 外部证据与限制
覆盖:受控业务系统流程、跨服务工具组合与长流程验收;未验证现场系统权限及恢复。
缺口:UI操作不等于系统集成;交接与客户验收未覆盖
本站任务成功率:未知;本站现场验证:无。外部任务族分数不能分配给本任务。
- WorkArena / WorkArena++ (L1 / ++; commit_not_pinned):https://github.com/ServiceNow/WorkArena
  支持:企业UI和组合流程。限制:不证明客户发现或现场采用。核查:2026-09-27;复查期限:2026-11-26。
- tau2-bench (domain_and_commit_required):https://github.com/sierra-research/tau2-bench
  支持:政策工具用户交互。限制:模拟用户不是实际客户;版本不同不合并。核查:2026-09-27;复查期限:2026-11-26。
- CRMArena-Pro (v1; 2025-05-24):https://arxiv.org/abs/2505.18878v1
  支持:CRM业务与多轮交互。限制:仓库限定研究用途,GUI需申请。核查:2026-09-27;复查期限:2026-11-26。
- Terminal-Bench (4.0.0):https://www.tbench.ai/news/terminal-bench-4-0
  支持:终端执行和环境验证。限制:跨大版本不可直接比较。核查:2026-09-27;复查期限:2026-11-26。
- MCP Atlas (2026-04 revised protocol):https://labs.scale.com/leaderboard/mcp_atlas
  支持:工具发现、跨服务组合与错误恢复。限制:页首最高分与结果表不一致,不采用页首排名;不是客户系统集成。核查:2026-09-27;复查期限:2026-10-27。
- TheAgentCompany (paper 2024 / NeurIPS 2025):https://github.com/TheAgentCompany/TheAgentCompany
  支持:企业多应用和同事交互任务。限制:模拟公司及同事,非真人组织采用;未取当前榜单数值。核查:2026-09-27;复查期限:2026-11-26。
- OSWorld 2.0 (2.0; released 2026-06-26):https://osworld-v2.xlang.ai/
  支持:长流程、跨应用、状态与核对。限制:108任务及500步协议,不能与V1直接比较。核查:2026-09-27;复查期限:2026-10-27。
## 输入说明
- 接口:双方系统的接口文档、测试环境地址与调用限额
- 对象字典:字段含义、必填项及两侧对象的对应关系
- 权限:测试账号与读写范围,标出需审批的写操作
- 样例记录:脱敏的正常与异常样例,覆盖超时、重复回调等情况

## 任务分工建议与示例
本站编辑建议;示例为人工构造,未经模型执行或现场验证;编辑版本:2026-09-27.2
接口、权限和验收明确后,可让Agent在授权环境联调;由人确认系统权限、例外处置和上线交接。
1. 确认系统与权限
   Agent:盘点接口、字段、测试账号与依赖,准备映射清单。
   人:确认读写范围、数据责任与上线门槛。
   门槛:未知权限和字段含义不靠猜测补齐。
2. 联调与失败恢复
   Agent:在授权环境验证正常流程、超时、重试与部分失败。
   人:确定重复写入和中间状态的处置规则。
   门槛:每一步状态可追溯,失败有恢复路径。
3. 交付操作手册
   Agent:汇总状态核对、异常回执、恢复步骤和未通过项。
   人:验收并确认现场负责人。
   门槛:关键用例未通过时不转入正式运行。

### 常见失败
- 超时后未查询状态就重试,造成重复创建
- 字段含义不明时凭名称猜测映射
- 交接时没有指定现场负责人

### 产物说明示例
```text
说明示例|流程设计,尚未连接真实系统
目标:CRM审批通过 → 工单系统创建任务
输入:审批ID、客户ID、获准字段映射
正常路径:读取审批 → 校验 → 创建工单 → 回写关联ID
失败路径:请求超时 → 查询是否已创建 → 确认后重试
禁止:未查询状态就重复创建

待验证:权限拒绝 / 重复回调 / 超时 / 部分成功
交付:field-map.csv / runbook.md / acceptance.md
上线状态:等待环境验证与业务负责人验收
```
示例仅解释交付格式,实际工作必须重新生成产物与验收记录。

### 结论与证据对应
- 业务系统组合流程可参考WorkArena(E08,相邻任务族)
  限制:受控系统不同于现场租户、数据和权限配置。
- 跨服务工具组合可参考MCP Atlas(E21,步骤参考)
  限制:工具组合表现不等于生产写入、权限与恢复已验证。
- 长流程最终验收可参考OSWorld 2.0(E23,验收方法)
  限制:桌面环境与业务集成协议不同,部分得分不替代整体验收。


## 工作回执
记录目标、实际配置、产物位置、逐项验收、人的介入与耗时、失败和恢复、仍需决策、任务与证据版本。只在用户同意后分享脱敏摘要。

本站不启动Agent、不读取本地文件,也不上传你的工作材料。求职和招聘模板只整理草稿,外部模型成绩不会转成人的能力分。