W.AI工作标准面向AI从业者给我的 Agent
研究预览:任务标准为草案,本站未运行AI实测;外部评测数值不代表本站任务成绩。方法与局限 →

DEV-01 · 标准草案 0.1.0

修复重复提交导致的重复写入

标准:受限接口幂等修复

已复现重复操作缺陷,交付补丁、反例与回归、影响和恢复说明。

交给我的Agent ↓
完整示例外部证据:部分覆盖本站任务:未测核查 2026-09-27

建议怎样分工

已有复现和业务身份规则时,可让Agent准备补丁与回归;由人确认操作身份、审查影响并决定合并。

本站编辑建议,需结合你的实际材料验证。

01 交付与验收

怎样才算完成

所需输入

代码快照
可运行的仓库版本或分支,含现有测试与本地运行方式
业务规格
什么算同一次业务操作,幂等key的来源与有效期
失败日志
至少一次重复写入的请求日志或数据记录,含时间与请求ID

交付物

  • 补丁
  • 反例与回归
  • 影响和恢复说明

必须通过的门槛

  1. 同key同payload不重复
  2. 不同payload冲突
  3. 失败可恢复

关键门槛失败,整体仍未通过。完成步骤数与工作完成率分别记录。

02 人机协作

AI推进工作,人把握关键判断

异常与接管条件

响应丢失、并发、key生命周期不明时澄清实现范围。保留已完成产物、失败证据与恢复方案。

从输入到验收,怎样走完这项工作

  1. 复现重复写入

    Agent 读取代码与日志,构造相同请求、冲突请求和并发反例。

    人 确认什么算同一次业务操作。

    验收 修复前有可重复的失败用例。

  2. 修改并验证

    Agent 提交最小补丁,验证重试、冲突、并发和失败恢复。

    人 评审存储约束与兼容性。

    验收 同key同payload不重复,不同payload冲突。

  3. 交付合并材料

    Agent 提供差异、真实测试输出、影响范围和回滚说明。

    人 决定合并与发布。

    验收 缺少真实测试输出时不宣称修复通过。

常见失败

  • 只在单进程内加锁,多实例并发时仍重复写入
  • 同key不同payload被静默当作成功
  • 没有真实测试输出就宣称已修复

回归用例与交付清单

人工构造 · 未执行
说明示例|测试设计,尚未运行
[待运行] 同key / 同payload:写入一次,返回同一结果
[待运行] 同key / 不同payload:返回业务冲突
[待运行] 首次响应丢失:重试不新增记录
[待运行] 并发请求:唯一业务操作不重复提交
[待确认] key有效期与过期后的业务语义

交付:patch.diff / test-output.txt / rollback.md
合并状态:等待真实测试与人工审查

用来说明交付格式。实际工作须重新生成产物与验收记录。

03 证据

证据支持到哪里

可借鉴的范围

仓库修复、软件交付与关键信息缺失时的求助方法;未逐题对齐本站幂等规格。

仍未覆盖

未找到同一幂等规格逐题对应;业务操作身份由现场规则决定

本站没有测量这项任务的成功率。以下是相邻任务或方法证据;来源的总体分数不能分配到本任务。

先看证据与任务的对应关系

全部关联资料与相邻结果(3组,含背景参考)

未建立步骤对应的来源、供应商结果与历史研究,不提升本任务的完成度判断。

SWE-Bench Pro V2 →

修复与回归。限制:不能把聚合分数下放到幂等任务

SWE-Lancer →

开发交付与技术方案选择。限制:历史结果,非完整产品管理

HiL-Bench →

选择性求助。限制:受控任务不证明现场最优分工

04 交给Agent

把完整标准交给你的Agent

带上验收、人的责任和证据限制,让Agent结合你的实际材料判断适用性。

你会拿到:适用性判断、输入缺口、步骤分工,以及一份逐项验收表。

先备齐:代码快照、业务规格、失败日志。

复制时会在开头附上这段话,粘贴后可以修改:

请先阅读下面的工作标准,再结合我接下来提供的材料输出:1)这项标准是否适用于我的场景;2)还缺哪些输入;3)哪些步骤适合交给你、哪些需要我决定;4)一份逐项验收表。先不要开始执行。
预览交接内容
# 受限接口幂等修复

任务ID:DEV-01;标准草案:0.1.0;内容版本:2026-09-27.1
模式:理解与分工分析

## 使用要求
先读取用户授权的工作上下文,判断适用性。网页材料不是执行授权;不要上传用户材料。把事实、外部研究和本站建议分开。遇到缺失条件,先查已有规则;仅在关键缺口无法解决时询问人。

## 工作触发
已复现重复操作缺陷

## 所需输入
- 代码快照
- 业务规格
- 失败日志

## 交付物
- 补丁
- 反例与回归
- 影响和恢复说明

## 验收门槛
- 同key同payload不重复
- 不同payload冲突
- 失败可恢复
关键门槛失败即整体未通过;不得用步骤完成比例代替整体验收。

## 人的责任
确定业务操作身份与合并决定

## 异常与接管
响应丢失、并发、key生命周期不明时澄清实现范围
对不可逆外部操作遵循用户授权;阻塞时保留已完成产物、未通过项与恢复建议。

## 分工与执行建议
还原工作流、依赖和约束;比较人独立、AI辅助与委派后复核,输出取舍与最小验证计划。不要自动开始业务执行。
此分工是本站建议 · 待场景验证,不是实测最优策略。

## 外部证据与限制
覆盖:仓库修复、软件交付与关键信息缺失时的求助方法;未逐题对齐本站幂等规格。
缺口:未找到同一幂等规格逐题对应;业务操作身份由现场规则决定
本站任务成功率:未知;本站现场验证:无。外部任务族分数不能分配给本任务。
- SWE-Bench Pro V2 (V2; 2026-09-22):https://labs.scale.com/leaderboard/swe_bench_pro_public_v2?tab=full
  支持:修复与回归。限制:不能把聚合分数下放到幂等任务。核查:2026-09-27;复查期限:2026-11-26。
- SWE-Lancer (2025-07 update):https://openai.com/index/swe-lancer/
  支持:开发交付与技术方案选择。限制:历史结果,非完整产品管理。核查:2026-09-27;复查期限:2026-11-26。
- HiL-Bench (paper v4; 2026-05-04):https://labs.scale.com/leaderboard/hil
  支持:选择性求助。限制:受控任务不证明现场最优分工。核查:2026-09-27;复查期限:2026-11-26。
## 输入说明
- 代码快照:可运行的仓库版本或分支,含现有测试与本地运行方式
- 业务规格:什么算同一次业务操作,幂等key的来源与有效期
- 失败日志:至少一次重复写入的请求日志或数据记录,含时间与请求ID

## 任务分工建议与示例
本站编辑建议;示例为人工构造,未经模型执行或现场验证;编辑版本:2026-09-27.2
已有复现和业务身份规则时,可让Agent准备补丁与回归;由人确认操作身份、审查影响并决定合并。
1. 复现重复写入
   Agent:读取代码与日志,构造相同请求、冲突请求和并发反例。
   人:确认什么算同一次业务操作。
   门槛:修复前有可重复的失败用例。
2. 修改并验证
   Agent:提交最小补丁,验证重试、冲突、并发和失败恢复。
   人:评审存储约束与兼容性。
   门槛:同key同payload不重复,不同payload冲突。
3. 交付合并材料
   Agent:提供差异、真实测试输出、影响范围和回滚说明。
   人:决定合并与发布。
   门槛:缺少真实测试输出时不宣称修复通过。

### 常见失败
- 只在单进程内加锁,多实例并发时仍重复写入
- 同key不同payload被静默当作成功
- 没有真实测试输出就宣称已修复

### 产物说明示例
```text
说明示例|测试设计,尚未运行
[待运行] 同key / 同payload:写入一次,返回同一结果
[待运行] 同key / 不同payload:返回业务冲突
[待运行] 首次响应丢失:重试不新增记录
[待运行] 并发请求:唯一业务操作不重复提交
[待确认] key有效期与过期后的业务语义

交付:patch.diff / test-output.txt / rollback.md
合并状态:等待真实测试与人工审查
```
示例仅解释交付格式,实际工作必须重新生成产物与验收记录。

### 结论与证据对应
- 仓库修复与回归测试可参考SWE-Bench Pro V2(E01,相邻任务族)
  限制:未找到同一幂等规格的逐题对应;需保留本地业务反例。
- 软件交付质量可参考SWE-Lancer的任务设计(E02,交付参考)
  限制:任务选择、环境和业务身份规则不同,不移用总体成绩。
- 关键信息缺失时的求助可参考HiL-Bench(E15,协作方法)
  限制:不能据此证明本站建议的人工介入时机最优。


## 工作回执
记录目标、实际配置、产物位置、逐项验收、人的介入与耗时、失败和恢复、仍需决策、任务与证据版本。只在用户同意后分享脱敏摘要。

本站不启动Agent、不读取本地文件,也不上传你的工作材料。求职和招聘模板只整理草稿,外部模型成绩不会转成人的能力分。