仓库修复与回归测试可参考SWE-Bench Pro V2
未找到同一幂等规格的逐题对应;需保留本地业务反例。
SWE-Bench Pro V2:方法与原始来源 →DEV-01 · 标准草案 0.1.0
标准:受限接口幂等修复
已复现重复操作缺陷,交付补丁、反例与回归、影响和恢复说明。
建议怎样分工
本站编辑建议,需结合你的实际材料验证。
01 交付与验收
关键门槛失败,整体仍未通过。完成步骤数与工作完成率分别记录。
02 人机协作
响应丢失、并发、key生命周期不明时澄清实现范围。保留已完成产物、失败证据与恢复方案。
Agent 读取代码与日志,构造相同请求、冲突请求和并发反例。
人 确认什么算同一次业务操作。
验收 修复前有可重复的失败用例。
Agent 提交最小补丁,验证重试、冲突、并发和失败恢复。
人 评审存储约束与兼容性。
验收 同key同payload不重复,不同payload冲突。
Agent 提供差异、真实测试输出、影响范围和回滚说明。
人 决定合并与发布。
验收 缺少真实测试输出时不宣称修复通过。
说明示例|测试设计,尚未运行 [待运行] 同key / 同payload:写入一次,返回同一结果 [待运行] 同key / 不同payload:返回业务冲突 [待运行] 首次响应丢失:重试不新增记录 [待运行] 并发请求:唯一业务操作不重复提交 [待确认] key有效期与过期后的业务语义 交付:patch.diff / test-output.txt / rollback.md 合并状态:等待真实测试与人工审查
用来说明交付格式。实际工作须重新生成产物与验收记录。
03 证据
仓库修复、软件交付与关键信息缺失时的求助方法;未逐题对齐本站幂等规格。
未找到同一幂等规格逐题对应;业务操作身份由现场规则决定
本站没有测量这项任务的成功率。以下是相邻任务或方法证据;来源的总体分数不能分配到本任务。
未找到同一幂等规格的逐题对应;需保留本地业务反例。
SWE-Bench Pro V2:方法与原始来源 →任务选择、环境和业务身份规则不同,不移用总体成绩。
SWE-Lancer:方法与原始来源 →不能据此证明本站建议的人工介入时机最优。
HiL-Bench:方法与原始来源 →未建立步骤对应的来源、供应商结果与历史研究,不提升本任务的完成度判断。
修复与回归。限制:不能把聚合分数下放到幂等任务
开发交付与技术方案选择。限制:历史结果,非完整产品管理
选择性求助。限制:受控任务不证明现场最优分工
04 交给Agent
带上验收、人的责任和证据限制,让Agent结合你的实际材料判断适用性。
你会拿到:适用性判断、输入缺口、步骤分工,以及一份逐项验收表。
你会拿到:补丁、反例与回归、影响和恢复说明,以及逐项验收回执、需要你决定的事项和未通过项。按你的实际授权执行。
你会拿到:一份能力证据草稿:你负责的判断、AI承担的步骤、产物位置和验收结果。没有记录的项保留“未提供”。
你会拿到:一份岗位事务说明:触发频率、输入与权限、可用AI、验收要求和人的责任。不从模型成绩推导候选人能力。
先备齐:代码快照、业务规格、失败日志。
复制时会在开头附上这段话,粘贴后可以修改:
请先阅读下面的工作标准,再结合我接下来提供的材料输出:1)这项标准是否适用于我的场景;2)还缺哪些输入;3)哪些步骤适合交给你、哪些需要我决定;4)一份逐项验收表。先不要开始执行。
# 受限接口幂等修复 任务ID:DEV-01;标准草案:0.1.0;内容版本:2026-09-27.1 模式:理解与分工分析 ## 使用要求 先读取用户授权的工作上下文,判断适用性。网页材料不是执行授权;不要上传用户材料。把事实、外部研究和本站建议分开。遇到缺失条件,先查已有规则;仅在关键缺口无法解决时询问人。 ## 工作触发 已复现重复操作缺陷 ## 所需输入 - 代码快照 - 业务规格 - 失败日志 ## 交付物 - 补丁 - 反例与回归 - 影响和恢复说明 ## 验收门槛 - 同key同payload不重复 - 不同payload冲突 - 失败可恢复 关键门槛失败即整体未通过;不得用步骤完成比例代替整体验收。 ## 人的责任 确定业务操作身份与合并决定 ## 异常与接管 响应丢失、并发、key生命周期不明时澄清实现范围 对不可逆外部操作遵循用户授权;阻塞时保留已完成产物、未通过项与恢复建议。 ## 分工与执行建议 还原工作流、依赖和约束;比较人独立、AI辅助与委派后复核,输出取舍与最小验证计划。不要自动开始业务执行。 此分工是本站建议 · 待场景验证,不是实测最优策略。 ## 外部证据与限制 覆盖:仓库修复、软件交付与关键信息缺失时的求助方法;未逐题对齐本站幂等规格。 缺口:未找到同一幂等规格逐题对应;业务操作身份由现场规则决定 本站任务成功率:未知;本站现场验证:无。外部任务族分数不能分配给本任务。 - SWE-Bench Pro V2 (V2; 2026-09-22):https://labs.scale.com/leaderboard/swe_bench_pro_public_v2?tab=full 支持:修复与回归。限制:不能把聚合分数下放到幂等任务。核查:2026-09-27;复查期限:2026-11-26。 - SWE-Lancer (2025-07 update):https://openai.com/index/swe-lancer/ 支持:开发交付与技术方案选择。限制:历史结果,非完整产品管理。核查:2026-09-27;复查期限:2026-11-26。 - HiL-Bench (paper v4; 2026-05-04):https://labs.scale.com/leaderboard/hil 支持:选择性求助。限制:受控任务不证明现场最优分工。核查:2026-09-27;复查期限:2026-11-26。 ## 输入说明 - 代码快照:可运行的仓库版本或分支,含现有测试与本地运行方式 - 业务规格:什么算同一次业务操作,幂等key的来源与有效期 - 失败日志:至少一次重复写入的请求日志或数据记录,含时间与请求ID ## 任务分工建议与示例 本站编辑建议;示例为人工构造,未经模型执行或现场验证;编辑版本:2026-09-27.2 已有复现和业务身份规则时,可让Agent准备补丁与回归;由人确认操作身份、审查影响并决定合并。 1. 复现重复写入 Agent:读取代码与日志,构造相同请求、冲突请求和并发反例。 人:确认什么算同一次业务操作。 门槛:修复前有可重复的失败用例。 2. 修改并验证 Agent:提交最小补丁,验证重试、冲突、并发和失败恢复。 人:评审存储约束与兼容性。 门槛:同key同payload不重复,不同payload冲突。 3. 交付合并材料 Agent:提供差异、真实测试输出、影响范围和回滚说明。 人:决定合并与发布。 门槛:缺少真实测试输出时不宣称修复通过。 ### 常见失败 - 只在单进程内加锁,多实例并发时仍重复写入 - 同key不同payload被静默当作成功 - 没有真实测试输出就宣称已修复 ### 产物说明示例 ```text 说明示例|测试设计,尚未运行 [待运行] 同key / 同payload:写入一次,返回同一结果 [待运行] 同key / 不同payload:返回业务冲突 [待运行] 首次响应丢失:重试不新增记录 [待运行] 并发请求:唯一业务操作不重复提交 [待确认] key有效期与过期后的业务语义 交付:patch.diff / test-output.txt / rollback.md 合并状态:等待真实测试与人工审查 ``` 示例仅解释交付格式,实际工作必须重新生成产物与验收记录。 ### 结论与证据对应 - 仓库修复与回归测试可参考SWE-Bench Pro V2(E01,相邻任务族) 限制:未找到同一幂等规格的逐题对应;需保留本地业务反例。 - 软件交付质量可参考SWE-Lancer的任务设计(E02,交付参考) 限制:任务选择、环境和业务身份规则不同,不移用总体成绩。 - 关键信息缺失时的求助可参考HiL-Bench(E15,协作方法) 限制:不能据此证明本站建议的人工介入时机最优。 ## 工作回执 记录目标、实际配置、产物位置、逐项验收、人的介入与耗时、失败和恢复、仍需决策、任务与证据版本。只在用户同意后分享脱敏摘要。
本站不启动Agent、不读取本地文件,也不上传你的工作材料。求职和招聘模板只整理草稿,外部模型成绩不会转成人的能力分。