{"version":"2026-09-27.2","status":"本站编辑建议；示例为人工构造，未经模型执行或现场验证","examples":{"DATA-01":{"name":"核对订单收入，找出差异","decision":"口径确认后，可让Agent准备查询、逐单计算与差异清单；由人确认异常与最终账目。","steps":[{"title":"确定净额口径","agent":"读取订单、退款字段与既有规则，列出时间窗和状态筛选。","human":"确认退款归属期、币种和净额定义。","gate":"所有字段、状态和时间窗都有出处。"},{"title":"计算并定位差异","agent":"在获准的数据副本上生成SQL、逐单对账，保留明细。","human":"解释跨期退款、漏单和业务例外。","gate":"能从差异追溯到原订单与退款记录。"},{"title":"提交验收回执","agent":"记录通过项、未通过项及可复查的计算过程。","human":"复核异常清单，决定是否接受结果。","gate":"关键差异未解决时，整体状态保持未通过。"}],"artifactTitle":"差异清单与验收回执","artifact":"说明示例｜人工构造，非真实数据或AI运行结果\n口径：同一期间、同一币种，净额 = 实付 - 已完成退款\n订单   实付   退款   应计净额   账面净额   差异\nA001   100    20     80         80         0\nA002   200    50     150        200        -50\n合计   300    70     230        280        -50\n\n验收回执：未通过\n已核对：逐单金额加总一致\n待处理：A002退款未入账，需人确认退款归属期\n交付：query.sql / reconciliation.csv / exceptions.md","claims":[{"claim":"多源业务数据分析可参考DABstep的任务与验收方法","source":"E06","relation":"相邻任务族","limit":"没有本订单数据、退款规则与逐题结果；不推导对账成功率。"},{"claim":"SQL生成和企业查询流程可参考Spider 2.0","source":"E07","relation":"步骤参考","limit":"正确SQL不等于账目口径正确，也不证明全部差异已经解释。"},{"claim":"工作簿交付可参考SpreadsheetBench 2","source":"E20","relation":"产物参考","limit":"表格任务成绩不能替代财务口径、来源完整性和最终对账验收。"}],"coverage":"多源业务数据分析、企业SQL流程与工作簿交付；分别参考DABstep、Spider 2.0和SpreadsheetBench 2。","inputDetails":[{"name":"订单","detail":"订单明细导出或只读数据副本，含订单ID、状态、下单时间与币种"},{"name":"付款","detail":"支付流水，含实付金额、支付时间与对应订单ID"},{"name":"退款","detail":"退款记录，含退款状态、完成时间与原订单ID"},{"name":"商品","detail":"商品或SKU表，用于区分计入收入的商品类型"},{"name":"口径及截止日","detail":"书面的净额定义、退款归属期规则与统计截止日"}],"failures":["把未完成的退款计入净额","一单多次付款导致重复计数","只给出总差异，无法追溯到具体订单"]},"DEV-01":{"name":"修复重复提交导致的重复写入","decision":"已有复现和业务身份规则时，可让Agent准备补丁与回归；由人确认操作身份、审查影响并决定合并。","steps":[{"title":"复现重复写入","agent":"读取代码与日志，构造相同请求、冲突请求和并发反例。","human":"确认什么算同一次业务操作。","gate":"修复前有可重复的失败用例。"},{"title":"修改并验证","agent":"提交最小补丁，验证重试、冲突、并发和失败恢复。","human":"评审存储约束与兼容性。","gate":"同key同payload不重复，不同payload冲突。"},{"title":"交付合并材料","agent":"提供差异、真实测试输出、影响范围和回滚说明。","human":"决定合并与发布。","gate":"缺少真实测试输出时不宣称修复通过。"}],"artifactTitle":"回归用例与交付清单","artifact":"说明示例｜测试设计，尚未运行\n[待运行] 同key / 同payload：写入一次，返回同一结果\n[待运行] 同key / 不同payload：返回业务冲突\n[待运行] 首次响应丢失：重试不新增记录\n[待运行] 并发请求：唯一业务操作不重复提交\n[待确认] key有效期与过期后的业务语义\n\n交付：patch.diff / test-output.txt / rollback.md\n合并状态：等待真实测试与人工审查","claims":[{"claim":"仓库修复与回归测试可参考SWE-Bench Pro V2","source":"E01","relation":"相邻任务族","limit":"未找到同一幂等规格的逐题对应；需保留本地业务反例。"},{"claim":"软件交付质量可参考SWE-Lancer的任务设计","source":"E02","relation":"交付参考","limit":"任务选择、环境和业务身份规则不同，不移用总体成绩。"},{"claim":"关键信息缺失时的求助可参考HiL-Bench","source":"E15","relation":"协作方法","limit":"不能据此证明本站建议的人工介入时机最优。"}],"coverage":"仓库修复、软件交付与关键信息缺失时的求助方法；未逐题对齐本站幂等规格。","inputDetails":[{"name":"代码快照","detail":"可运行的仓库版本或分支，含现有测试与本地运行方式"},{"name":"业务规格","detail":"什么算同一次业务操作，幂等key的来源与有效期"},{"name":"失败日志","detail":"至少一次重复写入的请求日志或数据记录，含时间与请求ID"}],"failures":["只在单进程内加锁，多实例并发时仍重复写入","同key不同payload被静默当作成功","没有真实测试输出就宣称已修复"]},"FDE-02":{"name":"连接业务系统，交付可恢复的流程","decision":"接口、权限和验收明确后，可让Agent在授权环境联调；由人确认系统权限、例外处置和上线交接。","steps":[{"title":"确认系统与权限","agent":"盘点接口、字段、测试账号与依赖，准备映射清单。","human":"确认读写范围、数据责任与上线门槛。","gate":"未知权限和字段含义不靠猜测补齐。"},{"title":"联调与失败恢复","agent":"在授权环境验证正常流程、超时、重试与部分失败。","human":"确定重复写入和中间状态的处置规则。","gate":"每一步状态可追溯，失败有恢复路径。"},{"title":"交付操作手册","agent":"汇总状态核对、异常回执、恢复步骤和未通过项。","human":"验收并确认现场负责人。","gate":"关键用例未通过时不转入正式运行。"}],"artifactTitle":"联调交接回执","artifact":"说明示例｜流程设计，尚未连接真实系统\n目标：CRM审批通过 → 工单系统创建任务\n输入：审批ID、客户ID、获准字段映射\n正常路径：读取审批 → 校验 → 创建工单 → 回写关联ID\n失败路径：请求超时 → 查询是否已创建 → 确认后重试\n禁止：未查询状态就重复创建\n\n待验证：权限拒绝 / 重复回调 / 超时 / 部分成功\n交付：field-map.csv / runbook.md / acceptance.md\n上线状态：等待环境验证与业务负责人验收","claims":[{"claim":"业务系统组合流程可参考WorkArena","source":"E08","relation":"相邻任务族","limit":"受控系统不同于现场租户、数据和权限配置。"},{"claim":"跨服务工具组合可参考MCP Atlas","source":"E21","relation":"步骤参考","limit":"工具组合表现不等于生产写入、权限与恢复已验证。"},{"claim":"长流程最终验收可参考OSWorld 2.0","source":"E23","relation":"验收方法","limit":"桌面环境与业务集成协议不同，部分得分不替代整体验收。"}],"coverage":"受控业务系统流程、跨服务工具组合与长流程验收；未验证现场系统权限及恢复。","inputDetails":[{"name":"接口","detail":"双方系统的接口文档、测试环境地址与调用限额"},{"name":"对象字典","detail":"字段含义、必填项及两侧对象的对应关系"},{"name":"权限","detail":"测试账号与读写范围，标出需审批的写操作"},{"name":"样例记录","detail":"脱敏的正常与异常样例，覆盖超时、重复回调等情况"}],"failures":["超时后未查询状态就重试，造成重复创建","字段含义不明时凭名称猜测映射","交接时没有指定现场负责人"]},"PM-02":{"name":"设计AI失败时可恢复、可接管的交互","decision":"失败案例和权限边界明确后，可让Agent起草失败处理规格、原型说明和验收用例；由人设定用户控制方式、不可逆动作的授权和升级接收人。","inputDetails":[{"name":"任务","detail":"目标任务清单，至少5个真实场景，标明频率与出错代价"},{"name":"用户","detail":"涉及的用户角色及各自能做的决定，如客户、客服、审批人"},{"name":"权限","detail":"权限矩阵：可读、可写、需审批、禁止，单独标出不可逆动作"},{"name":"失败案例","detail":"至少3个已发生或已知的失败，附原始记录与期望处理方式"}],"steps":[{"title":"整理失败与权限清单","agent":"从工单、日志和访谈记录中归类失败类型，标出每类涉及的动作能否撤销。","human":"确认哪些动作不可逆、哪些必须审批。","gate":"每类失败都有来源案例；不可逆动作单独列出。"},{"title":"起草纠错、撤销与升级交互","agent":"为每类失败写明用户如何发现、如何纠正或撤销、何时升级给谁，并给出原型或线框说明。","human":"设定默认自动化范围，确认文案不夸大AI能力。","gate":"每个不可逆动作都有确认或撤销路径；每类失败都有可见提示。"},{"title":"用失败用例走查验收","agent":"逐条编写验收用例，按原型走查并记录未通过项。","human":"组织用户或业务方走查，确认升级接收人。","gate":"每类失败至少有一条用例证明用户能发现并接管；升级有明确接收人。"}],"failures":["只设计成功路径，失败时用户看不到AI做了什么","升级做成循环提示，没有明确接收人","为了流畅把不可逆动作放进默认自动化"],"artifactTitle":"失败处理规格与验收用例","artifact":"说明示例｜人工构造，非真实产品或AI运行结果\n场景：AI助手替客户修改订单收货地址\n失败类型 | 用户如何发现 | 纠正或撤销 | 升级\n地址解析错误 | 确认页高亮差异字段 | 提交前可编辑 | 无需升级\n订单已发货 | 提示“已发货，无法修改” | 不执行，给出替代路径 | 转人工客服\n权限不足 | 明示缺少哪项授权 | 不执行 | 通知订单负责人\n\n不可逆动作：取消已支付订单 → 默认不自动化，需用户二次确认\n验收用例：3条已编写，待走查\n交付：prototype.md / failure-spec.md / acceptance-cases.md","claims":[{"claim":"Agent何时停下求助，可参考HiL-Bench的选择性求助设计","source":"E15","relation":"协作方法","limit":"受控任务的求助时机不证明本产品的最优接管点；接管规则仍需用户走查。"},{"claim":"政策约束下与用户多轮交互的失败场景，可参考tau2-bench","source":"E09","relation":"失败场景参考","limit":"模拟用户不是实际客户；该评测不测规格编写能力。"}],"coverage":"选择性求助与政策约束下的用户交互失败场景；未覆盖规格编写本身和真实用户走查。"},"GROW-01":{"name":"按人群制作有事实依据的内容","decision":"产品事实和可用来源确定后，可让Agent按人群起草内容并逐条建立主张台账；由人核对产品事实、删改无法证实的主张并承担发布责任。","inputDetails":[{"name":"产品事实","detail":"当前版本的功能、限制、价格与型号，附文档版本号"},{"name":"研究/案例","detail":"可引用的研究与已获授权的客户案例，注明日期与适用条件"},{"name":"目标受众","detail":"每个人群的角色、要解决的问题与决策顾虑，至少2个人群"}],"steps":[{"title":"建立主张台账","agent":"从产品文档、公开研究和已授权案例中摘出可用事实，逐条记录来源、日期与适用条件。","human":"确认产品事实与可公开的客户案例。","gate":"每条主张都有来源；无来源的内容不进入草稿。"},{"title":"按人群起草","agent":"针对每个人群的问题选取主张写出草稿，每句标注对应的台账编号。","human":"判断人群定位与品牌口径。","gate":"实际结果与预测分开表述；没有虚构的用户经历或数字。"},{"title":"发布前核对","agent":"逐句核对台账，列出过期来源、口径冲突和需删改的主张。","human":"决定删改并签发。","gate":"来源失效或口径冲突的主张已删除或改写；签发人明确。"}],"failures":["为了说服力补写没有来源的数字或用户故事","把内部预测写成已实现的结果","来源已更新，草稿仍沿用旧口径"],"artifactTitle":"主张台账与草稿标注","artifact":"说明示例｜人工构造，非真实产品、客户或AI运行结果\n编号 | 主张 | 类型 | 来源 | 状态\nC1 | 支持从CSV导入历史订单 | 产品事实 | 产品文档 v3.2 | 已确认\nC2 | 试点客户对账耗时减少 | 客户实绩 | 案例未获授权 | 从草稿删除\nC3 | 可覆盖多数常规查询 | 预测 | 内部估算 | 改写为目标并注明假设\n\n草稿（面向财务负责人）：……支持直接导入历史订单[C1]……\n核对结果：删除1条，改写1条，待签发\n交付：draft.md / claims.csv / sources.md","claims":[{"claim":"专业交付物的质量验收方式，可参考GDPval","source":"E04","relation":"产物参考","limit":"一次性专业产物比较，不证明分群内容的事实全部正确，也不证明带来转化。"},{"claim":"完整项目交付物，可参考Remote Labor Index","source":"E05","relation":"相邻任务族","limit":"该评测排除直接客户互动与长期效果，不能推导内容的传播或转化结果。"}],"coverage":"专业产物验收与完整项目交付；营销产物仅有供应商自测，作为背景放在补充资料。未覆盖分群效果与事实核对准确率。"}},"domains":[{"id":"sales","label":"销售","scenario":"查看CRM更新与客户跟进类公开任务","tasks":["FDE-02","FDE-01"],"mapping":"本站以企业交付方向组织系统集成与流程发现；尚无销售专属标准。","aliases":["销售","CRM","客户跟进","商机"]},{"id":"marketing","label":"营销","scenario":"查看营销内容与活动操作类公开任务","tasks":["GROW-01","GROW-02"],"mapping":"关联内容与增长方向，任务条件仍需逐项对照。","aliases":["营销","市场","广告","投放"]},{"id":"operations","label":"运营","scenario":"查看跨系统业务操作类公开任务","tasks":["FDE-02","DATA-02"],"mapping":"关联流程集成与指标契约，不能代表全部运营工作。","aliases":["运营","流程","后台"]},{"id":"support","label":"客服","scenario":"查看客户支持与工单类公开任务","tasks":["DEV-03","FDE-02"],"mapping":"关联知识检索与业务系统操作；尚无客服专属标准。","aliases":["客服","工单","客户支持","FAQ"]},{"id":"finance","label":"财务","scenario":"查看财务业务操作类公开任务","tasks":["DATA-01"],"mapping":"关联订单对账；本站示例没有被该基准逐题测量。","aliases":["财务","对账","账务","收入"]},{"id":"hr","label":"人力资源","scenario":"查看人力资源流程类公开任务","tasks":[],"mapping":"当前任务库尚无人力资源专属标准，可先查官方公开样例与评分方式。","aliases":["人力","HR","招聘","入职","人事"]}],"changeActions":{"C02":"使用数据分析证据时，先核对榜单验证状态；继续按本地业务门槛验收，不因榜单维护状态改变委派范围。","C05":"将营销供应商自测作为补充线索；验收标准不因自报分数而降低。等待可访问的任务和运行记录再评估支持力度。","C01":"在软件回执中记录V2与运行协议；与旧版比较前先检查任务集合和配置。","C03":"系统交接增加跨应用状态核对、部分失败与恢复检查；这是方法建议，不是现场成功率提升。","C04":"Agent失败后保留轨迹与根因判断，分别验收诊断是否正确、修复是否有效。"},"changeTypes":{"C01":"资料维护","C02":"资料维护","C05":"资料维护","C03":"工作建议变化","C04":"工作建议变化"},"taskNames":{"DEV-01":"修复重复提交导致的重复写入","DEV-02":"核对业务写入与事件通知是否一致","DEV-03":"按版本和权限检索知识、回答问题","DEV-04":"评测工具Agent，定位失败与回归","PM-01":"判断一个业务问题是否值得用AI解决","PM-02":"设计AI失败时可恢复、可接管的交互","PM-03":"判断新模型版本是否可以发布","PM-04":"判断AI功能实验是否带来业务收益","FDE-01":"梳理客户流程，确定试点与验收","FDE-02":"连接业务系统，交付可恢复的流程","FDE-03":"用设备知识辅助维护判断","FDE-04":"判断现场流程能否采用并完成交接","DATA-01":"核对订单收入，找出差异","DATA-02":"统一不同工具中的指标口径","DATA-03":"解释转化率变化，拆分人群组成影响","DATA-04":"审核实验是否有效、区间是否可靠","GROW-01":"按人群制作有事实依据的内容","GROW-02":"让内容适配渠道和商业属性","GROW-03":"设计不同人群的激活实验","GROW-04":"核算增长增量和扣除成本后的收益"},"searchTerms":{"DEV-01":["幂等","重复下单","接口","bug","修复"],"DEV-02":["事件","消息队列","一致性","outbox"],"DEV-03":["RAG","知识库","检索","问答","客服"],"DEV-04":["评测","eval","回归","Agent测试"],"PM-01":["需求","立项","机会评估","用户访谈"],"PM-02":["交互设计","原型","失败处理","撤销","人工接管"],"PM-03":["模型升级","上线","发布","灰度","回滚"],"PM-04":["A/B测试","实验","商业化","ROI"],"FDE-01":["客户需求","售前","POC","试点","销售"],"FDE-02":["集成","CRM","工单","自动化流程","API"],"FDE-03":["设备","维修","运维知识"],"FDE-04":["交付验收","上线交接","采用"],"DATA-01":["财务","对账","收入","SQL","报表"],"DATA-02":["指标","口径","埋点","BI"],"DATA-03":["转化率","归因","分群"],"DATA-04":["A/B测试","置信区间","实验评估"],"GROW-01":["营销","文案","内容","分群"],"GROW-02":["SEO","渠道","投放素材","电商"],"GROW-03":["激活","留存","用户运营"],"GROW-04":["广告","ROI","增量","预算"]},"handoffPrompts":{"understand":"请先阅读下面的工作标准，再结合我接下来提供的材料输出：1）这项标准是否适用于我的场景；2）还缺哪些输入；3）哪些步骤适合交给你、哪些需要我决定；4）一份逐项验收表。先不要开始执行。","execute":"请按下面的工作标准，在我已授权的范围内准备执行：先列出你要执行的步骤和需要的权限，等我确认后再开始；每完成一步按验收门槛自检，如实报告未通过项。不可逆操作必须先问我。","candidate":"请用下面的求职能力证据模板，从我提供的真实工作记录中整理这项工作的能力证据。没有记录的项写“未提供”，不要补写或美化。","employer":"请用下面的招聘事务模板，把我们团队的这项实际工作整理成岗位要求：触发频率、输入与权限、可用AI、验收要求和人的责任。缺失项写“未提供”。"}}