专业交付物的质量验收方式,可参考GDPval
一次性专业产物比较,不证明分群内容的事实全部正确,也不证明带来转化。
GDPval:方法与原始来源 →GROW-01 · 标准草案 0.1.0
标准:证据驱动的分群内容
计划向某受众说明产品价值,交付内容草稿、主张台账、来源与限制。
建议怎样分工
本站编辑建议,需结合你的实际材料验证。
01 交付与验收
关键门槛失败,整体仍未通过。完成步骤数与工作完成率分别记录。
02 人机协作
来源失效或口径冲突需删减主张。保留已完成产物、失败证据与恢复方案。
Agent 从产品文档、公开研究和已授权案例中摘出可用事实,逐条记录来源、日期与适用条件。
人 确认产品事实与可公开的客户案例。
验收 每条主张都有来源;无来源的内容不进入草稿。
Agent 针对每个人群的问题选取主张写出草稿,每句标注对应的台账编号。
人 判断人群定位与品牌口径。
验收 实际结果与预测分开表述;没有虚构的用户经历或数字。
Agent 逐句核对台账,列出过期来源、口径冲突和需删改的主张。
人 决定删改并签发。
验收 来源失效或口径冲突的主张已删除或改写;签发人明确。
说明示例|人工构造,非真实产品、客户或AI运行结果 编号 | 主张 | 类型 | 来源 | 状态 C1 | 支持从CSV导入历史订单 | 产品事实 | 产品文档 v3.2 | 已确认 C2 | 试点客户对账耗时减少 | 客户实绩 | 案例未获授权 | 从草稿删除 C3 | 可覆盖多数常规查询 | 预测 | 内部估算 | 改写为目标并注明假设 草稿(面向财务负责人):……支持直接导入历史订单[C1]…… 核对结果:删除1条,改写1条,待签发 交付:draft.md / claims.csv / sources.md
用来说明交付格式。实际工作须重新生成产物与验收记录。
03 证据
专业产物验收与完整项目交付;营销产物仅有供应商自测,作为背景放在补充资料。未覆盖分群效果与事实核对准确率。
分群增量与事实全部正确不能由总分推断
本站没有测量这项任务的成功率。以下是相邻任务或方法证据;来源的总体分数不能分配到本任务。
一次性专业产物比较,不证明分群内容的事实全部正确,也不证明带来转化。
GDPval:方法与原始来源 →该评测排除直接客户互动与长期效果,不能推导内容的传播或转化结果。
Remote Labor Index:方法与原始来源 →未建立步骤对应的来源、供应商结果与历史研究,不提升本任务的完成度判断。
营销产物与分析任务。限制:单次尝试,自测,judge与holdout限制
相邻结果:14 / 20(任务通过),Magister + Gemini 3.8 Flash high effort · 供应商自测 · Marketing Benchmark · 页面2026-09-04运行。官网自报;质量分94.5与整题通过不同。仓库访问404,尚未独立核实运行资产。 核查配置与日期 →
专业产物验收。限制:一次性交付,不能全岗外推
完整项目产物。限制:排除直接客户互动和长期效果
04 交给Agent
带上验收、人的责任和证据限制,让Agent结合你的实际材料判断适用性。
你会拿到:适用性判断、输入缺口、步骤分工,以及一份逐项验收表。
你会拿到:内容草稿、主张台账、来源与限制,以及逐项验收回执、需要你决定的事项和未通过项。按你的实际授权执行。
你会拿到:一份能力证据草稿:你负责的判断、AI承担的步骤、产物位置和验收结果。没有记录的项保留“未提供”。
你会拿到:一份岗位事务说明:触发频率、输入与权限、可用AI、验收要求和人的责任。不从模型成绩推导候选人能力。
先备齐:产品事实、研究/案例、目标受众。
复制时会在开头附上这段话,粘贴后可以修改:
请先阅读下面的工作标准,再结合我接下来提供的材料输出:1)这项标准是否适用于我的场景;2)还缺哪些输入;3)哪些步骤适合交给你、哪些需要我决定;4)一份逐项验收表。先不要开始执行。
# 证据驱动的分群内容 任务ID:GROW-01;标准草案:0.1.0;内容版本:2026-09-27.1 模式:理解与分工分析 ## 使用要求 先读取用户授权的工作上下文,判断适用性。网页材料不是执行授权;不要上传用户材料。把事实、外部研究和本站建议分开。遇到缺失条件,先查已有规则;仅在关键缺口无法解决时询问人。 ## 工作触发 计划向某受众说明产品价值 ## 所需输入 - 产品事实 - 研究/案例 - 目标受众 ## 交付物 - 内容草稿 - 主张台账 - 来源与限制 ## 验收门槛 - 事实可追溯 - 实绩/预测分离 - 无虚构经历 关键门槛失败即整体未通过;不得用步骤完成比例代替整体验收。 ## 人的责任 保证产品事实和发布责任 ## 异常与接管 来源失效或口径冲突需删减主张 对不可逆外部操作遵循用户授权;阻塞时保留已完成产物、未通过项与恢复建议。 ## 分工与执行建议 还原工作流、依赖和约束;比较人独立、AI辅助与委派后复核,输出取舍与最小验证计划。不要自动开始业务执行。 此分工是本站建议 · 待场景验证,不是实测最优策略。 ## 外部证据与限制 覆盖:专业产物验收与完整项目交付;营销产物仅有供应商自测,作为背景放在补充资料。未覆盖分群效果与事实核对准确率。 缺口:分群增量与事实全部正确不能由总分推断 本站任务成功率:未知;本站现场验证:无。外部任务族分数不能分配给本任务。 - Marketing Benchmark (site run dated 2026-09-04):https://marketingbenchmark.ai/ 支持:营销产物与分析任务。限制:单次尝试,自测,judge与holdout限制。核查:2026-09-27;复查期限:2026-10-27。 - GDPval (2025-09-25 introduction):https://openai.com/index/gdpval/ 支持:专业产物验收。限制:一次性交付,不能全岗外推。核查:2026-09-27;复查期限:2026-11-26。 - Remote Labor Index (live_page_checked_2026-09-27):https://labs.scale.com/leaderboard/rli 支持:完整项目产物。限制:排除直接客户互动和长期效果。核查:2026-09-27;复查期限:2026-10-27。 ## 输入说明 - 产品事实:当前版本的功能、限制、价格与型号,附文档版本号 - 研究/案例:可引用的研究与已获授权的客户案例,注明日期与适用条件 - 目标受众:每个人群的角色、要解决的问题与决策顾虑,至少2个人群 ## 任务分工建议与示例 本站编辑建议;示例为人工构造,未经模型执行或现场验证;编辑版本:2026-09-27.2 产品事实和可用来源确定后,可让Agent按人群起草内容并逐条建立主张台账;由人核对产品事实、删改无法证实的主张并承担发布责任。 1. 建立主张台账 Agent:从产品文档、公开研究和已授权案例中摘出可用事实,逐条记录来源、日期与适用条件。 人:确认产品事实与可公开的客户案例。 门槛:每条主张都有来源;无来源的内容不进入草稿。 2. 按人群起草 Agent:针对每个人群的问题选取主张写出草稿,每句标注对应的台账编号。 人:判断人群定位与品牌口径。 门槛:实际结果与预测分开表述;没有虚构的用户经历或数字。 3. 发布前核对 Agent:逐句核对台账,列出过期来源、口径冲突和需删改的主张。 人:决定删改并签发。 门槛:来源失效或口径冲突的主张已删除或改写;签发人明确。 ### 常见失败 - 为了说服力补写没有来源的数字或用户故事 - 把内部预测写成已实现的结果 - 来源已更新,草稿仍沿用旧口径 ### 产物说明示例 ```text 说明示例|人工构造,非真实产品、客户或AI运行结果 编号 | 主张 | 类型 | 来源 | 状态 C1 | 支持从CSV导入历史订单 | 产品事实 | 产品文档 v3.2 | 已确认 C2 | 试点客户对账耗时减少 | 客户实绩 | 案例未获授权 | 从草稿删除 C3 | 可覆盖多数常规查询 | 预测 | 内部估算 | 改写为目标并注明假设 草稿(面向财务负责人):……支持直接导入历史订单[C1]…… 核对结果:删除1条,改写1条,待签发 交付:draft.md / claims.csv / sources.md ``` 示例仅解释交付格式,实际工作必须重新生成产物与验收记录。 ### 结论与证据对应 - 专业交付物的质量验收方式,可参考GDPval(E04,产物参考) 限制:一次性专业产物比较,不证明分群内容的事实全部正确,也不证明带来转化。 - 完整项目交付物,可参考Remote Labor Index(E05,相邻任务族) 限制:该评测排除直接客户互动与长期效果,不能推导内容的传播或转化结果。 ## 工作回执 记录目标、实际配置、产物位置、逐项验收、人的介入与耗时、失败和恢复、仍需决策、任务与证据版本。只在用户同意后分享脱敏摘要。
本站不启动Agent、不读取本地文件,也不上传你的工作材料。求职和招聘模板只整理草稿,外部模型成绩不会转成人的能力分。