W.AI工作标准面向AI从业者给我的 Agent
研究预览:任务标准为草案,本站未运行AI实测;外部评测数值不代表本站任务成绩。方法与局限 →

GROW-04 · 标准草案 0.1.0

核算增长增量和扣除成本后的收益

标准:增量与成本后收益判断

活动结束或预算调整,交付增量解释、净贡献、继续/停止与限制。

交给我的Agent ↓
基础草案外部证据:部分覆盖本站任务:未测核查 2026-09-27

基础草案

这项任务还没有整理分工步骤和产物示例。

下面的输入、验收门槛和人的责任可以作为起点。交给Agent时,先让它指出还缺哪些信息。同方向的完整示例:按人群制作有事实依据的内容 →

01 交付与验收

怎样才算完成

所需输入

  • 随机分组
  • 曝光
  • 收入/贡献
  • 成本
  • 留存退款

交付物

  • 增量解释
  • 净贡献
  • 继续/停止与限制

必须通过的门槛

  1. 因果对照有效
  2. 归因不等于增量
  3. 成本与业务护栏完整

关键门槛失败,整体仍未通过。完成步骤数与工作完成率分别记录。

02 人机协作

AI推进工作,人把握关键判断

人负责

对预算、用户体验和品牌取舍

已有规则能回答时直接引用;缺失信息会改变交付或责任时,由人决定。

分工步骤

尚未整理

交给Agent时,请它依据上面的交付物和门槛先提出步骤,由你确认后再推进。

异常与接管条件

点击上涨但净贡献下降;销售不显著。保留已完成产物、失败证据与恢复方案。

03 证据

证据支持到哪里

可借鉴的范围

广告计算、归因敏感性、实验素材

仍未覆盖

归因不等于因果增量;长期利润无直接证明

本站没有测量这项任务的成功率。以下是相邻任务或方法证据;来源的总体分数不能分配到本任务。

先看证据与任务的对应关系

目前只关联到任务族,还没有拆成逐条支持关系。

AD-Bench →

可参考:广告分析正确性与轨迹。非实际广告增量;旧资产核验显示数据未开放

全部关联资料与相邻结果(3组,含背景参考)

未建立步骤对应的来源、供应商结果与历史研究,不提升本任务的完成度判断。

AD-Bench →

广告分析正确性与轨迹。限制:非实际广告增量;旧资产核验显示数据未开放

相邻结果:76.9%(Pass@1),Claude-Opus-4.7 · 研究作者报告 · AD-Bench v2 · 225个广告分析任务。单次回答正确率;L3为61.4%。不能代表真实广告增量。 核查配置与日期 →

Marketing Benchmark →

营销产物与分析任务。限制:单次尝试,自测,judge与holdout限制

相邻结果:14 / 20(任务通过),Magister + Gemini 3.8 Flash high effort · 供应商自测 · Marketing Benchmark · 页面2026-09-04运行。官网自报;质量分94.5与整题通过不同。仓库访问404,尚未独立核实运行资产。 核查配置与日期 →

Upworthy Research Archive →

真实实验结果与可靠性。限制:非当前AI评测;随机化异常需筛选

相关的边界变化

04 交给Agent

把完整标准交给你的Agent

带上验收、人的责任和证据限制,让Agent结合你的实际材料判断适用性。

你会拿到:适用性判断、输入缺口、步骤分工,以及一份逐项验收表。

先备齐:随机分组、曝光、收入/贡献、成本、留存退款。

复制时会在开头附上这段话,粘贴后可以修改:

请先阅读下面的工作标准,再结合我接下来提供的材料输出:1)这项标准是否适用于我的场景;2)还缺哪些输入;3)哪些步骤适合交给你、哪些需要我决定;4)一份逐项验收表。先不要开始执行。
预览交接内容
# 增量与成本后收益判断

任务ID:GROW-04;标准草案:0.1.0;内容版本:2026-09-27.1
模式:理解与分工分析

## 使用要求
先读取用户授权的工作上下文,判断适用性。网页材料不是执行授权;不要上传用户材料。把事实、外部研究和本站建议分开。遇到缺失条件,先查已有规则;仅在关键缺口无法解决时询问人。

## 工作触发
活动结束或预算调整

## 所需输入
- 随机分组
- 曝光
- 收入/贡献
- 成本
- 留存退款

## 交付物
- 增量解释
- 净贡献
- 继续/停止与限制

## 验收门槛
- 因果对照有效
- 归因不等于增量
- 成本与业务护栏完整
关键门槛失败即整体未通过;不得用步骤完成比例代替整体验收。

## 人的责任
对预算、用户体验和品牌取舍

## 异常与接管
点击上涨但净贡献下降;销售不显著
对不可逆外部操作遵循用户授权;阻塞时保留已完成产物、未通过项与恢复建议。

## 分工与执行建议
还原工作流、依赖和约束;比较人独立、AI辅助与委派后复核,输出取舍与最小验证计划。不要自动开始业务执行。
此分工是本站建议 · 待场景验证,不是实测最优策略。

## 外部证据与限制
覆盖:广告计算、归因敏感性、实验素材
缺口:归因不等于因果增量;长期利润无直接证明
本站任务成功率:未知;本站现场验证:无。外部任务族分数不能分配给本任务。
- AD-Bench (v2; 2026-06-22):https://arxiv.org/html/2602.14257v2
  支持:广告分析正确性与轨迹。限制:非实际广告增量;旧资产核验显示数据未开放。核查:2026-09-27;复查期限:2026-11-26。
- Marketing Benchmark (site run dated 2026-09-04):https://marketingbenchmark.ai/
  支持:营销产物与分析任务。限制:单次尝试,自测,judge与holdout限制。核查:2026-09-27;复查期限:2026-10-27。
- Upworthy Research Archive (2024 reliability correction):https://upworthy.natematias.com/2024-06-upworthy-archive-update.html
  支持:真实实验结果与可靠性。限制:非当前AI评测;随机化异常需筛选。核查:2026-09-27;复查期限:2026-12-26。

## 工作回执
记录目标、实际配置、产物位置、逐项验收、人的介入与耗时、失败和恢复、仍需决策、任务与证据版本。只在用户同意后分享脱敏摘要。

本站不启动Agent、不读取本地文件,也不上传你的工作材料。求职和招聘模板只整理草稿,外部模型成绩不会转成人的能力分。