W.AI工作标准面向AI从业者给我的 Agent
研究预览:任务标准为草案,本站未运行AI实测;外部评测数值不代表本站任务成绩。方法与局限 →

Magister供应商 / 供应商自测

Marketing Benchmark

营销产物与分析任务

阅读原始来源 ↗供应商自测原始资料已查阅 · 2026-09-27

证据条件

版本
site run dated 2026-09-04
资料开放性
官网结果/仓库访问失败
来源家族
Magister供应商
下次复核
2026-10-27
本站复现
未运行;引用外部研究

阅读限制

这份证据还不能证明

单次尝试,自测,judge与holdout限制

同一实验的论文、博客和转载按一组来源计算。本站任务适配属于分析判断,不代表上游测试了本站任务。

外部结果快照

保留原指标,不作跨基准总排名
供应商自测

Magister + Gemini 3.8 Flash high effort

14 / 20

任务通过

范围
Marketing Benchmark · 页面2026-09-04运行
配置
完整Agent+skills+工具;每题一次
运行日期
2026-09-04
报告日期
2026-09-04
原文位置
官网 + Magister 表格

官网自报;质量分94.5与整题通过不同。仓库访问404,尚未独立核实运行资产。

关联的工作任务

以下为部分覆盖或方法关联,尚未完成逐题对应。

数据分析DATA-01

核对订单收入,找出差异

标准:订单净额查询与对账

SQL · 逐单对账与数据质量记录

人的责任确认业务口径与来源完整性
完整示例3条验收门槛 · 4组相关来源
数据分析DATA-03

解释转化率变化,拆分人群组成影响

标准:转化变化与组成分解

总体/组内/组成分析,因果限制与建议

人的责任解释统计结果并决定需要什么新数据
基础草案3条验收门槛 · 4组相关来源
内容与增长GROW-01

按人群制作有事实依据的内容

标准:证据驱动的分群内容

内容草稿 · 主张台账 · 来源与限制

人的责任保证产品事实和发布责任
完整示例3条验收门槛 · 3组相关来源
内容与增长GROW-02

让内容适配渠道和商业属性

标准:渠道与商业属性适配

不同渠道版本及保留属性核对

人的责任判断语义、品牌与渠道适用性
基础草案2条验收门槛 · 2组相关来源
内容与增长GROW-03

设计不同人群的激活实验

标准:分群激活实验设计

实验 · 触发/抑制 · 观察窗 · 停止规则

人的责任选择受众、渠道与预算
基础草案3条验收门槛 · 2组相关来源
内容与增长GROW-04

核算增长增量和扣除成本后的收益

标准:增量与成本后收益判断

增量解释 · 净贡献 · 继续/停止与限制

人的责任对预算、用户体验和品牌取舍
基础草案3条验收门槛 · 3组相关来源