加得起来的权重,稳得住的分流
A/B 标签页里是一份版本列表,每个版本有一个目标 URL 和一个权重。权重之和不是恰好 100% 时,表单拒绝保存——这听上去很迂腐,直到你调试过一次有 10% 流量消失在四舍五入缝隙里的测试。默认是两个版本各 50%;当你要拿一小部分流量试一件有风险的事时,90 比 10 这样不均衡的分配同样成立。
版本分配对每位访客是确定性的,而不是每次请求随机。同一个人两次点开同一条链接会看到同一个目标地址,这一点很重要,因为在两个落地页之间来回弹跳的访客,既得到糟糕的体验,也产出毫无意义的结果。分配由统计独立访客所用的同一个每日访客哈希推导而来,因此不额外存储任何东西,也不需要为此写入 cookie。
如实报告结果,不夸大
对于正在跑分流的链接,数据分析页面会多出一个 A/B 组件:每个版本的点击量与独立访客、每个版本实际拿到的占比与你配置的占比对照,以及相对上一时间段的变化。
数字旁边是用正态近似算出的置信区间,还有一行说明,写明差异要达到什么阈值才具有统计意义。多数链接工具只画两根柱子,任由读者默认更高的那根赢了;这行说明的意义,就是阻止 100 次点击、6% 的差距被当成胜利汇报给客户。
版本标签会写进点击事件本身,因此其他所有维度拆分都能按它筛选。你可以只问版本 B 是否在移动端、或只在某一个国家里胜过版本 A,而不必另起一次实验。
在链接上值得测试的是什么
落地页版本是标准场景:一个页面的两个版本,一条链接,用真实流量而不是主观意见来判断。定价页和优惠页从中获益最多,因为不同表述之间的差异,通常比任何标题微调都大。
除此之外,分流也适合比较那些彼此根本不是「同一事物两个版本」的目标地址——产品页对比测评文章、注册表单对比预约演示、应用商店页面对比网页结账。联盟营销者用它在同一批流量上比较两个 offer,这比分两周先后各跑一次要公平得多。
由于分流位于链接上而不是页面里,你可以测试自己无法控制的目标地址,也可以测试那些根本放不下测试脚本的页面。
- 同一场营销活动流量下的两个落地页
- 在全量切换之前,按百分比灰度放量一个新页面
- 同一批流量上来自不同广告主的两个 offer
- 移动端营销活动里,网页结账对比应用商店页面
结束一次测试只需改一个字段
某个版本胜出后,把获胜的 URL 设为基础目标地址,再关闭分流即可。在此之前分享出去的每一条链接照常可用——短链接从未变过——历史点击数据仍然挂在它身上,包括测试期间的版本标签。
分流可以和链接的其余能力组合。定向规则优先级更高,因此拥有专属目标地址的市场会被自动排除在实验之外。营销活动参数会追加到被选中的那个版本上,于是测试的两边无论在你自己的数据分析里还是在我们这里,都能被正确归因。
常见问题
一条链接可以有多少个版本?
权重允许多少就有多少,不过真正有用的测试通常在两三个版本之间。每个版本都需要足够的流量才能说明问题,所以把一条链接分成四份,往往得到四个没有结论的结果,而不是一个清晰的答案。
同一个人会始终看到同一个版本吗?
在一天之内会——分配是从当日访客哈希确定性地推导出来的。跨天之后 salt 会轮换,因此回访的访客可能被重新分配。这是我们为了不给任何人存储持久标识符而做出的取舍。
A/B 测试要额外收费吗?
它是链接记录的一部分,因此只要你出售的套餐启用了它,它就随处可用。既没有需要单独购买的实验产品,也没有按实验计费;唯一适用的限制,是普通的跟踪点击量额度。