一份对调查进行 A/B 测试的实用指南——测试什么、如何设计一个有效的实验、如何解读统计显著性,以及如何避开常见的陷阱。
A/B 测试不只适用于落地页和邮件主题行——它还是改进调查本身最可靠的方法之一。通过拆分受众并展示不同的版本,你可以发现究竟是什么真正提升了应答率、减少了中途流失并产出了更高质量的答案,而不是凭空猜测。本指南将说明在一份调查中应该测试什么、如何设计一个有效的实验,以及如何在解读结果时不自欺欺人。
什么是调查 A/B 测试
A/B 测试(也称拆分测试)是一种受控实验,你在其中把受众随机分成两组或更多组,并让每一组接触某个事物的不同版本——在这里,就是你的调查。由于分配是随机的,各组在开始时在统计上是等价的,因此结果中任何有意义的差异,都可以归因于你所做的改动,而非归因于恰好落入各组的是哪些人。正是这种随机化,把一个真正的实验与一次误导性的"前后对比"区分开来。
其目标是就调查设计做出以数据为依据的决策。与其争论较短的引言还是不同的首个问题表现更佳,不如把两者都拿来测试,让受访者的行为来平息争论。这很重要,因为关于调查设计的直觉常常是错的——团队"笃定"会胜出的那个版本往往会败下阵来,而各种影响的幅度也很少如人们所预测的那样。A/B 测试以证据取代意见,而经过多次测试,它会累积成实质性更高的应答率与数据质量。
有必要把 A/B 测试与相关的概念区分开来。简单的"前后对比"——改动调查,然后拿上个月与这个月相比较——并不是一个实验,因为那段时间里发生变化的其他任何因素(一场营销活动、一次季节性波动、一批不同的受众)都与你的改动纠缠在一起。唯有随机、同时进行的分配,才能把变体本身的影响单独隔离出来。同样地,对调查进行 A/B 测试,有别于用一份调查去对某个产品进行 A/B 测试;在这里,调查才是受测对象,而你所关心的结果是应答行为和答案质量,而非下游的产品指标。
你可以测试什么
调查中的许多要素都会影响结果,值得加以测试。邀请与主题行决定了人们是否会打开并开始作答这份调查——它往往是撬动应答率的最大单一杠杆。调查长度在完整性与完成率之间进行权衡;较短的版本往往能提升完成率。开场问题塑造着前进的势头,因为一个轻松、引人入胜的首个问题能减少早期的放弃。问题的措辞与顺序既可能改变完成率,也可能改变答案本身。量表类型(例如五点式与七点式量表之比)可能会影响受访者分布其答案的方式。甚至连激励方案和进度指示器也会影响完成率。每次只测试一个要素,这样你才能知道是什么导致了任何变化。
可供比较的结果指标包括打开率、开始率、完成率、流失点、完成所需时间,以及答案质量(例如开放式文本回答的长度和具体程度)。开展周期性研究的团队——例如每季度投放一次的市场调研问卷——会获得不断累积的收益,因为每一处经过测试的微小改进,都会带到未来的每一轮中去。
设计一个有效的实验
一个有效的 A/B 测试建立在四条原则之上。随机分配:随机地拆分受访者,而非按时间或渠道拆分,以使各组具有可比性。每次一个变量:在 A 与 B 之间只改动单一要素;如果你一次改动好几处,就无法判断究竟是哪一处起了作用(那需要多变量测试和大得多的样本)。足够的样本量:每个版本都需要足够的回答,才能侦测到你所关心的影响——微小的提升需要庞大的样本。固定的测试时长与停止规则:事先决定你要把测试运行多久或收集多少份回答,切勿在某个结果刚显得有利时就停手。
在发布之前,先确定你的主要指标(决定胜负的那唯一一个结果)和你的最小可侦测影响(值得据以采取行动的最小改进)。这两项抉择决定了你所需的样本量,并使你不致去追逐微不足道的差异。
解读统计显著性
当版本 B 胜过版本 A 时,你必须问一问:这一差异是真实的,还是仅仅出于偶然。统计显著性回答的正是这个问题。p 值是指:假如两个版本之间实际上并无差异,你观察到一个至少与所见差异一样大的差异的概率。一个常用的阈值是 p < 0.05,意味着结果纯属偶然的概率不到 5%;这大致相当于 95% 的置信度。
两点提醒。第一,统计显著性并不等于实际显著性——在样本极其庞大时,完成率提升 0.2% 也可能"显著",却根本不值得为之付出努力。请始终权衡影响的大小。第二,显著性取决于样本量:每个版本仅 30 份回答所得出的一个看似可喜的结果,通常单薄到不足为信。如果你为这一差异计算出一个置信区间,而它宽裕地把零排除在外,你便可以更有把握地认为该影响是真实的。
常见的陷阱
最具破坏性的错误是偷看并提早停止——反复查看结果,并在其一越过显著性时就结束测试。这会极大地抬高假阳性;请事先对你的样本量作出承诺。一次测试太多变量会搅浑归因。在不同时间段运行测试(版本 A 在周一,B 在周五)会把变体与星期几的影响混为一谈——请让它们同时运行。忽视样本量会导致从噪声中得出自信满满的结论。而样本比例失配——当你 50/50 的拆分实际到手却是比如 60/40 时——则标志着随机化出了故障,会使测试失效。请对此加以留意,并在信任结果之前查明原因。
一套分步的工作流程
用同样严谨的方式来运行每一次测试。陈述一个清晰的假设("一个 3 个问题的引言,会比当前 6 个问题的引言提升完成率")。选定一个主要指标和一个最小可侦测影响。计算每个版本所需的样本量。搭建两个版本,并随机、同时地拆分流量。让测试一直运行到预先设定的样本或时长,中途不要偷看。同时就统计显著性与实际显著性进行分析。推出胜出者,记录你的所学,并把下一个测试排入队列。这一持续改进的循环,正是行动迅捷的团队——包括众多 SaaS 初创公司——稳步提升应答质量的方式。SurveyMaker 凭借内置的分发功能和实时分析,让实验这一环变得轻而易举;如果你正在为测试与报告而权衡各个平台,我们的 SurveyMaker 与 SurveyMonkey 对比涵盖了分析方面的差异。
常见问题
一次调查 A/B 测试我需要多少份回答?这取决于你的基准率以及你想侦测的最小提升——影响越小,所需样本越大。作为一个粗略的参考,要侦测完成率上几个百分点的差异,通常每个版本需要数百份回答;请用一个样本量或功效计算器,代入你的具体数字。
我可以一次测试两个以上的版本吗?可以——那就是 A/B/n 测试。每增加一个版本,都会把你的流量进一步细分,并需要更多的总回答数,而且比较多个版本会抬高假阳性的风险,因此在判断显著性时要把这一点考虑进去。
为什么我不应该在测试刚显得显著时就停手?在结果首次越过显著性线时就提早停止,会极大地抬高假阳性率,因为随机波动会频繁地越过并再度越过该阈值。请对一个预先设定的样本量或时长作出承诺,并且只在结束时才作评估。
统计显著性与实际显著性有什么区别?统计显著性告诉你某一差异不太可能出于偶然;实际显著性则告诉你该差异是否大到足以对你的决策产生影响。一个庞大的样本可以让一个微小、无关紧要的差异在统计上变得显著,因此请始终也检查影响的大小。
借助 SurveyMaker 内置的分发功能和实时分析,测试、衡量并改进你的调查。