知识卡片

随机区组实验:先分层再分组

普通读书笔记卡 · 1067.a

内容

如果已知用户在关键指标上天然存在较大差异(比如高频/低频购买用户),可以先按这个已知维度把用户分成几个区组,再在每个区组内部分别做等比例的A/B分组,最后把各区组的A组合并成总实验组、B组合并成总对照组。这样一来,高频/低频这个已知的大方差来源就被从组间比较中剥离出去,不再干扰假设检验,是[[样本方差如何淹没真实效果]]的直接应对方案,也是随机区组实验设计的基本思路。

参考来源

- 位置:《数据科学工程实践》第8章《提高实验效能》"8.1 控制实验指标方差的必要性和手段"一节(源文件:_epub-src/OEBPS/Text/part0043.xhtml) - 结论依据:原文以外卖高频/低频用户为例说明"将样本粗略地分成高频用户、低频用户两大类,按照同样的比例进行实验组和对照组的AB分组……将所有区组的实验组……合并到一起作为本次实验的实验组,将两种用户的B组合并作为对照组,就可以将高频/低频的差异从假设检验的过程中剥离开,让实验结果更显著"。 - 原始内容:假设本次实验的目的是提升用户购买的频次,并且我们知道用户之间购买频次的差异(也就是频次的方差)会非常大,想要控制、缩小它,数据分析师只需要根据外卖用户的历史频次,将样本粗略地分成高频用户、低频用户两大类,按照同样的比例进行实验组和对照组的AB分组,将所有区组的实验组……合并到一起作为本次实验的实验组,将两种用户的B组合并作为对照组,就可以将高频/低频的差异从假设检验的过程中剥离开,让实验结果更显著。