知识卡片
分簇要在独立性和均匀性之间找平衡
内容
[[随机饱和度实验的两层随机化]]中的簇既要相互独立(比如骑手不能跨簇接单),又要内部样本分布均匀,这两个目标常常互相冲突:分簇分得越细,簇内部越均匀,但越容易发生跨簇干扰,破坏独立性假设;分簇分得越粗,独立性更容易保证,但簇之间又变得不均衡。实验设计者需要根据具体业务场景(如骑手实际跨区接单的比例)在这两者之间找到一个可接受的折衷点。
参考来源
- 位置:《数据科学工程实践》第9章《特殊场景下的实验设计和分析方法》"9.1.2 随机浓度实验的设计流程·地区聚类"一节(源文件:_epub-src/OEBPS/Text/part0050.xhtml)
- 结论依据:原文以外卖骑手抢单为例,明确"聚类出的簇与簇之间可能分布得不是很平均,这时我们可以增加分簇的数量……但是增加分簇数量的同时,无可避免地会增加跨簇接单率,因此实验设计者需要在分簇平均性和跨簇接单率之间做一个平衡"。
- 原始内容:假如我们把这些矩形格子聚成几簇,保证每个簇内的订单都是被簇内的骑手接单的,没有骑手跨簇接单,那么这些簇就是相互独立的,可以用于随机饱和度实验……另一方面,聚类出的簇与簇之间可能分布得不是很平均,这时我们可以增加分簇的数量,再在簇的基础上随机分组,以此增加订单分布的平均度,但是增加分簇数量的同时,无可避免地会增加跨簇接单率,因此实验设计者需要在分簇平均性和跨簇接单率之间做一个平衡。