知识卡片
数据集中集群与数据分散集群的分野
内容
多机数据集群按角色分两类:数据集中集群(如ZooKeeper)数据只往一台主机写,其余是备份,本质是主备架构的多备版本,适合数据量不大的场景;数据分散集群(如Hadoop、ES)每台服务器只存一部分数据、也能处理自己那部分读写,靠一角色负责分配算法,适合数据巨大、机器可扩到上千台。发散:判断该用哪种模式的关键不是”要不要用集群”,而是”数据量是否已大到单机存不下”。
参考来源
- 位置:《从0开始学架构》第30章《26|高可用存储架构:集群和分区》(源文件:_epub-src/OEBPS/Text/part0029_split_000.html)
- 结论依据:原文明确"数据集中集群适合数据量不大,集群机器数量不多的场景。例如,ZooKeeper集群,一般推荐5台机器左右,数据量是单台服务器就能够支撑;而数据分散集群,由于其良好的可伸缩性,适合业务数据量巨大、集群机器数量庞大的业务场景。例如,Hadoop集群、HBase集群,大规模的集群可以达到上百台甚至上千台服务器"。
- 原始内容:数据集中集群适合数据量不大,集群机器数量不多的场景。例如,ZooKeeper集群,一般推荐5台机器左右,数据量是单台服务器就能够支撑;而数据分散集群……适合业务数据量巨大、集群机器数量庞大的业务场景……大规模的集群可以达到上百台甚至上千台服务器。