知识卡片
分布式ML瓶颈
内容
分布式机器学习的难点不是把样本切开这么简单,而是全局参数访问、慢节点、容错和收敛正确性。网络通信常比计算更贵,算法设计要主动减少参数同步频率。
参考来源
- 位置:《大数据日知录:架构与算法》第15章《机器学习:范型与架构》引言部分(源文件:_epub-src/OEBPS/text00020.html)
- 结论依据:原文列举四类挑战:"单机版通过共享内存获取的全局参数此时需要并发程序通过网络来存取,而网络的通信效率会比内存存取效率低很多……如何增加通信效率或者减少通信量";"并发程序可能……执行速度不统一";"较强的容错性";以及"如果不能合理设计系统架构和算法,有时候分布式算法的执行效率甚至不如单机版"。
- 原始内容:单机版通过共享内存获取的全局参数此时需要并发程序通过网络来存取,而网络的通信效率会比内存存取效率低很多……在分布式环境下,运行在不同机器上的并发程序可能因为各种原因(机器负载高或者硬件故障等)造成执行速度不统一……较强的容错性,当集群中的机器发生故障时,如何进行调度使整个任务能够顺利完成,并保证程序运行的正确也是很重要的问题。