知识卡片

学习排序并行

普通读书笔记卡 · 1781.c

内容

分布式LambdaMART让各工作服务器用本地数据子集并行生成候选子树,再互相广播评估所有候选,最后由主控服务器选出全局评估分最高的子树纳入模型,如此逐棵训练,避免了逐节点通信的高开销。

参考来源

- 位置:《大数据日知录:架构与算法》第16章《机器学习:分布式算法》"16.3.3 分布式LambdaMART"一节(源文件:_epub-src/OEBPS/text00021.html) - 结论依据:原文明确"第k个工作服务器根据……生成新的子树……然后将……发送给其他所有的工作服务器,供它们对自己的结果进行评估……每个工作服务器会接收到K-1个其他的工作服务器独立训练出的弱假设……评估方法是依次将每个弱假设集成到……形成评估值集合……发送给主控服务器","主控服务器选择在整个训练集合S上评估值得分最高的弱假设作为下一个被接受的弱假设"。 - 原始内容:第k个工作服务器根据f(x,N−1)和Sk生成新的子树(即弱假设hN,k(x)),然后将hN,k(x)发送给其他所有的工作服务器,供它们对自己的结果进行评估……主控服务器选择在整个训练集合S上评估值得分最高的弱假设作为下一个被接受的弱假设……这样就完成了一棵子树的训练过程,依次训练后续子树即可完成整个任务训练过程。通过如此改进,可以极大地减少通信量。