一种改进的分布式同步梯度下降法

2021-08-06 06:23:16朱小飞
重庆理工大学学报(自然科学) 2021年7期
关键词:实验模型

李 梁,王 也,朱小飞

(重庆理工大学 计算机科学与工程学院,重庆 400054)

深度学习由于在语音、视觉和自然语言处理等领域的巨大成功而越来越受欢迎。有一种趋势是使用更深、更复杂的神经网络模型,训练的数据集则越来越大。这样的模型通常需要几个小时、几天甚至几周才能完成训练,分布式的训练模型的目的就是提升模型的训练速度[1-10]。采用远程通信机制(RDMA)来优化[1],因为在分布式环境下,并行处理可以更快地完成计算部分,而网络通信造成的延迟在整个过程中可能变得更加明显,但是优化后的分布式集群则表现出了良好的性能,且随着计算节点的增加,表现出良好的可扩展性。但是RMDA需要的是InfiniBand,因此也未必是一个直接可用的方法。Ferdinand等[2]提出对集群的性能做出一个评估,然后做出参数的设定以及节点的分配,这样做的确可以充分利用集群的计算能力,但同时对设备的要求十分苛刻。

在本文中,重点研究随机梯度下降法(SGD)在异构集群中的优化,其中主要流程是一组计算节点(worker),结果经过计算各自所分配的样本,然后将计算之后的梯度反馈给参数服务器。在这里有2种方法可以将梯度反馈给参数服务器,一种是异步梯度下降法(ASGD)[3];另一种是同步梯度下降法(SSGD)[4]。SSGD往往未能实现自己的理论计算加速,是由于异构集群中各个节点的计算能力差异导致worker之间返回的梯度时间不同,而同步梯度下降法需要等待所有节点均计算完成之后才进行下一步任务,这大大减缓了模型的更新速度。……

登录APP查看全文

猜你喜欢
实验模型
一半模型
记一次有趣的实验
重尾非线性自回归模型自加权M-估计的渐近分布
做个怪怪长实验
3D打印中的模型分割与打包
NO与NO2相互转化实验的改进
实践十号上的19项实验
太空探索(2016年5期)2016-07-12 15:17:55
FLUKA几何模型到CAD几何模型转换方法初步研究
《实验流体力学》征稿简则
一个相似模型的应用