王蕴韬
(中国信息通信研究院云计算与大数据研究所,北京 100191)
以机器学习为代表的人工智能技术,在包括自然语言处理和机器视觉应用等方面已有超越人类的出色表现。AI赋能领域的迅速扩大势不可挡,但随之而来的是数据使用量和替代计算量剧增。根据OpenAI统计,2012—2019年,随着机器学习“大深多”模型的不断演进,所需计算量已经翻了30万倍,模型所需算力呈现阶跃式发展。据斯坦福《AI INDEX 2019》报告统计,2012年之前,人工智能的计算速度紧追摩尔定律,每两年翻一番;2012年以后,则直接缩短为每三四个月翻一番。面对每20年才能翻一番的通用计算供给能力,算力显然已捉襟见肘。在此背景下,通过扩展单体计算能力已经无法满足实际工程需求,整合多个异构系统,采用分布式系统的计算策略完成机器学习的高效训练及推断已经成为业界的共同愿望。本文通过分析归纳机器学习计算特殊性及现有分布式计算性能分析理论的局限性,对比当前AI领域对分布式机器学习系统通信系统优化的理论与实践,提出了通信系统优化对于分布式机器学习系统性能的影响要素,并对下一步发展作出了展望。
经过近两年的研究及应用实践沉淀,产业界发现面向机器学习的计算具有不同于一般计算的独特性,具体表现在三方面[1][25]:一是机器学习计算大部分场景仅需要低精度计算即可,一般推断应用场景下8 bit即可满足95%以上需求,无需FP32、FP16等高精度计算;……