北方工业大学信息学院 乔子凌 柳子涵 鲍志平 蔡希昌 董红霞 刘都鑫 刘子逸
近年来,基于深度学习的音频事件分类方法成为研究热点,但其嵌入式实现仍存在较多难点。论文由此出发,研究嵌入式GPU下的音频事件分类算法及软硬件实现。硬件上,采用环形麦克风阵列和Jetson Nano完成音频采集及音频分类处理。算法上,研究两张基于多重卷积神经网络块结合池化层的方法,并在卷积层后叠加BN层和RELU激活函数。软件上,实现Python下的音频采集、算法实现及指标输出。实验对比证明,论文提出的网络一和网络二的分类准确指标mAP的值为0.431/0.343、AUC的值为0.973/0.965、d-prime的值为2.732/2.568。指标值明显高于与谷歌提供的基线值,且网络一较为优化。
目前难点在多个方面,一个是算法的成熟度方面,另一个是嵌入式实现方面。对于音频事件分类而言,其实时性有一定要求。应用上,通常在监测点布置需要多个音频采集点,并将音频数据进行实时分析与分类输出。
目前,在工程驱动的需求下,嵌入式GPU发展迅速。典型方案为NVIDIA公司的嵌入式GPU。但由于嵌入式GPU的平台性能有限,如何选择复杂度合适的神经网络算法,将复杂算法移植,并保证足够的准确度,这方面的研究已积累较多的经验。
本文通过研究两种组成不同的多层卷积神经网络块在嵌入式GPU下的建模与对比实验,完成一种工程可用的音频事件分类方法探索。
在实时音频事件分类实现中,硬件平台的小型化与运算速度的平衡尤为重要。……