何一锋 戴艺宁 陈一凡


摘 要:目前部署的沉浸式音频内容的范式是基于音频对象的,它是由一个声轨和位置元数据组成的。 基于电影对象的作品通常由几十个同时进行的音频对象组成,这给音频对象的提取带来了挑战。我们通过构建一种深度学习方法来提取对象,从基于对象的作品的多声道渲染中学习,而不是直接从音频对象本身学习。这种方法可以解决对象的可扩展性问题,也提供了以监督或无监督的方式来制定解决问题的可能性方案。
关键词:音频分离,深度学习,监督,无监督
中图法分类号TP389.1
1简介
音轨和位置元数据组成的音频对象在播放过程中被渲染成特定的听觉布局(如5.1或立体声),这比传统的多声道制作提供更高的灵活性、适应性和沉浸性。基于对象的音频制作是由几十个同时进行的音频对象组成。这种对象的可扩展性问题也从模型优化的角度带来了挑战。语音[7-9]和通用[3, 10]源分离文献中描述的包络模糊性问题也出现在这里。由于任务的来源(或说话人)独立性质,监督学习所需的输出到基础真理对不能被任意分配。 为了克服这些挑战,我们提出了一种基于多通道学习的方法:我们监督学习的参照物不是物体,而是由这些物体呈现的多通道混合。基于多通道的学习的灵感来自于人类评估电影作品的方式,根
据这种方式,即使两个混合中的物体数量可能不同,如果两个基于物体的作品在多通道布局中的渲染也是相似的,那么它们就被认为是相似的。……