引言
近年来,随着人工智能技术在媒体领域的应用日益广泛,AI配音的身影出现在了新闻节目、纪录片创作和新媒体视频生产中。相较于此前的语音唤醒、语音识别等智能语音技术的应用,AI配音更侧重语音合成的效果及“拟人化”程度,本文将结合当下AI配音的应用现状,从声画关系的视角,探讨该技术的阶段性成效与显著问题。
从手机端的Siri语音助手到汽车导航软件里的各类定制声音,人工智能语音技术早已在不知不觉中融入了人们的日常生活。事实上,除了较为常见的这些应用场景之外,人工智能语音技术也在媒体创作和内容生产等领域取得了阶段性的成果。其中,较具有影响力的当属AI新闻主播和纪录片中的AI配音。而随着短视频内容生产的体量逐渐增大,不少新媒体平台也开发了图文自动生成视频的技术,其中的AI配音应用作为关键部分也备受关注。由于应用场景的差异,在语音助手、导航等语音唤醒及识别的应用方面,人们会在一定程度上产生与机器对话的感受。而在新闻、纪录片或是短视频内容中,从受众角度来说会不自觉地更加关注人工智能语音的“拟人化”程度,因此,媒体内容生产领域的人工智能语音技术亟待解决如何“更像”的问题。
媒体内容生产中的“文语转换”
“文语转换”(Text To Speech)是语音合成技术的一项重要应用,它是声学、语言学、计算机科学等多学科知识交叉研究的成果。该技术的实现主要分为两个环节进行,分别是文本处理与波形生成。……