徐杨
(四川大学计算机学院,成都610065)
目前各种智能应用出现在不同领域,例如:问答系统、对话系统等,这些应用几乎都涉及文本生成任务,该任务是自然语言处理领域的研究热点之一。文本生成旨在通过机器自动生成符合语法规范、满足特定任务目标的文本,例如:在问答系统中机器根据源文本及问题查询,生成简洁且相关的答案;在对话系统中机器利用对话历史产生对当前对话的回复。然而,随着智能应用的发展,人机交互体验更加受到重视,为了增加智能应用的趣味性与可互动性,生成的文本要求表现多样性。例如:针对某些相似对话,聊天机器人如果只能产生特定的回答,将显得枯燥无味,不利于聊天持续进行。因此,多样性文本生成是文本生成研究的重点问题之一。目前多样性文本生成研究以神经网络的方法为主,利用Seq2Seq(Sequence-to-Sequence)模型对源文本编码,然后再解码产生目标文本。本文第一部分对多样性文本生成任务中面临的问题及其主要原因进行介绍与分析,第二部分重点介绍现阶段各类解决多样性文本生成问题的相关工作,尤其是变分自编码方法。
多样性文本生成任务要求机器根据给定的文本信息自动生成符合语法规范的、多样的、相关的文本。Seq2Seq 模型在众多文本生成任务[1-3]中均取得显著效果,但该模型对输入的相同源文本只能产生固定的输出文本。例如:在聊天机器人中,向机器发送相同或相似的对话,机器只能产生固定的回复,这使机器显得呆板、枯燥。……