词嵌入模型研究综述

2021-07-06 02:45:12和志强王梦雪
河北省科学院学报 2021年2期

陈 萌,和志强,王梦雪

(河北经贸大学 信息技术学院 ,河北 石家庄 050061)

0 引言

近年来,自然语言处理作为人工智能的一个热点方向受到越来越多人的关注,随着深度学习、预训练技术研究的逐渐深入,自然语言处理领域中的智能问答系统、命名实体识别、机器翻译等技术都取得了不错的成绩。在自然语言处理任务中,文本是非结构化的字符型数据,首先需要转化为可被计算机识别的的数值型数据,词是文本数据的基本单元,词嵌入技术是将文本数据表示为能被计算机识别的数值向量形式,这是文本数据能够被计算机处理的基础。词向量可以被视为词的特征向量,是把维数为词典大小的高维空间嵌入到一个低维数的连续向量空间,把词映射为实数域上向量的技术也叫词嵌入(word embedding)。词嵌入是自然语言处理领域中下游任务实现的重要基础。

最初自然语言处理任务中,非结构化的文本数据转换成可供计算机识别的数据形式使用的是独热编码模型(one-hot code),其是将文本转化为向量形式表示,不局限于语言种类。也是最简单的一种方式,是将词典中所有的词排成一列,根据词的位置设计向量,例如词典中有m个词,则每个单词都表示为一个m维的向量,单词对应词典中的位置的维度上为1,其他维度为0。该方法虽然简单,并且适用于任意文本数据,但是每个单词的向量中的1都在不同维度上,任意两个词之间都是孤立的,从这两个向量中看不出两个词之间是否有语义上的联系,这就是“词汇鸿沟”现象。……

登录APP查看全文