张博,孙逸,李孟颖,郑馥琦,张益嘉,王健,林鸿飞,杨志豪
(大连理工大学 计算机科学与技术学院,辽宁 大连 116024)
随着现代生物医学的快速发展,大量的临床医学数据呈现指数增长,且大多为非结构化文本。为构建临床试验筛选结构化文本,通过自然语言处理和机器学习的方法对临床试验筛选标准自动解析,并以此构建自动化筛选病人的系统是一个很有前景的研究热点,具有很大的实际应用前景和医学临床价值。临床试验是指通过人体志愿者也称为受试者进行的科学研究,筛选标准是临床试验负责人拟定的鉴定受试者是否满足某项临床试验的主要指标,分为入组标准和排出标准,一般为无规则的自由文本形式。临床试验的受试者招募一般是通过人工比较病历记录表和临床试验筛选标准完成,这种方式费时费力且效率低下。因此通过现有的深度学习等一些自然语言处理技术来实现临床试验筛选标准短文本分类系统具有重要意义。
本文旨在解决医学短文本分类问题,实验数据集选择的是中国健康信息处理会议(CHIP2019)评测数据,如图1所示,输入为一系列中文临床试验筛选标准的描述句子,输出为根据每一条临床试验数据返回筛选标准的具体类别。

图1 数据示例Fig.1 An example of data
传统的文本分类方法主要基于特征工程等机器学习方法,该方法需要大量的人工介入,需耗费大量的时间和精力,近年来,深度学习技术逐渐取代传统的机器学习技术成为文本分类领域的主流方法[1]。……