基于改进MC-Bert 的ICD 编码映射方法研究

2023-06-21 01:59:00周浩然郑建立
智能计算机与应用 2023年6期
关键词:语义实验模型

周浩然, 郑建立

(上海理工大学健康科学与工程学院, 上海 200093)

0 引 言

疾病和相关健康问题的国际统计分类(International Statistical Classification of Diseases and Related Health Problems,ICD)由世界卫生组织创立,用来确定全球卫生趋势和统计数据的一种医疗编码体系国际标准。 该体系由表1 所示的医学编码及对应医学名称组成最小描述单元,涉及到手术、疾病、诊断等医疗环节,对生物医学领域如医学知识实体对齐、医疗标准化、临床路径等研究起着重要作用,同时也作用于医保结算、医疗监督等领域。

表1 ICD 编码示例Tab. 1 Examples of ICD code

当前,国内医疗体系中存在着多种本地化的ICD 编码版本,且大部分基于ICD-9 和ICD-10。 虽然部分机构发布了某版本与另一版本的映射,但不论是从映射版本的数量以及更新速度都不尽如人意。 除此以外,各个医疗机构还存在各自定义的院内码,这更对医疗数据的一致性提出了挑战。

目前,医学编码相关的研究大多集中在病案的命名实体识别和编码领域,如夏等[1]基于深度学习技术实现电子病历的实体识别;厐等[2]基于文本相似度实现了康复量表与 ICF ( International Classification of Functioning,Disability and Health)编码的映射。 此外,专业医生也就各自专业领域ICD编码的合理性进行了讨论,如叶[3]等对ICD-10 在眼挫伤的分类编码讨论;许等[4]对ICD-10 编码在癫痫方面的质量分析。

实现ICD 映射的方式往往需要大量的人工分级、字典映射等传统方式,而基于语义相似度的方法较少。 随着蕴含大量生物医学领域先验知识的预训练模型MC-Bert(Meta-Controller BERT)的出现,中文医学文本可以转化为更加稠密和准确的向量表示,在此基础上本文提出一种基于改进MC-Bert 的ICD 编码映射方法,该方法通过语义相似度在现有的ICD 版本映射库中进行匹配实验,在不同匹配精度下的准确率均达到较高水平。……

登录APP查看全文

猜你喜欢
语义实验模型
一半模型
记一次有趣的实验
重尾非线性自回归模型自加权M-估计的渐近分布
语言与语义
做个怪怪长实验
3D打印中的模型分割与打包
NO与NO2相互转化实验的改进
实践十号上的19项实验
太空探索(2016年5期)2016-07-12 15:17:55
“上”与“下”语义的不对称性及其认知阐释
现代语文(2016年21期)2016-05-25 13:13:44
认知范畴模糊与语义模糊