周浩然, 郑建立
(上海理工大学健康科学与工程学院, 上海 200093)
疾病和相关健康问题的国际统计分类(International Statistical Classification of Diseases and Related Health Problems,ICD)由世界卫生组织创立,用来确定全球卫生趋势和统计数据的一种医疗编码体系国际标准。 该体系由表1 所示的医学编码及对应医学名称组成最小描述单元,涉及到手术、疾病、诊断等医疗环节,对生物医学领域如医学知识实体对齐、医疗标准化、临床路径等研究起着重要作用,同时也作用于医保结算、医疗监督等领域。

表1 ICD 编码示例Tab. 1 Examples of ICD code
当前,国内医疗体系中存在着多种本地化的ICD 编码版本,且大部分基于ICD-9 和ICD-10。 虽然部分机构发布了某版本与另一版本的映射,但不论是从映射版本的数量以及更新速度都不尽如人意。 除此以外,各个医疗机构还存在各自定义的院内码,这更对医疗数据的一致性提出了挑战。
目前,医学编码相关的研究大多集中在病案的命名实体识别和编码领域,如夏等[1]基于深度学习技术实现电子病历的实体识别;厐等[2]基于文本相似度实现了康复量表与 ICF ( International Classification of Functioning,Disability and Health)编码的映射。 此外,专业医生也就各自专业领域ICD编码的合理性进行了讨论,如叶[3]等对ICD-10 在眼挫伤的分类编码讨论;许等[4]对ICD-10 编码在癫痫方面的质量分析。
实现ICD 映射的方式往往需要大量的人工分级、字典映射等传统方式,而基于语义相似度的方法较少。 随着蕴含大量生物医学领域先验知识的预训练模型MC-Bert(Meta-Controller BERT)的出现,中文医学文本可以转化为更加稠密和准确的向量表示,在此基础上本文提出一种基于改进MC-Bert 的ICD 编码映射方法,该方法通过语义相似度在现有的ICD 版本映射库中进行匹配实验,在不同匹配精度下的准确率均达到较高水平。……