张小衡
(香港理工大学 中文及双语学系,香港)
中文的同形异码字问题
张小衡
(香港理工大学 中文及双语学系,香港)
同一个字符拥有不同的计算机内部代码,这意味着有两个或两个以上字形在人的眼中是同一个字,而计算机却认为是不同的字。这种“人机看法不一致”会给语言信息处理带来混乱,导致信息检索不全,统计数字不准,字词分类排序不一致等情况。该文结合Unicode实例专题讨论当前计算机上存在的中文同形异码字问题,包括 (a) 私人造字公有化所形成的同形异码字,(b) 兼容编码所形成的同形异码字,(c) 建立专门的笔画部首表而形成的同形异码字,(d) 半宽和全宽字形分别编码而造成的同形异码字等,并探讨解决问题的方法。
中文字符;同形异码;Unicode
在繁体字PDF版《中华人民共和国香港特别行政区政府二零一一至一二年施政报告》 中[1],多处出现“劏房”*劏 tāng, 粤语方言字,指杀。在香港,“劏房”指将大房间分割成(的)小房间,一般用于租借给贫穷人士居住。“劏房”和"豪宅" 的并存是社会贫富悬殊的突出表现,是大家关注的问题。这个词。如果您也关心香港的“劏房”问题,想找出施政报告中提到“劏房”的每一处,很可能会利用Adobe Reader 的Find或Advanced Search命令。但是,不管您使用内地的微软拼音中文输入法(MSPY 2010)还是台湾的微软新注音输入法(New Phonetic 2010)输入繁体检索字“劏”,结果都是一样: 连一个匹配都没有找到。但是,原文件中的确有“劏”字。如图1所示,在计算机报告找不到“劏”字的小窗口下面的原文件中就有“劏”字出现。……