秦克霄
(山西大学图书馆,山西太原,030006)
古代已有词语频次的观念,人们很早就发现了语言中词语使用的频次是有差异的.19世纪以来,随着语言学的发展以及文学风格和速记研究的需要,人们开始对语言的成分进行统计分析.德国语言学家F.W.Kaeding耗时七年编纂了Häufigkeitswörterbuch der Deutschen Sprache,这是世界上第一部频率词典,是第一次现代意义上的以统计调查方法完成的词汇研究工作.美国教育学家兼心理学家E.L.Thorndike,在20 世纪初先后编写了Teacher’s Word Book of 20,000 Words和 Teacher’s World Book of 30,000 Words,做了大量关于英语词汇的频率统计工作.由于有了大量不同语言中词频资料的积累,关于词语频次的特征不断得到了揭示,人们开始从理论上思考词频差异这种现象.频率词典实际上就是一种词表,包含两个最基本的数据就是词的出现频次和词的等级,二者反映了一个词在词表中的地位和性质,因此这两个基本数据间的相互关系成为了人们要首先着重研究的,并试图在一定的篇章范围内总结出语言成分出现频次所满足的严格的数学原理.如艾思杜、贡东、朱斯和芒代尔布罗等学者先后对这个问题进行了大量的研究.
美国哈佛大学语言学教授齐夫(G.K.Zipf)在前人研究的基础上,收集了大量的文本语料,并进行了系统的分析,正式创立了词频分布定律,验证下面的公式:若把一篇较长的文章中每个词出现的频次从高到低进行递减排列,某个词在文中出现的频率次数f(词频)与它的排列序号数r(词序)的乘积为一个常数c,即……