范俊军
(暨南大学 文学院,广东 广州 510632)
中国濒危语言有声语档数据规则
范俊军
(暨南大学 文学院,广东 广州 510632)
中国濒危语言有声语档数据规则分五个部分:一、濒危语言的语档数据构成;二、语档数据文件格式;三、语档音像数据质量标准;四、语料采录和数据处理工具;五、音像语料采录环境和设备匹配建议。该规范适用于中国濒危语言的记录和建档,也可作为中国语言田野调查记录和语料处理的参考准则。
濒危语言;语档;数据规范
濒危语言有声语档是以音频文件及其转写文件为数据主体的濒危语言口语资料集。本文定义了濒危语言语档的数据构成、语料数据质量标准、语料采录的环境和设备匹配规范,适用于中国濒危语言的记录和建档,也可作为中国语言田野调查记录和语料处理的参考准则。*本文内容曾在“中国濒危语言有声资源采录与立档技术高级讲习班”暨南二期(2014年)、暨南三期(2015年)上讲解并征求学员意见,此次公开发表希望能更广泛征求意见。技术部分承蒙广东得胜电子有限公司周雨程和有关技术人员提出建议。在此一并致谢。
濒危语言有声语档由媒体数据、转写数据、描写数据、元数据等四类数据构成。此外,也可包括多模态数据。媒体数据是以音频文件、视频文件、图形文件记录和存储的语言音像资料。转写数据是音频和视频的同步转写标注文本。描写数据是描写语言特点和相关知识的文字资料。……