兰秋军,马超群
(湖南大学 工商管理学院,湖南 长沙 410082)
现代金融研究也许是经济学研究各个分支中最具有实证性的,在该领域,基于不确定性理论的金融计量经济方法被普遍采用,通过采集各种相关金融数据,依赖统计推断,对复杂抽象的金融理论进行总结、阐释或验证。在此过程中,“数据”是研究的关键和基础。为此,各种支持金融研究的数据库相继被各大公司开发并推出,成为金融研究、教学以及实际投资分析与决策的重要“数据平台”。这些数据大致可分为两类:数值型(如金融资产的价格、交易量、收益率、资本规模等)和文本型(如名称、简介、公告、报告等)。长期以来,实质性用于金融研究的绝大部分数据是数值型的。文本型数据大多数只是提供标签、描述和注释等信息供研究者阅读参考以及定性研究,极少参与实际模型的计算与推断,最多也只是作为类别变量参与分类统计或作为哑元变量进入模型,并不涉及文本内容的理解和应用。近年,随着电子文本的大量涌现,计算语言学、自然语言理解和文本挖掘技术相应迅速发展,这种状况正在改变。越来越多的金融界学者开始尝试利用这些近期发展起来的文本理解与挖掘技术来深层次地获取信息,揭示金融市场中的规律,并支持金融理论与实证研究工作的开展。本文拟就这一领域的最新进展及趋势做一概要性的介绍。
数值型数据具有意义简单明确、结构化存储、规范通用等优点。……