冯祥+邱志超
摘 要 ApacheSolr是一个基于ApacheLucene的开源企业搜索服务器。Apache SolrCloud是基于Solr和Zookeeper的分布式搜索方案,它的主要思想是使用Zookeeper作为集群的配置信息中心。文章在海量日志索引信息存储和查询方面进行了探索,证明了在相关优化策略下Solr Cloud具备了优秀的查询性能。
关键词 Solr;SolrCloud;日志信息查询;大数据;性能优化;集群;分片
中图分类号:TP393 文献标识码:A 文章编号:1671-7597(2014)03-0037-03
随着传统互联网和移动互联网的持续发展,网络带给我们的是不断增长的各种不同价值信息,然而如何在信息海洋中快速检索到有价值信息,对于我们来讲至关重要。目前一些搜索公司在公共互联网领域提供了很好的解决方案,但是企业或者政府机关内部相关信息往往需要应用独立的搜索系统,Solr Cloud则是很好的一个平台选择。
1 概述
随着企业和政府信息化建设的持续推进,相关系统平台会产生海量的日志数据,而这些日志数据的整合分析对于企业和政府相关单位具有非常重要的价值,既有关系型数据库能够存储如此海量的大数据,然而对于分析如此海量的大数据进而提供准确的信息查询服务则显得力不从心。
1.1 问题描述
笔者所在从事项目环境对于海量的日志分析具有以下要求。
1)日志信息数据增量庞大。每天会有500万条记录的日志增量,总量有15亿条记录,索引物理存储总量1.5T的存储。
2)数据索引需要保留4年并且会动态添加新表的配置,并且维护索引和搜索会同步进行。
3)需要根据关键字搜索,将相关表的搜索结果总数返回,并且返回其中一个表的前10条数据,要求召回率为100%,可以时间排序。……