罗 斌,陈 翔
(北京理工大学管理与经济学院,北京 100081)
推荐系统通常根据用户的历史行为和兴趣来进行推荐活动,大量的用户行为数据是推荐的基础,系统中的新用户或者新物品就面临着推荐冷启动的问题。在社交网络中,研究发现社交网络上的用户行为数据呈现幂律分布规律,存在少量的活跃用户和大量位于长尾部分的不活跃用户,这也就是常说的长尾现象。对于长尾部分的用户,他们有着较少的历史行为或者相关活动数据,虽然不是冷启动,但在对这部分用户进行推荐的时候难免会遇到数据稀疏性问题,而长尾部分的用户却又数量巨大,且极具潜在的开发价值。最经典的应用就是亚马逊对于长尾商品的发掘,大部分商家重视畅销商品的销售,而忽略冷门商品,而亚马逊销售的图书中冷门书籍的销售量接近占到整体的一半。
在推荐系统的实际应用中基于邻域的算法得到了广泛的研究和应用[1]。它主要分为两大类,一是基于用户的协同过滤算法,另一个是基于物品的协同过滤算法。基于用户的协同过滤推荐算法主要有两步:(1)找到和目标用户兴趣相似的用户集合;(2)找到这个集合中用户喜欢的,且目标用户没有听说过的物品推荐给用户。基于协同过滤的推荐系统由于算法特点都更倾向于推荐流行的产品,但由于数据稀疏的原因都不能很好地推荐长尾部分物品[2]。而给用户推荐热门物品并不是推荐系统的目的,理想的推荐系统应该为用户推荐用户感兴趣并且不容易发现的物品。……