摘要: 摘 要: 针对传统Slope One算法在相似性计算时未考虑项目属性信息和时间因素对项目相似性计算的影响,以及推荐在当前大数据背景下面临的计算复杂度高、处理速度慢的问题,提出了一种基于聚类和Spark框架的加权Slope One算法。首先将时间权重加入到传统的项目评分相似性计算中,并引入项目属性相似性生成项目综合相似度;然后结合Canopy-K-means聚类算法生成最近邻居集;最后利用Spark计算框架对数据进行分区迭代计算,实现该算法的并行化。实验结果表明,基于Spark框架的改进算法与传统Slope One算法、基于用户相似性的加权Slope One算法相比,评分预测准确性更高,较Hadoop平台下的运行效率平均可提高3.5-5倍,更适合应用于大规模数据集的推荐。