基于Spark的并行Eclat算法

作者：冯兴杰; 潘轩关联规则挖掘大数据spark投影树并行化

摘要：通过对Spark大数据平台以及Eclat算法的深入分析,提出了基于Spark的Eclat算法(即SPEclat)。针对串行算法在处理大规模数据时出现的不足,该方法在多方面进行改进:为减少候选项集支持度计数带来的损耗,改变了数据的存储方式;将数据按前缀进行分组,并划分到不同的计算节点,压缩数据的搜索空间,实现并行化计算。最终将算法结合Spark云计算平台的优势加以实现。实验表明该算法可在处理海量数据集时高效运行,并且在面对数据量大规模增长的情况下具备良好的可扩展性。

注：因版权方要求，不能公开全文，如需全文，请咨询杂志社

学术咨询在线咨询

计算机应用研究

《计算机应用研究》（CN：51-1196/TP）是一本有较高学术价值的大型月刊，自创刊以来，选题新奇而不失报道广度，服务大众而不失理论高度。颇受业界和广大读者的关注和好评。《计算机应用研究》杂志以其新颖性、学术性、系统性、技术性于一身，瞄准国家迫切需要的前沿技术，及时反映并涵盖了国内外计算机学科领域最新发展趋势及技术动向，注重刊登反映本学科领域的新理论、新方法、新技术，选题新颖，可读性强而备受广大读者所喜爱，在各行各业拥有大量的读者、作者，在计算机业界享有崇高的知名度和影响力。

杂志详情

服务推荐

计算机应用研究相关期刊

基于Spark的并行Eclat算法

服务推荐

在线咨询

杂志订阅

期刊推荐

网友世界

计算机光盘软件与应用

计算机与网络

计算机仿真