作者:张舒雅; 王占刚spark用户特征贝叶斯分类
摘要:使用朴素贝叶斯分类算法,结合Spark内存计算框架,对用户观看视频及次数信息进行分析,建立用户性别和年龄区间的分类模型;然后利用特征项的权重优化模型,考虑到每个特征项在各个类别中的权重对分类结果的影响,提出了一种基于特征项与类别间相关性的TFC—IDFC权重计算方法,并与传统的TF—IDF权重计算方法进行比较,通过正确率和F1值两个指标,证明考虑到特征项与类别的相关性所提出的TFC—IDFC权重使得分类模型的分类能力更好。
注:因版权方要求,不能公开全文,如需全文,请咨询杂志社