作者:赵德平 蔡立静 李鹏 刘阳空间向量模型网页标题主题相关度布尔模型主题爬虫
摘要:首先,给出了主题爬虫的概念;然后介绍了主题相关度计算的两种模型:布尔模型和空间向量模型;通过对两种模型进行分析,提出了一种基于网页标题的空间向量模型主题相关度计算方法Relative。经过试验分析,该算法具有很好的实用性,基于该算法的主题爬虫系统能够在Web上爬取高度主题相关的网页,极大的提高了网络爬虫的效率。
注:因版权方要求,不能公开全文,如需全文,请咨询杂志社
《计算机光盘软件与应用》是一本有较高学术价值的大型半月刊,致力于创办以创新、准确、实用为特色,突出综述性、科学性、实用性,及时报道国内外计算机技术在科研、教学、应用方面的研究成果和发展动态,为国内计算机同行提供学术交流的平台。自创刊以来,选题新奇而不失报道广度,服务大众而不失理论高度,颇受业界和广大读者的关注和好评。
杂志详情