作者:罗永莲; 张永奎新闻网页主题内容抽取网页去重权值计算
摘要:网页检索结果中,用户经常会得到内容相同的冗余页面。它们不但浪费了存储资源,而且给信息检索或其它文本处理带来诸多不便。论文在抽取出新闻标题、主题内容和日期的前提下,依据新闻的时间性(易碎性),按日期分“群”,对冗余网页去重方法进行了探索性研究,从而很大程度地缩小了计算时间,提高了去重准确性。
注:因版权方要求,不能公开全文,如需全文,请咨询杂志社
《计算机工程与应用》(CN:11-2127/TP)是一本有较高学术价值的大型半月刊,自创刊以来,选题新奇而不失报道广度,服务大众而不失理论高度。颇受业界和广大读者的关注和好评。
部级期刊
人气 230975 评论 65
人气 216794 评论 35
省级期刊
人气 214075 评论 71
北大期刊、统计源期刊
人气 193667 评论 73