HI,欢迎来到学术之家,发表咨询:400-888-7501  订阅咨询:400-888-7502  股权代码  102064
0

一种基于信息熵的web信息提取的方法研究

作者:张云雷web内容挖掘信息提取dom

摘要:web页的噪声数据影响了文本提取算法的效率。提出了基于信息熵和DOM树的提取web正文信息的方法,利用文档对象模型技术提取网页包含的内容,将得到的信息融合成信息列表,再利用熵原理从信息列表中识别出网站的真正重复信息和正文信息。实验结果验证了方法的有效性。

注:因版权方要求,不能公开全文,如需全文,请咨询杂志社

科技资讯

《科技资讯》(半月刊)创刊于2003年,由北京市科学技术研究院主管,北京国际科技服务中心;北京合作创新国际科技服务中心主办,CN刊号为:11-5042/N,自创刊以来,颇受业界和广大读者的关注和好评。 《科技资讯》主要刊登中外新技术、新材料、新设备、新工艺及融投资项目的新资讯,并刊发能反映中外新技术发展动态,新产品开发进展及概述各学科新发展方向的内容。杂志社现向各级政府机关、相关单位、学校等征集学术论文。

杂志详情