HI,欢迎来到学术之家,发表咨询:400-888-7501  订阅咨询:400-888-7502  股权代码  102064
0

基于重复模式识别的网页信息抽取研究

作者:李志义; 沈之锐重复模式信息抽取编辑距离聚类

摘要:【目的/意义】随着Web网页的爆炸式增长和网页噪声不断增多,企业竞争情报系统和智能化网站的开发以及移动终端的阅读都急需一种可以高效精确抽取网页信息的方法。【方法/过程】本文提出了基于重复模式识别的信息提取新方法,通过页面解析、相似度计算、聚类并形成群组、删除横幅广告和导航链接等步骤,提取到了详情页面的标题和主要内容。【结果/结论】对于结构稳定的页面,本文实现了较高质量的信息抽取。不足之处是聚类和相似度的计算量较大,时间较长。

注:因版权方要求,不能公开全文,如需全文,请咨询杂志社

情报科学

《情报科学》(月刊)创刊于1980年,由国家教育部主管,中国科学技术情报学会、吉林大学主办,CN刊号为:22-1264/G2,自创刊以来,颇受业界和广大读者的关注和好评。 《情报科学》内容涉及高校图书馆网络化建设、现代信息业发展、多媒体技术、情报人员结构等方面,本着求实创新的理念,始终站在学科研究的前沿,全面反映学科发展的动态,着力突出刊物与时俱进的时代特征,抓住图书情报界的研究热点,刊发了一大批既有理论水平,又有学术影响的重要论文,及时反映了情报学、信息管理、图书馆学等诸领域的最新研究进展。

杂志详情