作者:陈鹤年 季文天 王成 李俊青gzip编码网络爬虫搜索引擎
摘要:搜索引擎是互联网上最热门的基础应用之一,搜索引擎主要有三部分组成,网页抓取(Web Crawler),建立索引(Indexing)和搜索(Searching)。该文阐述了网页爬取部分爬虫的设计,并就其中两项关键技术Gzip解压和UTF-8编码进行了详细的阐述,解决了网页爬的通用型问题,并为第三部分搜索提供直接支持。
注:因版权方要求,不能公开全文,如需全文,请咨询杂志社
《电脑知识与技术》(CN:34-1205/TP)是一本有较高学术价值的大型旬刊,自创刊以来,选题新奇而不失报道广度,服务大众而不失理论高度。颇受业界和广大读者的关注和好评。 《电脑知识与技术》是一本面向计算机全行业的综合性学术刊物。编委委员均来自国内各著名高校的教授和博士生导师,他们是我国计算机科学领域方面的专家、学者和权威人士;稿源来自全国各高等院校,相关专业研究机构以及国内大型信息通讯、软件研发企业设置的专业研究所。
省级期刊
人气 366846 评论 69
部级期刊
人气 324413 评论 34
人气 252857 评论 66
人气 250479 评论 47