作者:王璇; 霍义霞; 慈云飞; 史国振; 李莉搜索引擎网络爬虫larbin开源优化
摘要:网络爬虫是搜索引擎的重要组成部分,其性能直接影响搜索引擎的准确性和及时性。Larbin是一个高效、简单、功能比较完善的开源爬虫框架,基于此,介绍了几种典型的开源爬虫框架,并对其进行多维度比较;对Larbin体系结构进行详细的介绍;然后指出Larbin在程序结构和流程方面存在的不足,提出对应的优化方案;测试结果表明,改进后的方案在速度和性能方面都有所提高。
注:因版权方要求,不能公开全文,如需全文,请咨询杂志社