http://www.geccocrawler.com/intro/
Gecco是一款用java语言开发的轻量化的易用的网络爬虫,不同于Nutch这样的面向搜索引擎的通用爬虫,Gecco是面向主题的爬虫。
通用爬虫一般关注三个主要的问题:下载、排序、索引。
主题爬虫一般关注的是:下载、内容抽取、灵活的业务逻辑处理。
Gecco的目标是提供一个完善的主题爬虫框架,简化下载和内容抽取的开发,利用管道过滤器模式,提供灵活的内容清洗和持久化处理模式,让开发人员把更多的精力投入到与业务主题相关的内容处理上。