Larbin 一种高效的搜索引擎爬虫工具:Search Engine搜索引擎研究

来源：百度文库编辑：神马文学网时间：2024/04/29 09:54:36

Larbin 一种高效的搜索引擎爬虫工具
离开dallas已经整整十天了，基本上除了到处见见人之外基本上没有其它的时间来学习新知识，也没有空将要完成的工作收尾。
Niu.la ，Booso，luliang.dhs.org 和 wespoke 相继宕机，看来年底各个地方的维护都不力。
itseek的开发者多次问起 larbin 的事情，我就在这里对larbin做一个简单的介绍。因为相对于复杂的系统来讲，larbin具有高度的可配置性，和良好的工作效率。
１］larbin的简介
larbin是一种开源的网络爬虫/网络蜘蛛，由法国的年轻人Sébastien Ailleret独立开发。larbin目的是能够跟踪页面的url进行扩展的抓取，最后为搜索引擎提供广泛的数据来源。
Larbin只是一个爬虫，也就是说larbin只抓取网页，至于如何parse的事情则由用户自己完成。另外，如何存储到数据库以及建立索引的事情 larbin也不提供。
latbin最初的设计也是依据设计简单但是高度可配置性的原则，因此我们可以看到，一个简单的larbin的爬虫可以每天获取５００万的网页，实在是非常高效。
2] Larbin的性能特征
高效是我对 larbin 的评价。
今年四月份的时候我对larbin的性能做过一个测试，luliang.dhs.org是我自己常用的服务器，CPU 为1G，内存512，其它的性能一般，因为是三年前购置的。
我将我自己的网页六翼作为入口，运行larbin进行５层内的url的抓取。
当时纪录的一些数据：
Internet IO: 500-700k/per second （我想大约我的网络下载的瓶颈了吧）
CPU top: 5%-15%
disk consume: 1M/s ，基本上一个小时爬 3个G 的网页。差不多20万的页面
url 解析: 200万－300万每小时
3] larbin 的作用
很多人初见 larbin 不知道从哪里下手，那么我来简单介绍一下 larbin 的功能和实际应用。
1. larbin 获取单个、确定网站的所有联结，甚至可以镜像一个网站。
2. larbin建立 url 列表群，例如针对所有的网页进行 url retrive后，进行xml的联结的获取。或者是 mp3 。
3. larbin 定制后可以作为搜索引擎的信息的来源（例如可以将抓取下来的网页每2000一组存放在一系列的目录结构里面）。
总归，larbin应当是一个被广大搜索引擎爱好者应当引起注意的一个产品，虽然其功能逐渐被 Nutch 所接受和替代，但是其在爬虫上的优美设计的确值得称道。

Larbin 一种高效的搜索引擎爬虫工具:Search Engine搜索引擎研究 Google的启示:Search Engine搜索引擎研究搜索引擎spam的防止:Search Engine搜索引擎研究 4.Google的启示:Search Engine搜索引擎研究博客搜索和博客联播发布:Search Engine搜索引擎研究博客搜索和博客联播发布:Search Engine搜索引擎研究分布式搜索引擎search.minty dowser类聚引擎和larbin蜘蛛博客搜索引擎（blog search engine）搜索引擎营销(SEM)Search Engine Marketing 相关度计算与信噪比:Search Engine搜索引擎研究十七闪光的不一定是金子谈谈搜索引擎作弊问题(Search Engine Anti-SPAM) dySE：一个 Java 搜索引擎的实现--网络爬虫搜索引擎搞搞Search新意思利用Yahoo! Search API开发自已的搜索引擎-php版利用Yahoo! Search API开发自已的搜索引擎-php版几个非常独特的搜索引擎、工具几个非常独特的搜索引擎、工具0 几个非常独特的搜索引擎、工具! search engine 毕业设计中怎样用python写一个搜索引擎的分布式爬虫---异样的美感 - CSharpP... 搜索引擎优化工具搜索引擎搜索引擎搜索引擎