nutch在windows中安装之细解
近来nutch一词在网络中时有所见,但囿于平常工作繁忙而未能潜心细读与研究,只知道nutch是apache组织的一个开源项目,利用它用户可以建立自己内部网的搜索引擎,也可以建立针对整个网络的搜索引擎。好在春节假日期间,终于得空可以从容对其进行一番解读与测试了。在使用nutch之前,当然是需要先对其进行安装了。用搜索引擎查找了一下相关内容,发现大部分关于nutch如何安装的文章都是基于linux的,而基于windows安装的文章虽有,但非常简略。由于运行nutch自带的脚本命令需要linux的环境,所以必须首先安装cygwin来模拟这种环境,而cygwin本身的安装与使用也不是一件简单的事。下面,就让笔者对nutch在windows系统中的安装进行一番细解吧!
1、安装cygwin
首先,我们去http://www-inst.eecs.berkeley.edu/~instcd/iso/下载到cygwin软件的iso文件,用daemon软件将其设为虚拟光驱后,双击其中的setup文件,出现程序安装的向导界面(如图1所示)。
点击“下一步”后,安装向导要求选择cygwin的安装方式,如图2所示:

图示中共有三种安装方式:
(1)install from internet:从internet上下载并安装软件;
(2)download without installing:从internet上下载安装的文件,但暂时不安装;
(3)install from local directory:从本地含有安装文件的目录进行安装。
我们选择第三项“install from local directory”后,点击“下一步”,如图3所示:

安装向导要求选择cygwin的安装路径,我们可以在“root directory”文本框中更改安装路径,点击“下一步”,如图4所示:

安装向导要求选择cygwin安装文件所在的本地存储路径,可以在“local package directory”中设置,点击“下一步”,如图5所示:

安装向导显示出所要安装的内容列表,用户可以根据自己的实际需要来决定安装哪些程序。点击循环箭头图标后面的文字,可以更改安装的方式,常用的方式有default(表示只安装缺省的安装项)、install(表示安装全部程序,空间要求较大)、reinstall(表示重新安装程序)。推荐选择“install”方式,一步到位,以免后扰,不过用户应保证至少有2g以上的空间可供使用。点击“下一步”后,就开始正式的安装了(如图6所示)。

最后出现如图7所示的窗口,点击“完成”后,cygwin安装完毕。

至此,笔者还要对cygwin再多说几句。cygwin是一个在windows平台上模拟运行unix的环境,用户可以通过它来熟悉与学习unix系统的操作。对于unix系统还不甚熟悉的读者可以参阅笔者之前写作的《unix操作系统的入门与基础》、《unix的轻巧“约取而实得”》系列文章,下文中对涉及使用到的unix命令将不再给予详细解释。
2、安装nutch
去http://mirror.vmmatrix.net/apache/lucene/nutch/下载到nutch的最新版本,将其解压到指定目录中,如笔者是将其解压到i:/nutch-0.7.1中。
3、测试nutch命令
在运行nutch的脚本命令前,需要设置一些环境变量。cygwin提供了一个名为cygwin.bat的文件,通过它可以自动完成必需环境变量的设置。该文件可在cygwin所在的根目录下找到,感兴趣的读者还可通过ultraedit等编辑器打开该文件一查究竟。其实cygwin安装完成之后,会在windows系统桌面生成一图标,如图8所示:

此图标就是cygwin根目录下cygwin.bat文件的快捷方式,双击此图标将打开一类似dos窗口。由于先前笔者将nutch的压缩包解压至i:/nutch-0.7.1中,故在此命令窗口中输入命令“cd /cygdrive/i/nutch-0.7.1”,读者可根据自己的安装路径进行相应的修改,然后使用命令“ls -l”可查看nutch-0.7.1中的所有子目录及文件信息。执行命令“bin/nutch”,如果读者能看到如图9所示的提示,那恭喜你,nutch在windows系统中的安装已经大功告成了!

至于nutch的使用,且待后续分解:)
参考文献:
1、getting nutch running with windows
2、nutch 初体验
3、nutch 于 winxp
4、cygwin使用指南
闽公网安备 35060202000074号