java如何用lucene+nutch搭建分布式搜索引擎？

 我来答

2个回答

#热议# 空调使用不当可能引发哪些疾病？

hjgdsqswi
2011-07-16 · TA获得超过404个赞

知道答主

回答量：484

采纳率：0%

帮助的人：287万

我也去答题访问个人页

关注

展开全部

1.可以用lucene,lucene现在已经发展到1.9.1版了,相当稳定,网上中英文资源很丰富,甚至关于这个工具包的书(lucene in action)都有了.如果只是做站内搜索,可以直接从读数据库中读数据,调用lucene做索引.再写一个前台查询界面,调用lucene查询索引并在前台显示结果.

想一点程序都不写的话可以参考下面2个方案

2.用heritrix + nutchwax,heritrix也是一个很成熟的crawler,他将网页下载并压缩保存到arc格式的文件中,一个arc文件一般100兆左右,heritrix不解析提取网页的内容,nutchwax负责解析网页,提取内容并建索引,nutchwax提供检索界面.缺点是nutchwax的安装很麻烦.

3.用nutch,一个超强的开源软件,作者就是lucene的作者,该软件的目标是做到和Google一样强大,nutch的很多分布式实现的思想来源于Google,目前已实现分布式crawler,和分布式检索,已经有人用他抓了几亿的网页,nutch功能包括了下载网页,解析网页,计算网页重要度,建索引,前台搜索等一个搜索引擎需要的绝大部分功能,用他来做站内搜索也很方便.该软件支持中文. nutch目前稳定的版本是0.7.2 用该软件的缺点是网上的中文资料不多.你要习惯看英文资料

已赞过 已踩过<

评论收起

探索角色
2011-07-15

知道答主

回答量：13

采纳率：100%

帮助的人：9万

我也去答题访问个人页

关注

展开全部

具体你可以看一下这篇笔记。

参考资料： http://blog.csdn.net/calvinxiu/article/details/1040623

已赞过 已踩过<

评论收起

推荐律师服务：若未解决您的问题，请您详细描述您的问题，通过百度律临进行免费专业咨询

java如何用lucene+nutch搭建分布式搜索引擎？

其他类似问题

为你推荐：