windows下构建的nutch1.2 网页爬取问题

我是在windows下构建的nutch1.2现在我想要对中学校园网进行爬取在url中加入了五个中学校园网网址但结果只能搜到第一个网址的主页我在网上也找不到相应的解决办法困... 我是在windows下构建的nutch1.2 现在我想要对中学校园网进行爬取 在url中加入了五个中学校园网网址 但结果只能搜到第一个网址的主页
我在网上也找不到相应的解决办法 困惑已久 烦请指点哈
展开
 我来答
erliang20088
2013-05-11 · TA获得超过2496个赞
知道小有建树答主
回答量:926
采纳率:100%
帮助的人:955万
展开全部
提供点解决思路:
1、从后台的抓取部分着手解决问题。多数是由于URL地址写法和nutch的网址过滤规则不符引起的。
2、将五个拆成一个一个的去写到种子文件中去采,看看哪个采不到,再针对性的去找原因。
3、多查日志才是王道。
推荐律师服务: 若未解决您的问题,请您详细描述您的问题,通过百度律临进行免费专业咨询

为你推荐:

下载百度知道APP,抢鲜体验
使用百度知道APP,立即抢鲜体验。你的手机镜头里或许有别人想知道的答案。
扫描二维码下载
×

类别

我们会通过消息、邮箱等方式尽快将举报结果通知您。

说明

0/200

提交
取消

辅 助

模 式