如何利用python写爬虫程序

 我来答
思念是一种醉过
高粉答主

2018-04-04 · 每个回答都超有意思的
知道大有可为答主
回答量:224
采纳率:100%
帮助的人:4.2万
展开全部

利用python写爬虫程序的方法:

1、先分析网站内容,红色部分即是网站文章内容div。

2、随便打开一个div来看,可以看到,蓝色部分除了一个文章标题以外没有什么有用的信息,而注意红色部分我勾画出的地方,可以知道,它是指向文章的地址的超链接,那么爬虫只要捕捉到这个地址就可以了。

3、接下来在一个问题就是翻页问题,可以看到,这和大多数网站不同,底部没有页数标签,而是查看更多。

4、不过在查看源文件时有一个超链接,经测试它指向下一页,那么通过改变其最后的数值,就可以定位到相应的页数上。

代码如下:

大雪花jjtd
2016-09-20 · TA获得超过437个赞
知道小有建树答主
回答量:318
采纳率:0%
帮助的人:121万
展开全部
看下这个,用requests写的,比urllib代码简单点。其次就是正则表达式,匹配到自己想要抓取的内容
http://blog.csdn.net/tangdou5682/article/details/52596863
已赞过 已踩过<
你对这个回答的评价是?
评论 收起
HDStore
2017-04-11
知道答主
回答量:4
采纳率:0%
帮助的人:4.9万
展开全部
这里有比较详细的介绍

http://blog.csdn.net/column/details/why-bug.html
本回答被提问者和网友采纳
已赞过 已踩过<
你对这个回答的评价是?
评论 收起
收起 更多回答(1)
推荐律师服务: 若未解决您的问题,请您详细描述您的问题,通过百度律临进行免费专业咨询

为你推荐:

下载百度知道APP,抢鲜体验
使用百度知道APP,立即抢鲜体验。你的手机镜头里或许有别人想知道的答案。
扫描二维码下载
×

类别

我们会通过消息、邮箱等方式尽快将举报结果通知您。

说明

0/200

提交
取消

辅 助

模 式