如何设置python爬虫的爬取时间

 我来答

1个回答

#热议# 网上掀起『练心眼子』风潮，真的能提高情商吗？

午夜DJ233
2017-05-17 · 知道合伙人教育行家

午夜DJ233
知道合伙人教育行家

采纳数：1286 获赞数：5771

向TA提问私信TA

关注

展开全部

由于项目需求收集并使用过一些爬虫相关库，做过一些对比分析。以下是我接触过的一些库：

Beautiful Soup。名气大，整合了一些常用爬虫需求。缺点：不能加载JS。
Scrapy。看起来很强大的爬虫框架，可以满足简单的页面爬取（比如可以明确获知url pattern的情况）。用这个框架可以轻松爬下来如亚马逊商品信息之类的数据。但是对于稍微复杂一点的页面，如weibo的页面信息，这个框架就满足不了需求了。

Python基础教程
mechanize。优点：可以加载JS。缺点：文档严重缺失。不过通过官方的example以及人肉尝试的方法，还是勉强能用的。
selenium。这是一个调用浏览器的driver，通过这个库你可以直接调用浏览器完成某些操作，比如输入验证码。
cola。一个分布式爬虫框架。项目整体设计有点糟，模块间耦合度较高，不过值得借鉴。

以下是我的一些实践经验：

对于简单的需求，比如有固定pattern的信息，怎么搞都是可以的。
对于较为复杂的需求，比如爬取动态页面、涉及状态转换、涉及反爬虫机制、涉及高并发，这种情况下是很难找到一个契合需求的库的，很多东西只能自己写。

至于题主提到的：
还有，采用现有的Python爬虫框架，相比与直接使用内置库，优势在哪？因为Python本身写爬虫已经很简单了。
third party library可以做到built-in library做不到或者做起来很困难的事情，仅此而已。还有就是，爬虫简不简单，完全取决于需求，跟Python是没什么关系的。

本回答由提问者推荐

已赞过 已踩过<

评论收起

推荐律师服务：若未解决您的问题，请您详细描述您的问题，通过百度律临进行免费专业咨询

您可能关注的内容

虎课网爬虫python能做什么，python学习基础从入门到熟练运用!

爬虫python能做什么，python自学教程，，python3爬虫教程，python进阶教程，各种编程教程应有尽有，python系统性学习知识全面讲解，颠覆传统教学模式，随时随地，快学快用

www.huke88.com广告

通用人工智能网:征文奖励500元，python千字科技原创文章

www.opensnn.com

如何设置python爬虫的爬取时间

您可能关注的内容

其他类似问题

为你推荐：