Python爬虫是什么？

 我来答

9个回答

#热议# 不吃早饭真的会得胆结石吗？

数阔八爪鱼采集器丨RPA机器人
2021-06-24 · 前往八爪鱼RPA应用市场，免费获取机器人

数阔八爪鱼采集器丨RPA机器人

向TA提问

关注

展开全部

网络爬虫（又被称为网页蜘蛛，网络机器人，在FOAF社区中间，更经常的称为网页追逐者），是一种按照一定的规则，自动地抓取万维网信息的程序或者脚本。另外一些不常使用的名字还有蚂蚁、自动索引、模拟程序或者蠕虫。
其实通俗的讲就是通过程序去获取web页面上自己想要的数据，也就是自动抓取数据。
爬虫可以做什么？
你可以用爬虫爬图片，爬取视频等等你想要爬取的数据，只要你能通过浏览器访问的数据都可以通过爬虫获取。
爬虫的本质是什么？
模拟浏览器打开网页，获取网页中我们想要的那部分数据
浏览器打开网页的过程：
当你在浏览器中输入地址后，经过DNS服务器找到服务器主机，向服务器发送一个请求，服务器经过解析后发送给用户浏览器结果，包括html,js,css等文件内容，浏览器解析出来最后呈现给用户在浏览器上看到的结果。
所以用户看到的浏览器的结果就是由HTML代码构成的，我们爬虫就是为了获取这些内容，通过分析和过滤html代码，从中获取我们想要资源。

已赞过 已踩过<

评论收起

兔震特i
2020-11-09 · TA获得超过978个赞

知道大有可为答主

回答量：3288

采纳率：77%

帮助的人：96.8万

我也去答题访问个人页

关注

展开全部

爬虫一般是指网络资源的抓取，由于Python的脚本特性，易于配置对字符的处理非常灵活，Python有丰富的网络抓取模块，因此两者经常联系在一起Python就被叫作爬虫。

Python爬虫的构架组成：

Python的工作流程则：

已赞过 已踩过<

评论收起

科技黑_
2020-11-09 · 超过89用户采纳过TA的回答

知道小有建树答主

回答量：443

采纳率：87%

帮助的人：13.5万

我也去答题访问个人页

关注

展开全部

Python

就是一个程序，他把网页源代码下载下来，然后，用字符串提取的方式提取里面有效的信息，然后再把这个网页里的所有链接，再以同样的方式访问下载，然后再找里面的链接。周而复始，这样就可以慢慢的像虫子一样爬满整个网络的网页信息了，简单说叫数据采集。

已赞过 已踩过<

评论收起

老男孩教育
2021-02-21 · 百度认证:北京一天天教育科技有限公司官方账号,教育领域创作者

老男孩教育

专注于Linux高级运维、Python开发、大数据培训，为您分享行业前沿的技术，有效的学习方法和有价值的学习资料。

向TA提问

关注

展开全部

爬虫又叫做网络爬虫，可以理解为蜘蛛在网络上进行爬行，互联网是一个巨大的网络，爬虫就是行走在网络上的爬虫，遇到自己喜欢的食物，就会抓取下来，抓取网络资源。
而Python是最适合爬虫的语言，因为Python本身上就是一种比较简单的编程语言，适合零基础人员，更适合初学者学习，门槛低、功能强大;从实际情况上来说，爬虫是Python里面较为简单的课程，学习起来并不是非常困难的，简单的说，只要能在网络上看到的数据都是可以爬取的，大多数的爬虫都是通过发送请求-获取页面-解析页面-提取和存储内容来实现，实际就是用来获取网页的信息。

已赞过 已踩过<

评论收起

xiexie20172018
2021-02-05 · 超过30用户采纳过TA的回答

知道答主

回答量：604

采纳率：77%

帮助的人：26.6万

我也去答题访问个人页

关注

展开全部

为自动提取网页的程序，它为搜索引擎从zhi万维网上下载网页。网络爬虫为一个自动提取网页的程序，它为搜索引擎从万维网上下载网页，是搜索引擎的重要组成。传统爬虫从一个或若干初始网页的URL开始，获得初始网页上的URL，在抓取网页的过程中，不断从当前页面上抽取新的URL放入队列,直到满足系统的一定停止条件。将根据一定的搜索策略从队列中选择下一步要抓取的网页URL，并重复上述过程，直到达到系统的某一条件时停止。另外，所有被爬虫抓取的网页将会被系统存贮，进行一定的分析、过滤，并建立索引，以便之后的查询和检索。

已赞过 已踩过<

评论收起

更多回答（7）

推荐律师服务：若未解决您的问题，请您详细描述您的问题，通过百度律临进行免费专业咨询

Python爬虫是什么？

其他类似问题

为你推荐：