java和Python哪个适合写爬虫?

 我来答
科技黑_
2020-11-23 · 超过89用户采纳过TA的回答
知道小有建树答主
回答量:443
采纳率:87%
帮助的人:13.5万
展开全部
当然是Python,一般我们都口语化说Python爬虫,爬虫工程师都是用python语言。
Python独特的优势是写爬虫的关键。1)跨平台,对Linux和windows都有不错的支持;2)科学计算、数值拟合:Numpy、Scipy;3)可视化:2d:Matplotlib, 3d: Mayavi2;4)复杂网络:Networkx、scrapy爬虫;5)交互式终端、网站的快速开发。
用Python爬取信息的方法有三种:
1、正则表达式。实现步骤分为五步:1)在tomcat服务器端部署一个html网页;2)使用URL与网页建立联系;3)获取输入流,用于读取网页中的内容;4)建立正则规则;5)将提取到的数据放到集合中。
2、BeautifulSoup。
Beautiful Soup支持各种html解析器,包括python自带的标准库,还有其他的许多第三方库模块。其中一个是lxml parser。借助网页的结构和属性等特性来解析网页的工具,有了它我们不用再去写一些复杂的正则,只需要简单的几条语句就可以完成网页中某个元素的提取。
3、Lxml。Lxml是Python的一个解析库,支持HTML和XML的解析,支持xpath解析方式,而且解析效率非常高。Lxml主要解决三个问题:1)有一个XML文件,如何解析;2)解析后,如果查找、定位某个标签;3)定位后如何操作标签,比如访问属性、文本内容等。
当网页结构简单并且想要避免额外依赖(不需要安装库),使用正则表达式更为合适。当需要爬取数据量较少时,使用较慢的BeautifulSoup也可以的。当数据量大时,需要追求效益时,Lxml时最好选择。
爬虫是一个比较容易上手的技术,也许你看一篇文档就能爬取单个网页上的数据。但对于大规模爬虫,并不是1*n这么简单,因此很多企业都在高薪招聘Python精英人才。
数阔八爪鱼采集器丨RPA机器人
2021-08-05 · 前往八爪鱼RPA应用市场,免费获取机器人
数阔八爪鱼采集器丨RPA机器人
向TA提问
展开全部
这问题问的,会哪个哪个好,你会java,就用java写的好,会Python,就用Python写的好,难道还为了写爬虫而特地学一门语言?
选你最熟练的用。
本回答被网友采纳
已赞过 已踩过<
你对这个回答的评价是?
评论 收起
贝爷心中留
2020-11-22 · TA获得超过1.9万个赞
知道大有可为答主
回答量:4700
采纳率:45%
帮助的人:717万
展开全部
python呗,爬虫的核心应该是放在页面分析上,所以python调包在代码方面的简洁就十分合时宜了
已赞过 已踩过<
你对这个回答的评价是?
评论 收起
且听风吟看风景
2020-11-23 · TA获得超过547个赞
知道小有建树答主
回答量:1724
采纳率:87%
帮助的人:66.9万
展开全部
当然是Python!相比与java,,python抓取网页文档的接口更简洁;相比其他动态脚本语言,如perl,shell,python的urllib2包提供了较为完整的访问网页文档的API。
已赞过 已踩过<
你对这个回答的评价是?
评论 收起
蜜橙TLhdU
2020-11-23 · 超过75用户采纳过TA的回答
知道小有建树答主
回答量:443
采纳率:100%
帮助的人:19.6万
展开全部
网络爬虫又称网络蜘蛛、网络蚂蚁、网络机器人等,可以自动化浏览网络中的信息,当然浏览信息的时候需要按照我们制定的规则进行,这些规则我们称之为网络爬虫算法。使用Python可以很方便地编写出爬虫程序,进行互联网信息的自动化检索。
已赞过 已踩过<
你对这个回答的评价是?
评论 收起
收起 更多回答(5)
推荐律师服务: 若未解决您的问题,请您详细描述您的问题,通过百度律临进行免费专业咨询

为你推荐:

下载百度知道APP,抢鲜体验
使用百度知道APP,立即抢鲜体验。你的手机镜头里或许有别人想知道的答案。
扫描二维码下载
×

类别

我们会通过消息、邮箱等方式尽快将举报结果通知您。

说明

0/200

提交
取消

辅 助

模 式