怎么利用爬虫技术抓取淘宝搜索页面的产品信息

 我来答

2个回答

#热议# 什么是淋病？哪些行为会感染淋病？

数阔八爪鱼采集器丨RPA机器人
2021-07-28 · 前往八爪鱼RPA应用市场，免费获取机器人

数阔八爪鱼采集器丨RPA机器人

向TA提问

关注

展开全部

可以通过requests库re库进行淘宝商品爬虫爬取
import requests
import re
def getHTMLText(url):
try:
r= requests.get(url,timeout=30)
r.raise_for_status()
r.encoding = r.apparent_encoding
return r.text
except:
return ""

def parsePage(ilt,html):
try:
plt = re.findall(r'\"view_price\":\"[\d+\.]*\"',html)
tlt = re.findall(r'\"raw_title\"\:\".*?\"',html)
for i in range(len(plt)):
price = eval(plt[i].split(':')[1])
title = eval(tlt[i].split(':')[1])
ilt.append([price,title])
except:
print("F")

def printGoodsList(ilt):
tplt = "{:4}\t{:8}\t{:16}"
print(tplt.format("序号","价格","商品名称"))
count = 0
for g in ilt:
count = count +1
print(tplt.format(count,g[0],g[1]))

def main():
goods = '书包'
depth = 2
start_url = "https://s.taobao.com/search?q="+ goods
infoList = []
for i in range(depth):
try:
url = start_url +'&s='+str(44*i)
html = getHTMLText(url)
parsePage(infoList,html)
except:
continue
printGoodsList(infoList)
main()
这段代码在过去是可以爬取淘宝商品信息，但是因为淘宝的反扒技术升级，便不能让你大摇大摆地进出自如了。
此外也可以借助采集实现采集

已赞过 已踩过<

评论收起

柚鸥ASO
2024-03-16 广告

「柚鸥ASO」在ASO这块就做的蛮不错的,一直专注于应用商店优化,因为专注所以专业;专注应用商店下载量优化、评分优化、关键词排名优化、关键词覆盖、产品权重提升等等整体方案优化服务柚鸥网络-全球ASO优化服务商专注ASO优化已11年！（效果说... 点击进入详情页

本回答由柚鸥ASO提供

晶佳科技
2018-01-19

知道答主

回答量：51

采纳率：60%

帮助的人：5.1万

我也去答题访问个人页

关注

展开全部

写个脚本定时抓取制定网页地址，通过正则表达式匹配过滤想要的数据整理成自己想要的格式（比如excel）。
PHP 语言的话，可以用 file_get_content、curl。
Linux 可以用 curl wget 等。

已赞过 已踩过<

评论收起

推荐律师服务：若未解决您的问题，请您详细描述您的问题，通过百度律临进行免费专业咨询

您可能关注的内容

爬虫作用-数据采集就用后羿采集器-小白神器，一键采集

基于人工智能算法的新一代智能爬虫作用，不需要配置采集规则，一键采集!导出采集结果无数量限制~不要积分~~

www.houyicaiji.com广告

怎么利用爬虫技术抓取淘宝搜索页面的产品信息

您可能关注的内容

其他类似问题

为你推荐：