如何用shell获取html网页中指定的文本数据

 我来答

1个回答

#热议# 上班途中天气原因受伤算工伤吗？

育知同创教育
2017-07-11 · 百度知道合伙人官方认证企业

育知同创教育

1【专注：Python+人工智能|Java大数据|HTML5培训】 2【免费提供名师直播课堂、公开课及视频教程】 3【地址：北京市昌平区三旗百汇物美大卖场2层，微信公众号：yuzhitc】

向TA提问

关注

展开全部

import sys

from lxml import etree

reload(sys)

sys.setdefaultencoding("utf8")

import requests

r = requests.get('http://best.pconline.com.cn/')

html =  r.text

xmlhtml  =  etree.HTML(html)

content = xmlhtml.xpath('//div[starts-with(@id,"topic")]/div[1]/a[2]/text()')

urllist = xmlhtml.xpath('//div[starts-with(@id,"topic")]/div[1]/a[2]/@href')

lastime  = xmlhtml.xpath('//div[starts-with(@id,"topic")]/div[2]/div[2]/span[2]/text()')

data_text = [ text for text in content ]

data_url  = [ url for url in urllist ]

data_time = [ t.strip() for t in lastime ]

for i  in  xrange(0, len(data_text), 1):

print "%s, %s, %s"  % (data_text[i], data_url[i], data_time[i])

本回答被提问者采纳

已赞过已踩过<

你对这个回答的评价是？
评论收起