用python如何得到HTML标签外面的文本?
用python如何得到HTML标签外面的文本?比如下面的HTML:<ahref='xxx.xxx'title='xxx.xxx.xxx'>atexttosee</a>我想...
用python如何得到HTML标签外面的文本?
比如下面的HTML:
<a href='xxx.xxx' title='xxx.xxx.xxx'>a text to see</a>
我想得到“a text to see”这部分的文本,要用什么模块,或者是什么方法?
或者用正则表达式的话,要怎么写? 展开
比如下面的HTML:
<a href='xxx.xxx' title='xxx.xxx.xxx'>a text to see</a>
我想得到“a text to see”这部分的文本,要用什么模块,或者是什么方法?
或者用正则表达式的话,要怎么写? 展开
1个回答
展开全部
正则的话
import re
html = "<a href='xxx.xxx' title='xxx.xxx.xxx'>sample text1</a>abcdef<a href='xxx.xxx' title='xxx.xxx.xxx'>sample text2</a>"
result = map(lambda name: re.sub("<a href=.*?>","",name.strip().replace("</a>","")), re.findall("<a href=.*?>.*?</a>",html))
print result
上面代码会把所有a tag里的东西存在result这个list里面。另外python有个模块叫Beautiful Soup,专门用来处理html的,你有空可以看下
推荐律师服务:
若未解决您的问题,请您详细描述您的问题,通过百度律临进行免费专业咨询