jsoup抓取页面源码的问题、源码被隐藏、 30
使用Documentdocument=Jsoup.parse(getHTML(url,"utf-8"));获取页面源码、http://dy.qq.com/daily.ht...
使用Document document = Jsoup.parse(getHTML(url, "utf-8"));
获取页面源码、
http://dy.qq.com/daily.htm
这个网站里面的内容、任意连接、在谷歌的FireBug下能看到HTML中的元素、查看页面源码的时候显示的样式与js文件、怎么获取到真正的页面源码、
在线等.......
以解决、htmlunit+jsoup、 展开
获取页面源码、
http://dy.qq.com/daily.htm
这个网站里面的内容、任意连接、在谷歌的FireBug下能看到HTML中的元素、查看页面源码的时候显示的样式与js文件、怎么获取到真正的页面源码、
在线等.......
以解决、htmlunit+jsoup、 展开
1个回答
展开全部
你看到的网页里面没有你想要的东西对吧?
其实它的动态内容是js异步加载的,然后根据js返回的json对象动态设置到相应的位置的。你要抓内容就不能用Document这样的东西(Jsoup),直接用http的请求访问那些返回json对象的url,并把返回的东西解析成json对象,里面就有你想要的数据了。下一步就看你怎么利用这些数据了。
其实它的动态内容是js异步加载的,然后根据js返回的json对象动态设置到相应的位置的。你要抓内容就不能用Document这样的东西(Jsoup),直接用http的请求访问那些返回json对象的url,并把返回的东西解析成json对象,里面就有你想要的数据了。下一步就看你怎么利用这些数据了。
已赞过
已踩过<
评论
收起
你对这个回答的评价是?
推荐律师服务:
若未解决您的问题,请您详细描述您的问题,通过百度律临进行免费专业咨询