本篇由 下位子 投稿,这是下位子的第2篇投稿
昨天LZ去面试,遇到一个大牛,被血虐一番,发现自己基础还是很薄弱,对java一些原理掌握的还是不够稳固,比如java反射注解,知道一点就是说不出来,很尴尬... 生命不止,学习不止啊
PS :有兴趣的加入Android工程师交流QQ群:752016839 主要针对Android开发人员提升自己,突破瓶颈,相信你来学习,会有提升和收获。
之前那个项目 QNews 用的是的第三方的数据平台,所以访问次数会有限制,这就很无奈。。。
每天只能请求100次....但是LZ这个穷屌丝也买不起服务器,所以就上网查,有什么别的方法可以获取数据,意外之间发现了jsoup这个强大的框架,就花了上午时间学习了一下,然后下午做了一个小Demo,功能比较单一,请见谅。
其实一开始的时候是想 爬今日头条的数据,但是发现数据总是为空,我估计是上锁了... 然后就把矛头转向了 简书,哈哈哈...果然简书就是好,数据直接就可以爬到了, 好开心啊!! 项目地址:https://github.com/xiaweizi/jsoupJianshuDemo
先演示一波动态图:
话说这个布局就花了我半个小时...
一些基础的我就不说了,就简单说明一下我的数据是如何爬到的。可以直接去看一下我的源码,写的比较仓促,一些细节没有处理好,多多指教。
1
准备
1.1、相关资料
官方文档:https://jsoup.org/cookbook/
中文文档:http://www.open-open.com/jsoup/
1.2、添加依赖
compile 'org.jsoup:jsoup:1.9.2'
1.3、打开简书首页
在单个部分上 右击,然后点击检查选项(我用的是QQ浏览器,其他未尝试),底部就会跳出网页的源码,并且会跟踪到这个item对应的源码。
从上图可以大概了解到每个<li></li>
标签里的内容就是我们每个item的信息。
2
爬数据
2.1、获取 Document 对象
Document document = Jsoup.connect("http://www.jianshu.com/") .timeout(10000) .get();
这里通过建立与服务器的链接,并设置10s的超时连接来获取
Document
对象
2.2、获取跟标签的 Elements 对象
找到文章列表模块,发现 <ul class="note-list></ul>
是我们需要信息的跟标签。通过 select
方法查询节点所有信息。
for (Element element : li) { ... }
下面全部都是 li标签的列表,里面的内容大致相似,我们就可以通过循环来遍历里面的信息。
2.3、获取每个部分所有信息
因为信息比较多,我就选择比较有代表性的来将一下。
有个非常简单的方式:直接在你需要获取内容的部分右击,点击 检查,就可以直接追踪到要查询的位置。
2.3.1、标题
就拿标题而言,直接在标题右击-->检查,即可,一目了然。然后我把数据截图一下。
通过
select
查询节点信息,然后.text
获取里面文本内容。
2.3.2、头像
这个就是先找到头像 节点,然后图片节点,最后通过
attr
获取图片url
2.3.3、首页链接
这里注意
href
元素,他存放的就是跳转链接,不过是相对路径,这个时候就需要通过attr("abs:href")
获取绝对路径。
其他 就 大同小异,其实我知道也就这么多,也是不断尝试通过打印得出来的,还是比较心酸的,比较没学过 js,不过对 js 挺有兴趣的。
3
封装
剩下的就是将获取到的数据加载到bean对象中
3.1、创建 bean 对象
3.2、将获取到的数据添加到集合中
再来看一下效果:
4
总结
项目地址:https://github.com/xiaweizi/jsoupJianshuDemo
-
点击头像查看作者信息
-
点击图片或文字查看文章内容
-
点击专题查看专题内容
-
下拉刷新获取最新内容
最后还是唠叨一下,我要求不是很高,怎么就没有公司要我呢?
希望大家多多支持我,谢谢!