好东西WebMagic 0.7.3 版本发布,Java 爬虫框架

Posted 浪曦IT软件

tags:

篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了好东西WebMagic 0.7.3 版本发布,Java 爬虫框架相关的知识,希望对你有一定的参考价值。


WebMagic是一个简单灵活的Java爬虫框架。基于WebMagic,你可以快速开发出一个高效、易维护的爬虫。


本次更新增加了Downloader模块的一些功能。

  • #609 修复HttpRequestBody没有默认构造函数导致无法反序列化的bug。

  • #631 HttpRequestBody的静态构造函数不再抛出UnsupportedEncodingException受检异常。

  • #571 Page对象增加bytes属性,用于获取二进制数据。下载纯二进制页面时,请设置request.setBinarayContent(true),这样对于二进制内容不会尝试转换为String,减小开销。

  • #629 在HttpUriRequestConverter中会自动对一些导致URI异常的字符进行转移或过滤。

  • #610 自动识别编码时,可以识别Content-Type中charset为大写的情况。

  • #627 支持为Request单独设置页面编码,兼容同一站点多种编码方式的情况。

  • #613 Page对象增加charset属性,其值为request/site中设置的charset,或者为自动检测的charset(未定义时)。

  • #606 升级jsonpath到2.4.0

  • #608 升级jsoup到1.10.3

  • 文章转载自开源中国社区


加入浪曦大家庭,毕业即享高薪

扫码关注↓↓

 浪曦IT实训,技术改变生活 

以上是关于好东西WebMagic 0.7.3 版本发布,Java 爬虫框架的主要内容,如果未能解决你的问题,请参考以下文章

webmagic爬取博客园所有文章

使用webmagic搭建一个简单的爬虫

webmagic的设计机制及原理-如何开发一个Java爬虫 转

webmagic创始人回答:ebMagic默认的HttpClient只会用TLSv1去请求,对于某些只支持TLS1.2的站点(例如 https://juejin.im/) ,就会报错:

WebMagic爬虫Demo

WebMagic基础与Maven管理依赖