干货分享Python的爬虫与Selenium库详细教程

Posted 程序员小捣

tags:

篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了干货分享Python的爬虫与Selenium库详细教程相关的知识,希望对你有一定的参考价值。

关注我,每天分享软件测试技术干货、面试经验,想要领取测试资料、进入软件测试学习交流群的可以直接加群644956177~~

在我们爬取网页过程中,经常发现我们想要获得的数据并不能简单的通过解析html代码获取,这些数据是通过AJAX异步加载方式或经过JS渲染后才呈现在页面上显示出来。

selenuim是一种自动化测试工具,它支持多种浏览器。而在爬虫中,我们可以使用它来模拟浏览器浏览页面,进而解决javascript渲染的问题。

1.使用示例
在这里插入图片描述
2. 详细介绍

2.1 声明浏览器对象

即告诉程序,应该使用哪个浏览器进行操作
在这里插入图片描述
2.2 访问页面
在这里插入图片描述
2.3 查找元素

成功访问网页后,我们可能需要进行一些操作,比如找到搜索框然后输入关键字再敲击回车键。

因此,就需要在selenium中查找元素。

2.3.1 单个元素

selenium查找元素有两种方法。

第一种,是指定使用哪种方法去查找元素,比如指定依照CSS选择或者依照xpath去进行查找

在这里插入图片描述
下面是详细的元素查找方法

find_element_by_name

find_element_by_xpath

find_element_by_link_text

find_element_by_partial_link_text

find_element_by_tag_name

find_element_by_class_name

find_element_by_css_selector

第二种,是直接使用find_element,传入的第一个参数为需要使用的元素查找方法

在这里插入图片描述
2.3.2 多个元素

查找多个元素和查找单个元素的方法基本一致(只需要将查找单个元素的func里加一个s)。

查找多个元素返回的是一个list。
在这里插入图片描述
2.4 元素交互操作

元素交互是先获取一个元素,然后对获取的元素调用交互方法。

比如说在搜索框内输入文字:在这里插入图片描述
2.5 交互动作

交互动作是将动作附加到交互链中串行执行,需要使用到ActionChains。

2.6 执行JavaScript

比如拖拽下拉在这里插入图片描述
2.7 获取元素信息

已经通过元素查找获取到元素后,可能还需要获取这个元素的属性、文本

2.7.1 获取属性在这里插入图片描述
2.8 Frame

如果定位到父frame,是无法查找到子frame的信息的,因此需要切换到子frame再进行查找。同理,在子frame也无法查找到父frame的信息在这里插入图片描述
2.9 等待

请求网页时,可能会存在AJAX异步加载的情况。而selenium只会加载主网页,并不会考虑到AJAX的情况。因此,使用时需要等待一些时间,让网页加载完全后再进行操作。

2.9.1 隐式等待

使用隐式等待时,如果webdriver没有找到指定的元素,将继续等待。超出规定时间后,如果还是没又找到指定元素则抛出找不到元素的异常。默认等待时间为0。

隐式等待是对整个页面进行等待。

需要特别说明的是:隐性等待对整个driver的周期都起作用,所以只要设置一次即可。

在这里插入图片描述
2.9.2 显式等待

显示等待包含了等待条件和等待时间。

首先判定等待条件是否成立,如果成立,则直接返回;如果条件不成立,则等待最长时间为等待时间,如果超过等待时间后仍然没有满足等待等待条件,则抛出异常。

显式等待是对指定的元素进行等待。
在这里插入图片描述
2.10 浏览器的前进/后退

back实现回到前一页面,forward实现前往下一页面在这里插入图片描述
2.11 对Cookies进行操作在这里插入图片描述
 2.12 选项卡管理

选项卡管理就是浏览器的标签。有些时候我们需要在浏览器里增加一个新标签页或者删除一个标签页,就可以使用selenium来实现。在这里插入图片描述

最后

在这里还是要推荐下我自己建的Python自动化学习群:644956177 ,群里都是学Python自动化测试的,如果你正在学习Python ,小编欢迎你加入,大家都是测试开发党,不定期分享干货(只有Python软件测试相关的),包括我自己整理的一份2021最新的Python自动化资料。

如果我的博客对你有帮助、如果你喜欢我的博客内容,请 “点赞” “评论” “收藏” 一键三连哦!

以上是关于干货分享Python的爬虫与Selenium库详细教程的主要内容,如果未能解决你的问题,请参考以下文章

python爬虫笔记----4.Selenium库(自动化库)

python爬虫需要安装哪些库

python爬虫 Selenium库学习

python爬虫知识点总结Selenium库详解

小白+python+selenium库+图片爬取+反爬+资料超详细新手实现(01)webdriver环境配置+新手基础知识

爬虫工具包