Python爬虫之Selenium的应用

🕗 发布于 2024-12-12 10:39 python 爬虫 selenium

【1】Selenium基础介绍

1.什么是selenium？

（1）Selenium是一个用于Web应用程序测试的工具。
（2）Selenium 测试直接运行在浏览器中，就像真正的用户在操作一样。
（3）支持通过各种driver（FirfoxDriver，IternetExplorerDriver，OperaDriver，ChromeDriver）驱动
真实浏览器完成测试。
（4）selenium也是支持无界面浏览器操作的。

2.为什么使用selenium？

模拟浏览器功能，自动执行网页中的js代码，实现动态加载

3.如何安装selenium？

这里以操作谷歌浏览器为例，首先需要下载谷歌浏览器驱动：

驱动可以在http://chromedriver.storage.googleapis.com/index.html下载，注意驱动的版本一定要与浏览器大版本一致哦。
114后chrome驱动下载地址：https://googlechromelabs.github.io/chrome-for-testing/#stable

更多信息可以参考博文：https://blog.csdn.net/J080624/article/details/78569422

Python安装selenium

pip install selenium

4.selenium的使用步骤？

导入：from selenium import webdriver
创建谷歌浏览器操作对象：

path = 谷歌浏览器驱动文件路径
browser = webdriver.Chrome(path)

访问网址

url = 要访问的网址
browser.get(url)

【2】Selenium使用案例

① selenium的元素定位

元素定位：自动化要做的就是模拟鼠标和键盘来操作来操作这些元素，点击、输入等等。操作这些元素前首先要找到它们，WebDriver提供很多定位元素的方法

# 根据id来找到对象
# button = browser.find_element_by_id('su')
# print(button)

# 根据标签属性的属性值来获取对象的
# button = browser.find_element_by_name('wd')
# print(button)

# 根据xpath语句来获取对象
# button = browser.find_elements_by_xpath('//input[@id="su"]')
# print(button)

# 根据标签的名字来获取对象
# button = browser.find_elements_by_tag_name('input')
# print(button)

# 使用的bs4的语法来获取对象
# button = browser.find_elements_by_css_selector('#su')
# print(button)

# button = browser.find_element_by_link_text('直播')
# print(button)

② 访问元素信息

from selenium import webdriver
path = 'chromedriver.exe'
browser = webdriver.Chrome(path)

url = 'http://www.baidu.com'
browser.get(url)

input = browser.find_element_by_id('su')
# 获取标签的属性
print(input.get_attribute('class'))
# 获取标签的名字
print(input.tag_name)

# 获取元素文本
a = browser.find_element_by_link_text('新闻')
print(a.text)

③ 鼠标交互

事件：

点击:click()
输入:send_keys()
后退操作:browser.back()
前进操作:browser.forword()
模拟JS滚动:
js='document.documentElement.scrollTop=100000'
browser.execute_script(js) 执行js代码
获取网页代码：page_source
退出：browser.quit()

案例：

from selenium import webdriver

# 创建浏览器对象
path = 'chromedriver.exe'
browser = webdriver.Chrome(path)

# url
url = 'https://www.baidu.com'
browser.get(url)

import time
time.sleep(2)

# 获取文本框的对象
input = browser.find_element_by_id('kw')

# 在文本框中输入周杰伦
input.send_keys('周杰伦')

time.sleep(2)

# 获取百度一下的按钮
button = browser.find_element_by_id('su')

# 点击按钮
button.click()

time.sleep(2)

# 滑到底部
js_bottom = 'document.documentElement.scrollTop=100000'
browser.execute_script(js_bottom)

time.sleep(2)

# 获取下一页的按钮
next = browser.find_element_by_xpath('//a[@class="n"]')

# 点击下一页
next.click()

time.sleep(2)

# 回到上一页
browser.back()

time.sleep(2)

# 回去
browser.forward()

time.sleep(3)

# 退出
browser.quit()

【3】Phantomjs(基本被淘汰)

1.什么是Phantomjs？

（1）是一个无界面的浏览器
（2）支持页面元素查找，js的执行等
（3）由于不进行css和gui渲染，运行效率要比真实的浏览器要快很多

2.如何使用Phantomjs？

（1）获取PhantomJS.exe文件路径path
（2）browser = webdriver.PhantomJS(path)
（3）browser.get(url)

下载地址：https://phantomjs.org/download.html

在这里插入图片描述

扩展：保存屏幕快照:browser.save_screenshot('baidu.png')

from selenium import webdriver

path = 'phantomjs.exe'

browser = webdriver.PhantomJS(path)

url = 'https://www.baidu.com'
browser.get(url)

browser.save_screenshot('baidu.png')

import time
time.sleep(2)

input = browser.find_element_by_id('kw')
input.send_keys('昆凌')

time.sleep(3)

browser.save_screenshot('kunling.png')

【4】Chrome handless

Chrome-headless 模式， Google 针对 Chrome 浏览器 59版新增加的一种模式，可以让你不打开UI界面的情况下使用 Chrome 浏览器，所以运行效果与 Chrome 保持完美一致。

配置

from selenium import webdriver
from selenium.webdriver.chrome.options import Options

chrome_options = Options()
chrome_options.add_argument('‐‐headless')
chrome_options.add_argument('‐‐disable‐gpu')

path = r'C:\Program Files (x86)\Google\Chrome\Application\chrome.exe'
chrome_options.binary_location = path

browser = webdriver.Chrome(chrome_options=chrome_options)

browser.get('http://www.baidu.com/')

封装的handless

from selenium import webdriver
from selenium.webdriver.chrome.options import Options

def share_browser():
    chrome_options = Options()
    chrome_options.add_argument('--headless')
    chrome_options.add_argument('--disable-gpu')

    # path是你自己的chrome浏览器的文件路径
    path = r'C:\Program Files (x86)\Google\Chrome\Application\chrome.exe'
    chrome_options.binary_location = path

    browser = webdriver.Chrome(chrome_options=chrome_options)
    return browser

browser = share_browser()

url = 'https://www.baidu.com'

browser.get(url)

原文地址：https://blog.csdn.net/J080624/article/details/144407478

免责声明：本站文章内容转载自网络资源，如本站内容侵犯了原著者的合法权益，可联系本站删除。更多内容请关注自学内容网（zxcms.com）！

上一篇：【excel密码】Excel工作表不能复制或移动
下一篇：ARM学习（35）单元测试框架以及MinGW GCC覆盖率报告

【智体OS】官方上新发布智体电视：基于rtpc和rttouchpad实现智体电视的手机遥控-可安装任意PC应用用于智体电视
rtpc和rttouchpad的结合，使得智体电视变成了一个非常易于使用的智体设备。功能强大，应用丰富（千万级），并且支持poplang拓展智体电视机的功能插件，从而大大提升了智体电视的用户体验——内
阅读更多2024-12-13
Scala隐式转换
/ 特点：1.自动北调用 2.函数名字不重要 3.重要的是：参数类型和返回类型!//隐式转换:编译器自动滴，把数据类型从A->B。// 把Int类型，转成Double类型。// 隐式函数：imp
阅读更多2024-12-13
数据结构（二叉树）
二叉树（Binary Tree）每个节点最多有两个子节点（即左子节点和右子节点）。树的结构是分层的，即从根节点开始，往下逐层分布。在树结构中，节点之间的形成了层次结构。二叉树的根节点是树的起始节点，它
阅读更多2024-12-13
Web 端语音对话 AI 示例：使用 Whisper 和 llama.cpp 构建语音聊天机器人
通过结合 Web 端的语音识别和语音合成功能、Whisper的语音转文本能力、以及llama.cpp提供的LLM服务，我们成功构建了一个语音对话系统。语音对话的场景非常丰富，例如口语外教、语音问答等等
阅读更多2024-12-13
ubuntu 安装docker遇到的问题，如何解决的
2.看下liunx操作系统是什么版本，从阿里云镜像里面找到对应的版本粘贴到sources里面，没权限，要给权限。以下命令示例使用了最新的版本号 v2.20.2，请根据需要替换为实际最新版本号。1.
阅读更多2024-12-13
在 Linux 和 Windows 操作系统下查询局域网IP
该命令会向指定网段内的所有 IP 地址发送探测数据包，并返回处于活动状态的主机及其对应的 IP 地址等信息。Windows 系统下查询局域网 IP。·Linux 系统——
阅读更多2024-12-13
Axure RP：设计、原型与协作的综合平台
Axure RP是一款专业的原型设计软件，它在用户界面（UI）和用户体验（UX）设计领域中扮演着重要角色，帮助产品经理、设计师和开发人员制作具有交互性的原型，以展示和测试应用程序、网站或其他数字产品的
阅读更多2024-12-13
Github 2024-12-11C开源项目日报Top10
根据Github Trendings的统计，今日(2024-12-11统计)共有10个项目上榜。
阅读更多2024-12-13
uniapp插件日历设置、时间段设置、放号设置、预约放号设置
本插件是一款基于日历的时间段管理工具，支持日期选择、时间段配置、放号数量设定等功能，适用于预约系统、资源管理、票务分发等场景。通过抽屉式管理和实时数据同步，提供灵活的时间段设置和高效的交互体验
阅读更多2024-12-13
二、ubuntu单盘改软raid1
将单盘系统转换为软 RAID 1 是一个复杂的过程，尤其是在已经有数据的生产环境中进行时。这个过程涉及备份现有数据、创建 RAID 阵列、迁移数据以及更新引导加载程序（如 GRUB）。
阅读更多2024-12-13