selenium模块

时间：2017-11-08 20:50:12 阅读：248 评论：0 收藏：0 [点我收藏+]

标签：release mat enter nal sed exe 回车 nload div2

一、介绍

　　selenium最初是一个自动化测试工具，而爬虫中使用它主要是为了解决requests无法直接执行JavaScript代码的问题。

　　selenium本质是通过驱动浏览器，完全模拟浏览器的操作，比如跳转、输入、点击、下拉等。来拿到网页渲染之后的结果，可支持多种浏览器。

from selenium import webdriver
browser=webdriver.Chrome()
browser=webdriver.Firefox()
browser=webdriver.PhantomJS()
browser=webdriver.Safari()
browser=webdriver.Edge()

二、安装

#安装：selenium+chromedriver
pip3 install selenium
下载chromdriver.exe放到python安装路径的scripts目录中即可，注意最新版本是2.33，并非2.9
下载链接：http://npm.taobao.org/mirrors/chromedriver/

#验证安装
C:\Users\Administrator>python3
Python 3.6.1 (v3.6.1:69c0db5, Mar 21 2017, 18:41:36) [MSC v.1900 64 bit (AMD64)] on win32
Type "help", "copyright", "credits" or "license" for more information.
>>> from selenium import webdriver
>>> driver=webdriver.Chrome() #弹出浏览器
>>> driver.get(‘https://www.baidu.com‘)
>>> driver.page_source

#注意：
selenium3默认支持的webdriver是Firfox，而Firefox需要安装geckodriver
下载链接：https://github.com/mozilla/geckodriver/releases

selenium+Chromedriver

#安装：selenium+phantomjs
pip3 install selenium
下载phantomjs，解压后把phantomjs.exe所在的bin目录放到环境变量
下载链接：http://phantomjs.org/download.html

#验证安装
C:\Users\Administrator>phantomjs
phantomjs> console.log(‘egon gaga‘)
egon gaga
undefined
phantomjs> ^C
C:\Users\Administrator>python3
Python 3.6.1 (v3.6.1:69c0db5, Mar 21 2017, 18:41:36) [MSC v.1900 64 bit (AMD64)] on win32
Type "help", "copyright", "credits" or "license" for more information.
>>> from selenium import webdriver
>>> driver=webdriver.PhantomJS() #无界面浏览器
>>> driver.get(‘https://www.baidu.com‘)
>>> driver.page_source

selenium+phantomjs

selenium+phantomjs

三、基本使用

from selenium import webdriver # 驱动浏览器

from selenium.webdriver import ActionChains #滑动验证

from selenium.webdriver.common.by import By #按照什么方式查找，By.ID,By.CSS_SELECTOR，查找标签进而点击

from selenium.webdriver.common.keys import Keys #模拟键盘按键操作

from selenium.webdriver.support import expected_conditions as EC # EC中传的是元组

from selenium.webdriver.support.wait import WebDriverWait #与E联用，等待页面加载某些元素

browser=webdriver.Chrome()

try:

　　browser.get(‘https://www.baidu.com‘)

　　input_tag=browser.find_element_by_id(‘kw‘)

　　input_tag.send_keys(‘美女‘) #python2中输入中文错误，字符串前加个u

　　input_tag.send_keys(Keys.ENTER) #输入回车

　　search_button = browser.find_element_by_id(‘su‘) # 找到搜索按钮点击

　　search_button.click()

　　wait=WebDriverWait(browser,10)

　　wait.until(EC.presence_of_element_located((By.ID,‘content_left‘))) #等到id为c　　ontent_left的元素加载完毕,最多等10秒

　　print(browser.page_source)

　　print(browser.current_url)

　　print(browser.get_cookies())

finally:

　　browser.close()

四、三种选择器

from selenium import webdriver
from selenium.webdriver import ActionChains
from selenium.webdriver.common.by import By #按照什么方式查找，By.ID,By.CSS_SELECTOR
from selenium.webdriver.common.keys import Keys #键盘按键操作
from selenium.webdriver.support import expected_conditions as EC
from selenium.webdriver.support.wait import WebDriverWait #等待页面加载某些元素

browser=webdriver.Chrome()

browser.get(‘https://www.baidu.com‘)

#以下三种方式达到的都是同一种效果：查找id为kw的标签
input_tag1=browser.find_element(By.ID,‘kw‘) #等同于：input_tag1=browser.find_element_by_id(‘kw‘)

input_tag2=browser.find_element(By.CSS_SELECTOR,‘#kw‘) #等同于：input_tag2=browser.find_element_by_css_selector(‘#kw‘)

input_tag3=browser.find_element(By.XPATH,‘//*[@id="kw"]‘) #等同于：input_tag3=browser.find_element_by_xpath(‘//*[@id="kw"]‘)

#注意：browser.find_elements系列与browser.find_element的区别就是，前者是查找多个，后者是只找第一个
div1=browser.find_element(By.CSS_SELECTOR,‘div‘) #找到第一个div标签
div2=browser.find_elements(By.CSS_SELECTOR,‘div‘) #找到所有的div标签，放到列表里

browser.close()

selenium模块

标签：release mat enter nal sed exe 回车 nload div2

原文地址：http://www.cnblogs.com/78pikaqiu/p/7805997.html

踩

(0)

评论一句话评论（0）

分享档案

更多>

2021年07月29日 (22)
2021年07月28日 (40)
2021年07月27日 (32)
2021年07月26日 (79)
2021年07月23日 (29)
2021年07月22日 (30)
2021年07月21日 (42)
2021年07月20日 (16)
2021年07月19日 (90)
2021年07月16日 (35)

周排行