注意: IP代理精灵仅提供国内ip网络节点,不提供境外网络节点,不能用于任何非法用途或访问境外封闭网站,不能跨境联网,只能用于合法的国内网络加速。

请登录 注册 实名验证

首页 > 新闻资讯 > selenium+python设置爬虫代理IP的方法

selenium+python设置爬虫代理IP的方法

来源:IP代理精灵 作者:admin 时间:2019-04-26 14:40:32

这篇文章主要介绍了selenium+python设置爬虫代理IP的方法,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧!

selenium+python设置爬虫代理IP的方法

1. 设置背景


在使用selenium浏览器渲染技术,当我们爬取某个网站的信息的时候,在一般情况下速度都不是特别的快。而且需要利用selenium浏览器渲染技术爬取的网站,反爬虫的应对技术都比较厉害,对IP访问频率有很高程度的限制。所以,如果想提升selenium抓取数据的速度,可以从两个方面出发:


第一方面, 抓取频率要提高,破解出现的验证信息,一般都是验证码或者是用户登陆 。


第二方面,使用多线程 + 代理IP, 这种方式,需要电脑有足够的内存和充足稳定的代理IP。


2. 为chrome设置代理IP


注意事项:


第一,选择稳定的固定的代理IP。不要选择动态代理IP。我们常用的爬虫IP代理通常都是具有高度保密性质的高匿名动态IP,是通过拨号动态产生的,时效性非常的短,一般都是在3分钟左右。对于scrapy这种并发度很高,又不需要登录的爬虫来说,非常合适,但是在浏览器渲染类爬虫中并不适用。


第二,选择速度较快的代理IP。因为selenium爬虫采用的是浏览器渲染技术,这种浏览器渲染技术速度就本身就很慢。如果选择的代理IP速度较慢,爬取的时间就会进一步增加。


第三,要有足够大的电脑内存。因为chrome占内存较大,在并发度很高的情况下,容易造成浏览器崩溃,也就是程序崩溃。


第四,在程序结束时,调用 browser.quit( ) 清除浏览器缓存。


最新资讯

推荐阅读

  1. 15

    2019-04

    Python怎么切换代理IP

    随着大数据的应用越来越广泛,应用的行业也越来越多,我们每日都可以看到大数据的一些新颖的应用,从而帮助人们从中获取到真正有用的价值,随着很多工作的开展,我们需要大量的IP操作

  2. 20

    2019-05

    代理服务器的作用是什么?怎么设置?

    关于代理服务器以及代理服务器的作用,很多人都可能了解的似是而非,能了解一点,却不并不是很透彻。那么,今天,小编就来讲一讲代理服务器的作用是什么以及怎么设置这两个问题。问题

  3. 23

    2019-05

    什么是IP加速器

    什么是IP加速器?IP加速器是一种虚拟出来的企业内部专线,通过在公用网络上建立专线网络,来进行加密通讯。目前这种IP加速器是一种比较普遍的应用模式,相反国内通过免费或付费IP加速器

  4. 07

    2019-09

    如何构建构建Python爬虫IP代理池服务?

    如何构建构建Python爬虫IP代理池服务?作为一个Python爬虫程序员,在公司做分布式深网爬虫,搭建了一套稳定的代理池服务,为上千个爬虫提供有效的代理,保证各个爬虫拿到的都是对应网站有效

  5. 18

    2019-04

    网络不好如何使用代理服务器登录QQ

    在某些情况下,比如网络不通畅,无法与QQ服务器连通,我们会用代理服务器来登录QQ。对不太了解QQ代理服务器的朋友们来说,找代理、用代理都比较困难。下面我们就来详细了解一下代理服务

  6. 18

    2020-08

    如何用代理IP来保护网络安全

    如何用代理IP来保护网络安全!网络冲浪这么多年,网络给我们带来便利的同时,与之相伴的还有安全隐患,毕竟这是一个看不见的“网”,无法知道自己是否有私密信息不小心在上面,也不确定