注意: IP代理精灵仅提供国内ip网络节点,不提供境外网络节点,不能用于任何非法用途或访问境外封闭网站,不能跨境联网,只能用于合法的国内网络加速。

请登录 注册

首页 > 新闻资讯 > 爬虫IP被封的解决方法

爬虫IP被封的解决方法

来源:IP代理精灵 作者:admin 时间:2019-05-07 15:01:32

在我们酣畅淋漓地使用爬虫抓取数据为我们所用的时候,却也能难免遇到强敌,IP遭到封锁,爬虫被反。那么,万一不行,IP被封了,有什么方法来解呢?当然有,还很多。下面我们就一起来看看爬虫IP被封的解决方法。

爬虫IP被封的解决方法

方法1.


之前由于公司项目需要,采集过google地图数据,还有一些大型网站数据。


经验如下:


IP必须有,可以直接使用成熟的代理IP服务商,类似像ip代理精灵这种。


好处:


1.程序逻辑变化小,只需要代理功能。


2.根据对方网站屏蔽规则不同,你只需要添加更多的代理就行了。


3.就算具体IP被屏蔽了,你可以直接把IP代理下线就OK,程序逻辑不需要变化。


方法2.


有小部分网站的防范措施比较弱,可以伪装下IP,修改X-Forwarded-for,即可绕过。


大部分网站么,如果要频繁抓取,一般还是要多IP。我比较喜欢的解决方案是VPS再配多IP,通过默认网关切换来实现IP切换。


方法3.


ADSL + 脚本,监测是否被封,然后不断切换 ip


设置查询频率限制


正统的做法是调用该网站提供的服务接口。


方法4.


1 user agent 伪装和轮换


2 使用代理 ip 和轮换


3 cookies 的处理,有的网站对登陆用户政策宽松些


友情提示:考虑爬虫给人家网站带来的负担,be a responsible crawler :)


方法5.


尽可能的模拟用户行为:


1、UserAgent经常换一换;


2、访问时间间隔设长一点,访问时间设置为随机数;


3、访问页面的顺序也可以随机着来


方法6.


网站封的依据一般是单位时间内特定IP的访问次数.


我是将采集的任务按 目标站点的IP进行分组 通过控制每个IP 在单位时间内发出任务的个数,来避免被封.当然,这个前题是你采集很多网站.如果只是采集一个网站,那么只能通过多外部IP的方式来实现了.


方法7.


1. 对爬虫抓取进行压力控制;


2. 可以考虑使用代理的方式访问目标站点。


总结:


-降低抓取频率,时间设置长一些,访问时间采用随机数


-频繁切换UserAgent(模拟浏览器访问)


-多页面数据,随机访问然后抓取数据


-使用代理IP不间断更换


最新资讯

推荐阅读

  1. 13

    2019-06

    好用的代理ip软件

    使用代理ip绝对是个技术活,对于我们很多不太懂IT的网友来说还是免了吧。直接购买http代理IP更来得省事。好用的代理ip软件如何选择呢?今天我们就来聊聊这个问题。目前市场上众多代理ip软

  2. 03

    2019-07

    代理IP的正确使用方式

    也许,您正遇到了这样的尴尬问题,访问一个网站正在查询资料,突然发现IP被限制了。这个时候,您灵机一动,想到了使用代理IP来解决这个难题,于是,您开启了寻找优质代理IP的艰难旅程,

  3. 02

    2021-04

    Win7通过组策略禁止修改IP地址

    Win7通过组策略禁止修改IP地址!有的朋友可能不知道组策略是什么,首先给大家简单的介绍一下。组策略(英语:Group Policy)是微软Windows NT家族操作系统的一个特性,它可以控制用户帐户和计算机

  4. 28

    2019-05

    Win8如何设置LAN代理服务器

    许多win8系统用户为了能够畅游游戏世界,经常需要设置代理服务器来突破IP限制或是通告网络访问速度,但是许多用户并不知道要怎么设置LAN代理服务器,针对这个问题,小编这就给大家讲解Win

  5. 21

    2019-08

    什么是代理的类型?

    什么是代理的类型?代理的类型,具体是指代理协议类型,常见的有HTTP、HTTPS、Socks5等。HTTP,全称超文本传输协议(HyperText Transfer Protocol),是互联网数据传输的一种协议;HTTPS,是在HTTP协议基

  6. 30

    2019-07

    动态ip代理可以解决哪些问题

    动态ip用得比较多,主要是因为IP资源比较少,而且一些项目使用动态IP效果会更好的,比如做一些网站测试、网站功能搭建的时候常常会需要用到一些动态ip代理工具,这样不仅有助于我们搭建