用Python爬取大众点评时被反爬ip被封怎么办,他总叫我滑动验证但滑动了也没有用。。。求大佬帮忙。。。

Posted

tags:

篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了用Python爬取大众点评时被反爬ip被封怎么办,他总叫我滑动验证但滑动了也没有用。。。求大佬帮忙。。。相关的知识,希望对你有一定的参考价值。

参考技术A 1、放慢爬取速度,减小对于目标网站造成的压力。但是这样会减少单位时间类的爬取量。
第二种方法是通过设置IP等手段,突破反爬虫机制继续高频率爬取。网站的反爬机制会检查来访的IP地址,为了防止IP被封,这时就可以使用HTTP,来切换不同的IP爬取内容。使用代理IP简单的来讲就是让代理服务器去帮我们得到网页内容,然后再转发回我们的电脑。要选择高匿的ip,IPIDEA提供高匿稳定的IP同时更注重用户隐私的保护,保障用户的信息安全。
2、这样目标网站既不知道我们使用代理,更不会知道我们真实的IP地址。

3、建立IP池,池子尽可能的大,且不同IP均匀轮换。
如果你需要大量爬取数据,建议你使用HTTP代理IP,在IP被封掉之前或者封掉之后迅速换掉该IP,这里有个使用的技巧是循环使用,在一个IP没有被封之前,就换掉,过一会再换回来。这样就可以使用相对较少的IP进行大量访问。
参考技术B 用代理啊,多弄一下代理IP,另外需要控制抓取的速度,太快肯定会被封的。 参考技术C 我劝你们还是别学爬别人的东西了,很容易违法的 参考技术D 用ADSL,频率也要把控好追问

ADSL?

第5个回答  2019-04-18 1.用代理,写个代理池。
2.加个睡眠 sleep
3.加个请求头来模仿浏览器,不然你肯定会被封的。
希望能帮到你。。。。

如何处理python爬虫ip被封

如何处理python爬虫ip被封
1、爬虫降低访问速度
由于上文所说的访问速度过快会引起IP被封,那么最直观的办法便是降低访问速度,这样就能避免了我们的IP被封的问题。只是呢,降低速度,爬虫的效率就降低,主要还是要降低到什么程度?
在这一点上吗,我们首先要测试出网站设置的限制速度阈值,如此一来我们才能设置合理的访问速度,建议不要设固定的访问速度,可以设置在一个范围之内,避免过于规律而被系统检测到,从而导致IP被封。
2、爬虫切换IP访问
降低了访问速度,在所难免的影响到了爬取的抓取效率,无法高效的抓取,如此一来的抓取速度与人工抓取有何区别呢?都没有了使用爬虫抓取的优势了。既然单个爬虫被控制了速度,但是我们可以使用多个爬虫同时去抓取啊!是的,我们可以使用多线程,多进程,配合使用代理,不同的线程使用不同的IP地址,就像是同时有不同的用户在访问,如此一来就能大大的提高爬虫的爬取效率了。
参考技术A 网络爬虫抓取信息的过程中,如果抓取频率过高或者使用了多线程,很容易被禁止访问。通常,网站的反爬虫机制都是依据IP和用户的User-Agent来标识爬虫的。于是在爬虫的开发者可以通过以下方式来解决这个问题:

1、放慢抓取速度,减小对于目标网站造成的压力。但是这样会减少单位时间类的抓取量。

2、第二种方法是通过设置ip代理等手段,突破反爬虫机制继续高频率抓取。但是这样需要大量稳定的ip转换器。
参考技术B 一个是使用request库模拟人类正常登陆,浏览
再一个是用time模块中的sleep把爬取速度强制调整到3~4秒一次请求
如果真是被封了,那么换个ip吧本回答被提问者采纳
参考技术C 钱是解决之道

以上是关于用Python爬取大众点评时被反爬ip被封怎么办,他总叫我滑动验证但滑动了也没有用。。。求大佬帮忙。。。的主要内容,如果未能解决你的问题,请参考以下文章

Scrapy爬取大众点评

如何处理python爬虫ip被封

使用代理服务器爬取网页还会被封IP吗?

使用scrapy爬虫设置了ip代理报错是怎么回事

python爬虫爬取大众点评并导入redis

python爬虫实例详细介绍之爬取大众点评的数据