用Python爬取大众点评时被反爬ip被封怎么办,他总叫我滑动验证但滑动了也没有用。。。求大佬帮忙。。。
Posted
tags:
篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了用Python爬取大众点评时被反爬ip被封怎么办,他总叫我滑动验证但滑动了也没有用。。。求大佬帮忙。。。相关的知识,希望对你有一定的参考价值。
参考技术A 1、放慢爬取速度,减小对于目标网站造成的压力。但是这样会减少单位时间类的爬取量。第二种方法是通过设置IP等手段,突破反爬虫机制继续高频率爬取。网站的反爬机制会检查来访的IP地址,为了防止IP被封,这时就可以使用HTTP,来切换不同的IP爬取内容。使用代理IP简单的来讲就是让代理服务器去帮我们得到网页内容,然后再转发回我们的电脑。要选择高匿的ip,IPIDEA提供高匿稳定的IP同时更注重用户隐私的保护,保障用户的信息安全。
2、这样目标网站既不知道我们使用代理,更不会知道我们真实的IP地址。
3、建立IP池,池子尽可能的大,且不同IP均匀轮换。
如果你需要大量爬取数据,建议你使用HTTP代理IP,在IP被封掉之前或者封掉之后迅速换掉该IP,这里有个使用的技巧是循环使用,在一个IP没有被封之前,就换掉,过一会再换回来。这样就可以使用相对较少的IP进行大量访问。 参考技术B 用代理啊,多弄一下代理IP,另外需要控制抓取的速度,太快肯定会被封的。 参考技术C 我劝你们还是别学爬别人的东西了,很容易违法的 参考技术D 用ADSL,频率也要把控好追问
ADSL?
第5个回答 2019-04-18 1.用代理,写个代理池。2.加个睡眠 sleep
3.加个请求头来模仿浏览器,不然你肯定会被封的。
希望能帮到你。。。。
如何处理python爬虫ip被封
如何处理python爬虫ip被封1、爬虫降低访问速度
由于上文所说的访问速度过快会引起IP被封,那么最直观的办法便是降低访问速度,这样就能避免了我们的IP被封的问题。只是呢,降低速度,爬虫的效率就降低,主要还是要降低到什么程度?
在这一点上吗,我们首先要测试出网站设置的限制速度阈值,如此一来我们才能设置合理的访问速度,建议不要设固定的访问速度,可以设置在一个范围之内,避免过于规律而被系统检测到,从而导致IP被封。
2、爬虫切换IP访问
降低了访问速度,在所难免的影响到了爬取的抓取效率,无法高效的抓取,如此一来的抓取速度与人工抓取有何区别呢?都没有了使用爬虫抓取的优势了。既然单个爬虫被控制了速度,但是我们可以使用多个爬虫同时去抓取啊!是的,我们可以使用多线程,多进程,配合使用代理,不同的线程使用不同的IP地址,就像是同时有不同的用户在访问,如此一来就能大大的提高爬虫的爬取效率了。 参考技术A 网络爬虫抓取信息的过程中,如果抓取频率过高或者使用了多线程,很容易被禁止访问。通常,网站的反爬虫机制都是依据IP和用户的User-Agent来标识爬虫的。于是在爬虫的开发者可以通过以下方式来解决这个问题:
1、放慢抓取速度,减小对于目标网站造成的压力。但是这样会减少单位时间类的抓取量。
2、第二种方法是通过设置ip代理等手段,突破反爬虫机制继续高频率抓取。但是这样需要大量稳定的ip转换器。 参考技术B 一个是使用request库模拟人类正常登陆,浏览
再一个是用time模块中的sleep把爬取速度强制调整到3~4秒一次请求
如果真是被封了,那么换个ip吧本回答被提问者采纳 参考技术C 钱是解决之道
以上是关于用Python爬取大众点评时被反爬ip被封怎么办,他总叫我滑动验证但滑动了也没有用。。。求大佬帮忙。。。的主要内容,如果未能解决你的问题,请参考以下文章