正则爬取某段子网站前20页段子(request库)

Posted springionic

tags:

篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了正则爬取某段子网站前20页段子(request库)相关的知识,希望对你有一定的参考价值。

首先还是谷歌浏览器抓包对该网站数据进行分析,结果如下:

技术图片

  • 坑还是有的,这是我第一次写的正则:
content_list = re.findall(r<a href="/detail-.*">(.+?)</a>, html_str) 
  • 之后发现竟然匹配到了一些推荐的内容,最后我把正则改变下面这样,发现没有问题了,关于正则的知识这里就不做过多解释了
content_list = re.findall(r<div class="j-r-list-c-desc">\\s*<a href="/detail-.*">(.+?)</a>, html_str) 
  • 现在要的是爬取前20页的段子并保存到本地,已经知道翻页的规律和匹配内容的正则,就直接可以写代码了

 

代码如下,整体思路还是和前两排爬虫博客一样,面向对象的写法:

 1 import requests
 2 import re
 3 import json
 4 
 5 class NeihanSpider(object):
 6     """内涵段子,百思不得其姐,正则爬取一页的数据"""
 7     def __init__(self):
 8         self.temp_url = http://www.budejie.com/text/  # 网站地址,给页码留个可替换的
 9         self.headers = 
10             User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/75.0.3770.100 Safari/537.36,
11         
12 
13     def pass_url(self, url):  # 发送请求,获取响应
14         print(url)
15         response = requests.get(url, headers=self.headers)
16         return response.content.decode()
17 
18     def get_first_page_content_list(self, html_str):  # 提取第一页的数据
19         content_list = re.findall(r<div class="j-r-list-c-desc">\\s*<a href="/detail-.*">(.+?)</a>, html_str)  # 非贪婪匹配
20         return content_list
21 
22     def save_content_list(self, content_list):
23         with open(neihan.txt, a, encoding=utf-8) as f:
24             for content in content_list:
25                 f.write(json.dumps(content, ensure_ascii=False))
26                 f.write(\\n)  # 换行
27             print(成功保存一页!)
28 
29     def run(self):  # 实现主要逻辑
30         for i in range(20):  # 只爬取前20页数据
31             # 1. 构造url
32             # 2. 发送请求,获取响应
33             html_str = self.pass_url(self.temp_url.format(i+1))
34             # 3. 提取数据
35             content_list = self.get_first_page_content_list(html_str)
36             # 4. 保存
37             self.save_content_list(content_list)
38 
39 if __name__ == __main__:
40     neihan = NeihanSpider()
41     neihan.run()

 

以上是关于正则爬取某段子网站前20页段子(request库)的主要内容,如果未能解决你的问题,请参考以下文章

生活这么苦,用Python爬取搞笑网站段子乐乐

python爬取糗事百科段子

Python爬取今日头条段子

11-内涵段子-爬虫

芝麻HTTP:Python爬虫实战之爬取糗事百科段子

爬虫二:爬取糗事百科段子