Python爬虫项目，获取所有网站上的新闻，并保存到数据库中，解析html网页等

Posted 2020-09-28

tags:

篇首语：本文由小常识网(cha138.com)小编为大家整理，主要介绍了Python爬虫项目，获取所有网站上的新闻，并保存到数据库中，解析html网页等相关的知识，希望对你有一定的参考价值。

1、需求说明

需求：
爬取虎嗅网站的所有新闻，并保存到数据库中。
http://www.huxiu.com

技术：
1、爬虫
获取服务器的资源（urllib）
解析html网页（BeautifulSoup）
2、数据库技术
数据库 MySQLdb
业务逻辑的分析：
（1）、虎嗅网站的新闻，包括首页和分页信息（下一页）
（2）、需要从首页的资源和分页的资源中获取每个新闻的url连接
如何获取url：
解析网站html文件，如果A标签的href属性包含 article字段，就表示这是一个新闻
（3）访问新闻的url，解析出想要的字段

http://www.woaipu.com/shops/zuzhuan/61406

以上是关于Python爬虫项目，获取所有网站上的新闻，并保存到数据库中，解析html网页等的主要内容，如果未能解决你的问题，请参考以下文章

Python爬虫实战案例：爬取新闻资讯

python3 怎么爬取新闻网站

Python 网络爬虫（新闻采集脚本）

Python爬虫之cookie的获取保存和使用新手必学

求使用java语言抓取sina，搜狐网站上的新闻资讯的源码，或者原理说明也可~

爬取腾讯网的热点新闻文章并进行词频统计(Python爬虫+词频统计)