Python爬虫知识点——爬虫的基本原理

Posted 南邮果粒橙

tags:

篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了Python爬虫知识点——爬虫的基本原理相关的知识,希望对你有一定的参考价值。

爬虫的基本原理

爬虫就是获取网页提取保存信息自动化程序

获取网页:

获取网页就是获取网页的源码,只要把源码获取下来,就可以从中提取想要的消息

爬虫的流程:想网站的服务器发送一个请求,返回的响应体就是网页的源代码。

? ==>1,构造请求发送给服务器===>2.接受响应并解析

提取信息:

通过分析网页结构,提取网页信息。通常使用的解析库有:BeautifulSoup、lxml、pyquery,也可以使用正则,但是构造正则表达式比较复杂且易错

保存数据:

将提取的数据保存到某处以便后续利用。保存形式有:TXT、Json、数据库:MySQL、MongoDB、或远程服务器SFTP...

自动化程序

替人完成完成爬取工作的自动化程序,可以在抓取过程中进行异常处理……保证爬取的高效运行

文章摘自崔庆才的《Python3网络爬虫开发实战》

以上是关于Python爬虫知识点——爬虫的基本原理的主要内容,如果未能解决你的问题,请参考以下文章

Python爬虫--Requests 库用法大全

Python爬虫爬虫的基本原理

Python爬虫入门:爬虫基础了解

Python爬虫学习二------爬虫基本原理

Python爬虫知识点——代理

python网络爬虫进阶之HTTP原理,爬虫的基本原理,Cookies和代理介绍