网络爬虫-总结
Posted liubosong
tags:
篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了网络爬虫-总结相关的知识,希望对你有一定的参考价值。
import requests
requests . get( ‘ https:/ /www. baidu. com‘)
爬虫程序
1.给定种子url,程序负责获取url的页面数据
2.程序对页面数据解析解析,匹配需要的url连接,放入到队列
3.重复1和2, 直到条件完成
效率 线程 协程 分布式架构
优先级排序
去重 先hash 再处理
数据存储
以上是关于网络爬虫-总结的主要内容,如果未能解决你的问题,请参考以下文章