scrapy学习总结
Posted 坚持不一定胜利,但放弃一定失败
tags:
篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了scrapy学习总结相关的知识,希望对你有一定的参考价值。
1.为了配合XPath,Scrapy除了提供了 Selector
之外,还提供了方法来避免每次从response中提取数据时生成selector的麻烦
Selector有四个基本的方法(点击相应的方法可以看到详细的API文档):
2.为了创建一个Spider,您必须继承 scrapy.Spider
类, 且定义以下三个属性:
name
: 用于区别Spider。 该名字必须是唯一的,您不可以为不同的Spider设定相同的名字。start_urls
: 包含了Spider在启动时进行爬取的url列表。 因此,第一个被获取到的页面将是其中之一。 后续的URL则从初始的URL获取到的数据中提取。parse()
是spider的一个方法。 被调用时,每个初始URL完成下载后生成的Response
对象将会作为唯一的参数传递给该函数。 该方法负责解析返回的数据(response data),提取数据(生成item)以及生成需要进一步处理的URL的Request
对象
以上是关于scrapy学习总结的主要内容,如果未能解决你的问题,请参考以下文章