scrapy shell 用法(慢慢更新...)

Posted

tags:

篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了scrapy shell 用法(慢慢更新...)相关的知识,希望对你有一定的参考价值。

scrapy shell 命令

1.scrapy shell url  #url指你所需要爬的网址

2.有些网址数据的爬取需要user-agent,scrapy shell中可以直接添加头文件,

第①种方法

   scrapy shell -s USER_AGENT="Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (Khtml, like Gecko) Chrome/59.0.3071.86 Safari/537.36" url  #url指你所需要爬的网址

第②种方法  

  scrapy shell

  from scrapy import Request

  req=Request("url",headers={‘User-Agent‘:"Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/59.0.3071.86 Safari/537.36"})

  resp=fetch(req)

3.对于爬取到的网址的数据,希望将其保存到本地文件中,

  with open("e:/python/text.txt",‘w‘) as f:

    f.write(response.body.decode(‘utf-8‘))

4.scrapy shell对于检验正则表达式和css以及xpath是很方便的用法,

scrapy shell -s USER_AGENT="Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/59.0.3071.86 Safari/537.36" url  #该步骤之后将得到一个页面请求的回答信息response

response.css(".job-name::attr(title)")  #使用css提取到具体数据

 

未完待续。。。

 

以上是关于scrapy shell 用法(慢慢更新...)的主要内容,如果未能解决你的问题,请参考以下文章

scrapy shell命令的选项简介

python爬虫框架scrapy问题的解决

启动scrapy shell时如何解决错误?

Scrapy——2 Scrapy shell

爬虫系列之Scrapy框架

Scrapy之Scrapy shell

(c)2006-2024 SYSTEM All Rights Reserved IT常识