Python3爬虫爬取淘宝商品数据

Posted

tags:

篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了Python3爬虫爬取淘宝商品数据相关的知识,希望对你有一定的参考价值。

这次的主要的目的是从淘宝的搜索页面获取商品的信息。其实分析页面找到信息很容易,页面信息的存放都是以静态的方式直接嵌套的页面上的,很容易找到。主要困难是将信息从HTML源码中剥离出来,数据和网页源码结合的很紧密,剥离数据有一定的难度。

然后将获取的信息写入excel表格保存起来,这次只爬取了前面10页 的内容。在运行代码的过程中发现,30页后面的数据有问题,出现了手机价格为0的情况,这是不符合实际的,码也没有写错误处理的代码。

这次先写个粗略的,有点凌乱的感觉,下次有时间再系统的整理整理吧。

import requests
import re
from xlwt import Workbook
import xlrd
import time

def key_name( number ):
    #获取页面的内容并返回
    name = 手机
    URL_1 = "https://s.taobao.com/search?ie=utf8&initiative_id=staobaoz_20170905&stats_click=search_radio_all%3A1&js=1&imgfile=&q="
    URL_2 = "&suggest=0_1&_input_charset=utf-8&wq=u&suggest_query=u&source=suggest&p4ppushleft=5%2C48&s="
    URL = ( URL_1 + name + URL_2 + str(number))
    #print(URL)
    res = requests.get( URL )
    return res.text

def find_date( text):
    #根据整个页面的信息,获取商品的数据所在的HTML源码并放回
    reg = r,"data":{"spus":\[({.+?)\]}},"header":
    reg = re.compile(reg)
    info = re.findall(reg, text)
    return info[0]

def manipulation_data( info, N, sheet ):
    #解析获取的HTML源码,获取数据
    Date = eval(info)

    for d in Date:
        T = " ".join([t[tag] for t in d[tag_info]])
        #print(d[‘title‘] + ‘\t‘ + d[‘price‘] + ‘\t‘ + d[‘importantKey‘][0:len(d[‘importantKey‘])-1] + ‘\t‘ + T)
        
        sheet.write(N,0,d[title])
        sheet.write(N,1,d[price])
        sheet.write(N,2,T)
        N = N + 1
    return N
    
    
def main():
    
    book = Workbook()
    sheet = book.add_sheet(淘宝手机数据)
    sheet.write(0,0,品牌)
    sheet.write(0,1,价格)
    sheet.write(0,2,配置)
    book.save(淘宝手机数据.xls)
    #k用于生成链接,每个链接的最后面的数字相差48.
    #N用于记录表格的数据行数,便于写入数据
    k = 0
    N = 1
    for i in range(10+1):
        text = key_name( k + i * 48 )
        info = find_date(text)
        N = manipulation_data( info ,N, sheet )
    
        book.save(淘宝手机数据.xls)
        print(下载第 + str(i) + 页完成)

if __name__ == __main__:
    main()

 

以上是关于Python3爬虫爬取淘宝商品数据的主要内容,如果未能解决你的问题,请参考以下文章

Python爬虫——淘宝商品信息定向爬虫

Java爬虫爬取 天猫 淘宝 京东 搜索页和 商品详情

用爬虫爬1688产品时,爬虫怎么知道1688下一个商品网址是多少,并且自动输入网址抓取

利用Python爬虫爬取淘宝网某类商品的图片

利用Python爬虫爬取淘宝商品做数据挖掘分析实战篇,超详细教程

如何用python写一个爬虫统计淘宝某件商品的销量