ClickHouse的ontime测试数据集

Posted bisal

tags:

篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了ClickHouse的ontime测试数据集相关的知识,希望对你有一定的参考价值。

ClickHouse介绍》介绍了ClickHouse一些通用知识,《ClickHouse安装和使用》介绍了ClickHouse的安装,其实官网还提供了一些测试数据集,可以做更实际的验证工作。

官方文档给了很多示例数据集,

https://clickhouse.com/docs/zh/getting-started/example-datasets/ontime/#sidebar-sidebar-2-4

常用的就是OnTime,他是从https://transtats.bts.gov/下载到的数据集,记录了美国从1987年至今持续更新的的民航数据,可以方便的展示和进行PoC,一般用户的磁盘和电脑可以比较方便的体验和测试,16G左右的文件。

https://transtats.bts.gov/,隶属美国运输部的一个研究网站,记录了很多美国航空运输研究数据,有兴趣可以登录,

OnTime数据导入ClickHouse有两种方式,

(1) 从原始数据导入。

(2) 下载预处理好的数据。

导入方案一:从原始数据导入

用这段脚本,逐个下载zip文件,他是按照“年-月”为单位组成的数据文件,可以根据需求,输入所需的数据文件范围,

for s in `seq 1987 2018`
do
for m in `seq 1 12`
do
wget https://transtats.bts.gov/PREZIP/On_Time_Reporting_Carrier_On_Time_Performance_1987_present_$s_$m.zip
done
done

脚本可从GitHub下载,https://github.com/Percona-Lab/ontime-airline-performance/blob/master/download.sh

下载的每个excel文件包含109列数据,

创建表结构,ontime,

P.S. 此处可以先创建一个数据库create database datasets,然后进入数据库,use datasets,再执行create table ontime,

CREATE TABLE `ontime`
(
    `Year`                            UInt16,
    `Quarter`                         UInt8,
    `Month`                           UInt8,
    `DayofMonth`                      UInt8,
    `DayOfWeek`                       UInt8,
    `FlightDate`                      Date,
    `Reporting_Airline`               String,
    `DOT_ID_Reporting_Airline`        Int32,
    `IATA_CODE_Reporting_Airline`     String,
    `Tail_Number`                     Int32,
    `Flight_Number_Reporting_Airline` String,
    `OriginAirportID`                 Int32,
    `OriginAirportSeqID`              Int32,
    `OriginCityMarketID`              Int32,
    `Origin`                          FixedString(5),
    `OriginCityName`                  String,
    `OriginState`                     FixedString(2),
    `OriginStateFips`                 String,
    `OriginStateName`                 String,
    `OriginWac`                       Int32,
    `DestAirportID`                   Int32,
    `DestAirportSeqID`                Int32,
    `DestCityMarketID`                Int32,
    `Dest`                            FixedString(5),
    `DestCityName`                    String,
    `DestState`                       FixedString(2),
    `DestStateFips`                   String,
    `DestStateName`                   String,
    `DestWac`                         Int32,
    `CRSDepTime`                      Int32,
    `DepTime`                         Int32,
    `DepDelay`                        Int32,
    `DepDelayMinutes`                 Int32,
    `DepDel15`                        Int32,
    `DepartureDelayGroups`            String,
    `DepTimeBlk`                      String,
    `TaxiOut`                         Int32,
    `WheelsOff`                       Int32,
    `WheelsOn`                        Int32,
    `TaxiIn`                          Int32,
    `CRSArrTime`                      Int32,
    `ArrTime`                         Int32,
    `ArrDelay`                        Int32,
    `ArrDelayMinutes`                 Int32,
    `ArrDel15`                        Int32,
    `ArrivalDelayGroups`              Int32,
    `ArrTimeBlk`                      String,
    `Cancelled`                       UInt8,
    `CancellationCode`                FixedString(1),
    `Diverted`                        UInt8,
    `CRSElapsedTime`                  Int32,
    `ActualElapsedTime`               Int32,
    `AirTime`                         Nullable(Int32),
    `Flights`                         Int32,
    `Distance`                        Int32,
    `DistanceGroup`                   UInt8,
    `CarrierDelay`                    Int32,
    `WeatherDelay`                    Int32,
    `NASDelay`                        Int32,
    `SecurityDelay`                   Int32,
    `LateAircraftDelay`               Int32,
    `FirstDepTime`                    String,
    `TotalAddGTime`                   String,
    `LongestAddGTime`                 String,
    `DivAirportLandings`              String,
    `DivReachedDest`                  String,
    `DivActualElapsedTime`            String,
    `DivArrDelay`                     String,
    `DivDistance`                     String,
    `Div1Airport`                     String,
    `Div1AirportID`                   Int32,
    `Div1AirportSeqID`                Int32,
    `Div1WheelsOn`                    String,
    `Div1TotalGTime`                  String,
    `Div1LongestGTime`                String,
    `Div1WheelsOff`                   String,
    `Div1TailNum`                     String,
    `Div2Airport`                     String,
    `Div2AirportID`                   Int32,
    `Div2AirportSeqID`                Int32,
    `Div2WheelsOn`                    String,
    `Div2TotalGTime`                  String,
    `Div2LongestGTime`                String,
    `Div2WheelsOff`                   String,
    `Div2TailNum`                     String,
    `Div3Airport`                     String,
    `Div3AirportID`                   Int32,
    `Div3AirportSeqID`                Int32,
    `Div3WheelsOn`                    String,
    `Div3TotalGTime`                  String,
    `Div3LongestGTime`                String,
    `Div3WheelsOff`                   String,
    `Div3TailNum`                     String,
    `Div4Airport`                     String,
    `Div4AirportID`                   Int32,
    `Div4AirportSeqID`                Int32,
    `Div4WheelsOn`                    String,
    `Div4TotalGTime`                  String,
    `Div4LongestGTime`                String,
    `Div4WheelsOff`                   String,
    `Div4TailNum`                     String,
    `Div5Airport`                     String,
    `Div5AirportID`                   Int32,
    `Div5AirportSeqID`                Int32,
    `Div5WheelsOn`                    String,
    `Div5TotalGTime`                  String,
    `Div5LongestGTime`                String,
    `Div5WheelsOff`                   String,
    `Div5TailNum`                     String
) ENGINE = MergeTree
      PARTITION BY Year
      ORDER BY (IATA_CODE_Reporting_Airline, FlightDate)
      SETTINGS index_granularity = 8192;

用如下指令加载数据,

ls -1 *.zip | xargs -I -P $(nproc) bash -c "echo ; unzip -cq  '*.csv' | sed 's/\\.00//g' | clickhouse-client --input_format_with_names_use_header=0 --query='INSERT INTO ontime FORMAT CSVWithNames'"

以上是文档介绍,但实际操作中,存在两个问题,

(1) wget下载https,可能会提示,

ERROR: cannot verify transtats.bts.gov's certificate, issued by ‘/C=US/O=Entrust, Inc./OU=See www.entrust.net/legal-terms/OU=(c) 2012 Entrust, Inc. - for authorized use only/CN=Entrust Certification Authority - L1K’:
  Unable to locally verify the issuer's authority.
To connect to transtats.bts.gov insecurely, use `--no-check-certificate'.

此时,需要wget跟着--no-check-certificate,作为一个认证下载指令,

wget --no-check-certificate https://transtats.bts.gov/PREZIP/On_Time_Reporting_Carrier_On_Time_Performance.zip

(2) 加载数据的时候,会提示csv格式错误,导致不能插入,参考一些资料,即使配置了input_format_allow_errors_ratio、改成了CSVWithNames,还是提示错误。于是只能尝试方案二。

P.S. 

TSV:tab separated values,即“制表符分隔值”,用制表符分隔数据。
CSV:comma separated values,即“逗号分隔值”,用逗号分隔数据。

导入方案二:下载预处理好的数据

下载数据文件ontime.tar,16G,他包含了所有可以提供下载的数据,相当于就是个数据库格式的数据文件,

curl -O https://datasets.clickhouse.com/ontime/partitions/ontime.tar

解压缩,注意这里不用提前在/var/lib/clickhouse创建data/ontime数据库的文件夹,因为这个压缩文件解压的时候,会带着路径/data/ontime,

tar xvf ontime.tar -C /var/lib/clickhouse

重启ClickHouse Server,

sudo service clickhouse-server restart

可以看下/var/lib/clickhouse/data/datasets/ontime任何一个文件夹,excel文档中的109列,每列都对应一个.bin文件和.mrk文件,都是二进制,不用做任何关联,就可以登录数据库访问这些数据了,

此时就可以检索数据库ontime,但是如果不使用use datasets登录数据库,检索的时候,就需要带着datasets.ontime。

统计表ontime的数据量,可以看到1亿数据,1毫秒,

可以检索均值,每次查询的时候,都会显示执行的进度,提示扫描时间、扫描数据量(行数、空间量)、扫描的速度(每秒扫描行数、每秒扫描空间量),如下图所示,2.057秒扫描了1亿多行的数据,每秒扫描9千万行,每秒扫描260多MB的数据量,

还可以检索很多维度的数据,例如,从2000年到2008年每天的航班数,

查询从2000年到2008年每周延误超过10分钟的航班数,

查询2000年到2008年每个机场延误超过10分钟以上的次数,

每年航班延误超过10分钟的百分比,

另外一种检索,

每年更受人们喜爱的目的地,

ClickHouse基本支持ANSI SQL,能实时读取这些未经聚合的数据。

ClickHouse官网提供了很多应用教程,

https://clickhouse.com/learn/

近期更新的文章:

表和索引统计信息自动采集的问题

小白学习MySQL - 变通创建索引的案例一则

ClickHouse安装和使用

ClickHouse介绍

最近碰到的一些问题

文章分类和索引:

《公众号800篇文章分类和索引

以上是关于ClickHouse的ontime测试数据集的主要内容,如果未能解决你的问题,请参考以下文章

ClickHouse数据压缩

将数据集导入 Docker 下的 Clickhouse 时出现“异常:没有要插入的数据”

ClickHouse 高可用集群安装测试

Logistics_Day17:自定义外部数据源ClickHouse

clickhouse数据压缩对比

ClickHouse 分布式原理:Distributed引擎