pyspark GBT

Posted kayy

tags:

篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了pyspark GBT相关的知识,希望对你有一定的参考价值。

from pyspark import SparkContext

from pyspark import SparkConf

from pyspark.mllib.regression import LabeledPoint

from pyspark.mllib.tree import GradientBoostedTrees

 

string_test = ‘pyspark_test‘

conf = SparkConf().setAppName(string_test).setMaster(‘yarn‘)

sc = SparkContext(conf=conf)

hdfs_data = sc.textFile("hdfs://dap/basicdata/dianzhang/phoenix/tmp_dianzhang_train_type/ds=2018-04-15/type=R1_C1/000000_0")

a = hdfs_data.map(lambda x:x.split(‘\t‘))

b = a.map(lambda x:LabeledPoint(x.pop(-1), x[3:]))

‘‘‘

弯路

c = b.collect()

model = GradientBoostedTrees.trainClassifier(sc.parallelize(c), {}, numIterations=10)

‘‘‘

model = GradientBoostedTrees.trainClassifier(b, {}, numIterations=10)

 

以上是关于pyspark GBT的主要内容,如果未能解决你的问题,请参考以下文章

Pyspark 安装错误:没有名为“pyspark”的模块

Pyspark:将 sql 查询转换为 pyspark?

Pyspark - ImportError:无法从“pyspark”导入名称“SparkContext”

Pyspark:基于所有列减去/差异 pyspark 数据帧

在 PySpark 的两个不同 pyspark.sql.dataframes 中的两列中创建一个 pyspark.sql.dataframe

pyspark:在日期和时间上重新采样 pyspark 数据帧