PySpark RDD 之 takeSample

原創

2020-02-23 05:13

1. pyspark 版本

2.3.0版本

2. 官網

takeSample(withReplacement, num, seed=None)[source]¶

Return a fixed-size sampled subset of this RDD.

中文：返回此RDD的固定大小的採樣子集。

Note This method should only be used if the resulting array is expected to be small, as all the data is loaded into the driver’s memory.
注意 僅當預期結果數組較小時才應使用此方法，因爲所有數據均已加載到驅動程序的內存中。

>>> rdd = sc.parallelize(range(0, 10))
>>> len(rdd.takeSample(True, 20, 1))
20
>>> len(rdd.takeSample(False, 5, 2))
5
>>> len(rdd.takeSample(False, 15, 3))
10

3. 我的代碼

from pyspark import SparkContext, SparkConf
conf = SparkConf().setMaster("local").setAppName("takeSample")
sc = SparkContext(conf=conf)
lines = sc.parallelize([1, 2, 3, 4, 5])
rdd = lines.takeSample(True, 3)  #Flase: 數據集中沒重複的數據  True： 數據集中有重複的數據
print('rdd= ', rdd)
# rdd = lines.takeSample(Flase, 3)
# rdd=  [5, 2, 3]

>>> rdd=  [2, 1, 2]

4. notebook

發表評論

所有評論

還沒有人評論，想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.

相關文章

pyspark Window 窗口函數

參考：Introducing Window Functions in Spark SQL 窗口函數 At its core, a window function calculates a return value for ever

2020-07-07 22:37:37

spark讀取elasticsearch nested array

anton spark讀elasticsearch array anton elasticsearch數組在Elasticsearch中，沒有專用的數組類型。默認情況下，任何字段都可以包含零個或多個值(數組中的所有值必須具有相同

Insightzen_xian

2020-07-07 22:21:01

Pyspark ValueError: Cannot run multiple SparkContexts at once 解決之道

pyspark執行可能就遇到問題 ValueError: Cannot run multiple SparkContexts at once; existing SparkContext(app=PySparkShell, master

2020-07-06 17:59:34

spark構建迴歸模型

Spark機器學習第六章實現加載數據集數據集爲Bike-Sharing-Dataset path = "hdfs:///user/yy/Bike-Sharing-Dataset/hour_noheader.csv" raw_

2020-07-06 13:47:14

pyspark dataframe 自定義分區器

def myp(x): return x % 100 pp = F.udf(myp) df = spark.range(900) df.show() df = df.repartitionByRange(pp('i

2020-07-05 13:35:28

(待解決) java.io.EOFException: End of File Exception between local host

背景 spark 設置checkpoint 的地址爲阿里雲的hdfs 報錯 spark.sparkContext.setCheckpointDir('dfs://f***iyuncs.com:10290/test') 集羣

2020-07-05 13:35:26

pyspark入門系列 - 02 pyspark.sql入口 SparkSession簡介與實踐

SparkSesson爲使用Dataset和DataFrame API編程Spark的入口點。 SparkSesson對象可以創建DataFrame，將Dataframe註冊爲表，並在表上執行SQL、緩存表、讀parquet文件等

2020-07-04 10:41:11

pyspark入門系列 - 03 pyspark.sql.DataFrame函數彙總與實踐

先放上pyspark.sql.DataFrame的函數彙總 from pyspark.sql import SparkSession spark = SparkSession.Builder().master('local')

2020-07-04 10:00:55

pyspark入門系列 --pyspark.sql.Column函數彙總與實戰

from pyspark.sql import SparkSession spark = SparkSession.Builder().master('local').appName('sparksqlColumn').getO

2020-07-04 10:00:55

pyspark入門系列 - 01 統計文檔中單詞個數

導入SparkConf和SparkContext模塊，任何Spark程序都是SparkContext開始的，SparkContext的初始化需要一個SparkConf對象，SparkConf包含了Spark集羣配置的各種參數。初始

2020-07-04 10:00:55

pyspark入門系列 --pyspark.sql.Row函數彙總

from pyspark.sql import SparkSession spark = SparkSession.Builder().master('local').appName('pysparkSqlRow').getOr

2020-07-04 10:00:55

PySpark 之 flatMap

1. pyspark 版本 2.3.0版本 2. 官網 flatMap(f, preservesPartitioning=False)[source] Return a new RDD by first ap

2020-06-29 15:59:59

PySpark RDD 之 reduce

1. pyspark 版本 2.3.0版本 2. 官網 reduce(f)[source] Reduces the elements of this RDD using the specified

2020-06-29 15:59:59

PySpark 之連接變換 union、intersection、subtract、cartesian

1. pyspark 版本 2.3.0版本 2. 解釋 union() 並集 intersection() 交集 subtr

2020-06-29 15:59:59

PySpark RDD 之 filter

1. pyspark 版本 2.3.0版本 2. 官網 filter(f)[source] Return a new RDD containing only the elements that satisfy a pre

2020-06-29 15:59:59

24小時熱門文章

最新文章

最新評論文章