我有一个 SparkR DataFrame 并且我想为每个唯一的 value 获取模式(最常见) name 。我怎样才能做到这一点?似乎没有内置的 mode 函数。 SparkR 或 PySpark 解决方案都可以。

#Create DF
df <- data.frame(name = c("Thomas", "Thomas", "Thomas", "Bill", "Bill", "Bill"),
  value = c(5, 5, 4, 3, 3, 7))
DF <- createDataFrame(df)

name   | value
-----------------
Thomas |  5
Thomas |  5
Thomas |  4
Bill   |  3
Bill   |  3
Bill   |  9

#What I want to get
name   | mode(value)
-----------------
Thomas |   5
Bill   |   3

最佳答案

您可以使用 .groupBy()window 方法的组合来实现,如下所示:

grouped = df.groupBy('name', 'value').count()
window = Window.partitionBy("name").orderBy(desc("count"))
grouped\
    .withColumn('order', row_number().over(window))\
    .where(col('order') == 1)\
    .show()

输出:
+------+-----+-----+-----+
|  name|value|count|order|
+------+-----+-----+-----+
|  Bill|    3|    2|    1|
|Thomas|    5|    2|    1|
+------+-----+-----+-----+

关于pyspark - 使用 groupBy 在 Spark 列中获取模式(最常见)值,我们在Stack Overflow上找到一个类似的问题:https://stackoverflow.com/questions/44806757/

10-10 14:05