我有一个面板结构的数据框:两年内每个单元有2个观测值:

library(tidyr)
mydf <- data.frame(
    id = rep(1:3, rep(2,3)),
    year = rep(c(2012, 2013), 3),
    value = runif(6)
)
mydf
#  id year      value
#1  1 2012 0.09668064
#2  1 2013 0.62739399
#3  2 2012 0.45618433
#4  2 2013 0.60347152
#5  3 2012 0.84537624
#6  3 2013 0.33466030

我想将此数据重塑为宽格式,可以使用tidyr::spread轻松完成。但是,由于year变量的值为数字,所以我的新变量的名称也变为数字,这使得其进一步使用变得更加困难。

spread(mydf, year, value)
#  id       2012      2013
#1  1 0.09668064 0.6273940
#2  2 0.45618433 0.6034715
#3  3 0.84537624 0.3346603

我知道我可以轻松地重命名列。但是,如果我想与其他操作一起在链中进行重塑,则将带来不便。例如。以下行显然没有意义。

library(dplyr)
mydf %>% spread(year, value) %>% filter(2012 > 0.5)

以下工作原理不那么简洁:

tmp <- spread(mydf, year, value)
names(tmp) <- c("id", "y2012", "y2013")
filter(tmp, y2012 > 0.5)

知道如何在spread中更改新的变量名吗?

最佳答案

我知道自最初提出这个问题以来已经过去了几年,但是为了后代,我还要强调sepspread参数。如果不是NULL,它将用作键名和值之间的分隔符:

mydf %>%
 spread(key = year, value = value, sep = "")
#  id   year2012  year2013
#1  1 0.15608322 0.6886531
#2  2 0.04598124 0.0792947
#3  3 0.16835445 0.1744542

这不是问题中所希望的,但足以满足我的目的。参见?spread

使用tidyr 1.0.0进行更新:tidyr 1.0.0现在引入了pivot_wider(和pivot_longer),可以在这方面通过names_sepnames_prefix参数进行更多控制。因此,现在的 call 将是:
mydf %>%
  pivot_wider(names_from = year, values_from = value,
              names_prefix = "year")
# # A tibble: 3 x 3
#        id year2012 year2013
#     <int>    <dbl>    <dbl>
#   1     1    0.347    0.388
#   2     2    0.565    0.924
#   3     3    0.406    0.296

为了获得确切的原始信息(仅以y为前缀),您现在当然可以通过简单地拥有names_prefix = "y"来直接获得它。

如果您要收集多个列,则使用names_sep,如下所示,其中我向数据添加了四分之一:
# Add quarters to data
mydf2 <- data.frame(
  id = rep(1:3, each = 8),
  year = rep(rep(c(2012, 2013), each = 4), 3),
  quarter  = rep(c("Q1","Q2","Q3","Q4"), 3),
  value = runif(24)
)
head(mydf2)
# id year quarter     value
# 1  1 2012      Q1 0.8651470
# 2  1 2012      Q2 0.3944423
# 3  1 2012      Q3 0.4580580
# 4  1 2012      Q4 0.2902604
# 5  1 2013      Q1 0.4751588
# 6  1 2013      Q2 0.6851755

mydf2 %>%
  pivot_wider(names_from = c(year, quarter), values_from = value,
              names_sep = "_", names_prefix = "y")
# # A tibble: 3 x 9
#      id  y2012_Q1  y2012_Q2  y2012_Q3  y2012_Q4  y2013_Q1  y2013_Q2  y2013_Q3  y2013_Q4
#   <int>     <dbl>     <dbl>     <dbl>     <dbl>     <dbl>     <dbl>     <dbl>     <dbl>
# 1     1     0.865     0.394     0.458    0.290      0.475     0.685     0.213     0.920
# 2     2     0.566     0.614     0.509    0.0515     0.974     0.916     0.681     0.509
# 3     3     0.968     0.615     0.670    0.748      0.723     0.996     0.247     0.449

关于r - 提迪尔传播后,如何控制新变量的名称?,我们在Stack Overflow上找到一个类似的问题:https://stackoverflow.com/questions/31788195/

10-12 17:41
查看更多