有人知道如何从R中的data。frame中移除一整列吗?例如,如果我得到这个data.frame:

> head(data)
   chr       genome region
1 chr1 hg19_refGene    CDS
2 chr1 hg19_refGene   exon
3 chr1 hg19_refGene    CDS
4 chr1 hg19_refGene   exon
5 chr1 hg19_refGene    CDS
6 chr1 hg19_refGene   exon

我想去掉第二列。


当前回答

要按名称删除一个或多个列,如果列名是已知的(而不是在运行时确定的),我喜欢使用子集()语法。例如,对于数据帧

df <- data.frame(a=1:3, d=2:4, c=3:5, b=4:6)

你可以去掉a列

Data <- subset( Data, select = -a )

要去掉b和d列,你可以这么做

Data <- subset( Data, select = -c(d, b ) )

你可以删除d和b之间的所有列:

Data <- subset( Data, select = -c( d : b )

如上所述,此语法仅在列名已知的情况下有效。当以编程方式确定列名(即赋值给变量)时,它将不起作用。我将从?子集文档中复制这个警告:

警告: 这是一个方便交互使用的功能。 对于编程,最好使用标准子集 像'['这样的函数,特别是非标准求值 的论点“子集”可能会产生意想不到的后果。

其他回答

我只是想加上一个还没提到的。这很简单,但也很有趣,因为在我所有的互联网阅读中,我没有看到它,即使高度相关的%在%中出现在很多地方。

df <- df[ , -which(names(df) == 'removeCol')]

而且,我没有看到任何人发布grep替代品。这对于删除匹配模式的多个列非常方便。

发布的答案在使用data.frames时非常好。然而,从内存的角度来看,这些任务的效率非常低。对于大数据,删除列可能需要异常长的时间和/或由于内存不足错误而失败。包数据。Table使用:=操作符帮助解决这个问题:

library(data.table)
> dt <- data.table(a = 1, b = 1, c = 1)
> dt[,a:=NULL]
     b c
[1,] 1 1

我应该用一个更大的例子来说明差异。我会在某个时候更新这个答案。

使用dplyR,以下工作:

数据<- select(Data, -genome)

根据这里找到的文件https://www.marsja.se/how-to-remove-a-column-in-r-using-dplyr-by-name-and-index/#:~:text=select(starwars%2C%20%2Dheight)

要按名称删除一个或多个列,如果列名是已知的(而不是在运行时确定的),我喜欢使用子集()语法。例如,对于数据帧

df <- data.frame(a=1:3, d=2:4, c=3:5, b=4:6)

你可以去掉a列

Data <- subset( Data, select = -a )

要去掉b和d列,你可以这么做

Data <- subset( Data, select = -c(d, b ) )

你可以删除d和b之间的所有列:

Data <- subset( Data, select = -c( d : b )

如上所述,此语法仅在列名已知的情况下有效。当以编程方式确定列名(即赋值给变量)时,它将不起作用。我将从?子集文档中复制这个警告:

警告: 这是一个方便交互使用的功能。 对于编程,最好使用标准子集 像'['这样的函数,特别是非标准求值 的论点“子集”可能会产生意想不到的后果。

这样你就可以删除列并将变量存储到另一个变量中。

df = subset(data, select = -c(genome) )