在子集数据帧中删除未使用的因子水平

我有一个包含因子的数据帧。当我使用子集或其他索引函数创建这个数据帧的子集时，就创建了一个新的数据帧。然而，因子变量保留其所有原始水平，即使它们不存在于新的数据框架中。

这在绘制面图或使用依赖于因子级别的函数时会导致问题。

在新的数据框架中从一个因子中移除级别最简洁的方法是什么?

这里有一个例子:

df <- data.frame(letters=letters[1:5],
                    numbers=seq(1:5))

levels(df$letters)
## [1] "a" "b" "c" "d" "e"

subdf <- subset(df, numbers <= 3)
##   letters numbers
## 1       a       1
## 2       b       2
## 3       c       3    

# all levels are still there!
levels(subdf$letters)
## [1] "a" "b" "c" "d" "e"

当前回答

谢谢你提出这个问题。然而，以上的解决方案都不适合我。我为这个问题做了一个变通方案，分享它以防其他人偶然发现这个问题:

对于所有包含值为零的级别的因子列，您可以先将这些列转换为字符类型，然后再将它们转换回因子。

对于上面的问题，只需添加以下代码行:

# Convert into character
subdf$letters = as.character(subdf$letters)

# Convert back into factor
subdf$letters = as.factor(subdf$letters)

# Verify the levels in the subset
levels(subdf$letters)

2021-12-29 00:53:13

其他回答

谢谢你提出这个问题。然而，以上的解决方案都不适合我。我为这个问题做了一个变通方案，分享它以防其他人偶然发现这个问题:

对于所有包含值为零的级别的因子列，您可以先将这些列转换为字符类型，然后再将它们转换回因子。

对于上面的问题，只需添加以下代码行:

# Convert into character
subdf$letters = as.character(subdf$letters)

# Convert back into factor
subdf$letters = as.factor(subdf$letters)

# Verify the levels in the subset
levels(subdf$letters)

2021-12-29 00:53:13

已经尝试了这里的大多数例子，如果不是全部，但似乎没有一个在我的情况下工作。经过相当一段时间的斗争，我尝试使用as.character()在因子列上将其更改为带有字符串的col，这似乎工作得很好。

不确定性能问题。

2019-09-02 03:20:17

查看R源代码中的droplevels方法代码，您可以看到它包装为因子函数。这意味着你基本上可以用因子函数重新创建列。下面是数据。从所有因子列中删除级别的表方式。

library(data.table)
dt = data.table(letters=factor(letters[1:5]), numbers=seq(1:5))
levels(dt$letters)
#[1] "a" "b" "c" "d" "e"
subdt = dt[numbers <= 3]
levels(subdt$letters)
#[1] "a" "b" "c" "d" "e"

upd.cols = sapply(subdt, is.factor)
subdt[, names(subdt)[upd.cols] := lapply(.SD, factor), .SDcols = upd.cols]
levels(subdt$letters)
#[1] "a" "b" "c"

2015-12-09 14:56:58

如果你不想要这种行为，不要使用因子，而是使用字符向量。我觉得这比事后修补要好得多。在用read加载数据之前，请尝试以下操作。表或read.csv:

options(stringsAsFactors = FALSE)

缺点是你只能按字母排序。(重新排序是你的朋友情节)

2009-07-28 23:53:43

你所要做的就是在子集设置后再次应用factor()到你的变量:

> subdf$letters
[1] a b c
Levels: a b c d e
subdf$letters <- factor(subdf$letters)
> subdf$letters
[1] a b c
Levels: a b c

EDIT

因子页的例子如下:

factor(ff)      # drops the levels that do not occur

要从数据框架中的所有因子列中删除级别，您可以使用:

subdf <- subset(df, numbers <= 3)
subdf[] <- lapply(subdf, function(x) if(is.factor(x)) factor(x) else x)

2009-07-28 22:41:31

在子集数据帧中删除未使用的因子水平

推荐文章

最新文章

标签