pandas中的大多数操作都可以通过操作符链接(groupby、聚合、应用等)来完成,但我发现过滤行的唯一方法是通过普通的括号索引
df_filtered = df[df['column'] == value]
这是没有吸引力的,因为它要求我分配df到一个变量,然后才能过滤它的值。还有像下面这样的吗?
df_filtered = df.mask(lambda x: x['column'] == value)
pandas中的大多数操作都可以通过操作符链接(groupby、聚合、应用等)来完成,但我发现过滤行的唯一方法是通过普通的括号索引
df_filtered = df[df['column'] == value]
这是没有吸引力的,因为它要求我分配df到一个变量,然后才能过滤它的值。还有像下面这样的吗?
df_filtered = df.mask(lambda x: x['column'] == value)
当前回答
pandas为Wouter Overmeire的答案提供了两种不需要重写的选择。一个是.loc[。,如在
df_filtered = df.loc[lambda x: x['column'] == value]
另一个是.pipe()
df_filtered = df.pipe(lambda x: x.loc[x['column'] == value])
其他回答
来自@lodagro的答案很棒。我将通过泛化掩码函数来扩展它:
def mask(df, f):
return df[f(df)]
然后你可以这样做:
df.mask(lambda x: x[0] < 0).mask(lambda x: x[1] > 0)
我不完全确定你想要什么,你的最后一行代码也没有帮助,但无论如何:
“链式”过滤是通过将布尔索引中的条件“链式”进行的。
In [96]: df
Out[96]:
A B C D
a 1 4 9 1
b 4 5 0 2
c 5 5 1 0
d 1 3 9 6
In [99]: df[(df.A == 1) & (df.D == 6)]
Out[99]:
A B C D
d 1 3 9 6
如果你想要链接方法,你可以添加你自己的掩码方法并使用它。
In [90]: def mask(df, key, value):
....: return df[df[key] == value]
....:
In [92]: pandas.DataFrame.mask = mask
In [93]: df = pandas.DataFrame(np.random.randint(0, 10, (4,4)), index=list('abcd'), columns=list('ABCD'))
In [95]: df.ix['d','A'] = df.ix['a', 'A']
In [96]: df
Out[96]:
A B C D
a 1 4 9 1
b 4 5 0 2
c 5 5 1 0
d 1 3 9 6
In [97]: df.mask('A', 1)
Out[97]:
A B C D
a 1 4 9 1
d 1 3 9 6
In [98]: df.mask('A', 1).mask('D', 6)
Out[98]:
A B C D
d 1 3 9 6
我也有同样的问题,只是我想把这些标准组合成一个OR条件。Wouter Overmeire给出的格式将两个标准组合成一个AND条件,使得两个条件都必须满足:
In [96]: df
Out[96]:
A B C D
a 1 4 9 1
b 4 5 0 2
c 5 5 1 0
d 1 3 9 6
In [99]: df[(df.A == 1) & (df.D == 6)]
Out[99]:
A B C D
d 1 3 9 6
但我发现,如果你把每个条件……== True),并将标准与管道连接,这些标准在OR条件中组合,只要其中任何一个为真就满足:
df[((df.A==1) == True) | ((df.D==6) == True)]
pandas为Wouter Overmeire的答案提供了两种不需要重写的选择。一个是.loc[。,如在
df_filtered = df.loc[lambda x: x['column'] == value]
另一个是.pipe()
df_filtered = df.pipe(lambda x: x.loc[x['column'] == value])
这是没有吸引力的,因为它要求我分配df到一个变量,然后才能过滤它的值。
df[df["column_name"] != 5].groupby("other_column_name")
似乎可以工作:你也可以嵌套[]操作符。也许是因为你问了这个问题。