如何根据列值从DataFrame中选择行？

如何根据Pandas中某列的值从DataFrame中选择行？

在SQL中，我会使用：

SELECT *
FROM table
WHERE column_name = some_value

当前回答

我发现前面答案的语法是多余的，很难记住。Pandas在v0.13中引入了query（）方法，我更喜欢它。对于您的问题，您可以使用df.query（'col==val'）。

转载自query（）方法（实验）：

In [167]: n = 10

In [168]: df = pd.DataFrame(np.random.rand(n, 3), columns=list('abc'))

In [169]: df
Out[169]:
          a         b         c
0  0.687704  0.582314  0.281645
1  0.250846  0.610021  0.420121
2  0.624328  0.401816  0.932146
3  0.011763  0.022921  0.244186
4  0.590198  0.325680  0.890392
5  0.598892  0.296424  0.007312
6  0.634625  0.803069  0.123872
7  0.924168  0.325076  0.303746
8  0.116822  0.364564  0.454607
9  0.986142  0.751953  0.561512

# pure python
In [170]: df[(df.a < df.b) & (df.b < df.c)]
Out[170]:
          a         b         c
3  0.011763  0.022921  0.244186
8  0.116822  0.364564  0.454607

# query
In [171]: df.query('(a < b) & (b < c)')
Out[171]:
          a         b         c
3  0.011763  0.022921  0.244186
8  0.116822  0.364564  0.454607

您还可以通过在环境中添加@来访问变量。

exclude = ('red', 'orange')
df.query('color not in @exclude')

2016-02-09 01:36:49

其他回答

很好的答案。只有当数据帧的大小接近百万行时，许多方法在使用df[df['col']==val]时往往需要很长时间。我希望“another_column”的所有可能值都对应于“some_column“中的特定值（在本例中是在字典中）。这起作用很快。

s=datetime.datetime.now()

my_dict={}

for i, my_key in enumerate(df['some_column'].values): 
    if i%100==0:
        print(i)  # to see the progress
    if my_key not in my_dict.keys():
        my_dict[my_key]={}
        my_dict[my_key]['values']=[df.iloc[i]['another_column']]
    else:
        my_dict[my_key]['values'].append(df.iloc[i]['another_column'])
        
e=datetime.datetime.now()

print('operation took '+str(e-s)+' seconds')```

2022-02-16 21:13:21

使用带有panda>=0.25.00的.query更灵活：

由于panda>=0.25.00，我们可以使用查询方法来使用panda方法过滤数据帧，甚至可以使用带有空格的列名。通常，列名中的空格会给出一个错误，但现在我们可以使用backtick（`）来解决这个问题-请参见GitHub：

# Example dataframe
df = pd.DataFrame({'Sender email':['ex@example.com', "reply@shop.com", "buy@shop.com"]})

     Sender email
0  ex@example.com
1  reply@shop.com
2    buy@shop.com

将.query与方法str.endswith一起使用：

df.query('`Sender email`.str.endswith("@shop.com")')

输出

     Sender email
1  reply@shop.com
2    buy@shop.com

此外，我们还可以通过在查询中用@前缀来使用局部变量：

domain = 'shop.com'
df.query('`Sender email`.str.endswith(@domain)')

输出

     Sender email
1  reply@shop.com
2    buy@shop.com

2019-08-03 12:05:15

如果您想重复查询数据帧，并且速度对您很重要，最好的方法是将数据帧转换为字典，然后通过这样做，您可以将查询速度提高数千倍。

my_df = df.set_index(column_name)
my_dict = my_df.to_dict('index')

制作my_dict字典后，您可以浏览：

if some_value in my_dict.keys():
   my_result = my_dict[some_value]

如果column_name中有重复值，则无法创建字典。但您可以使用：

my_result = my_df.loc[some_value]

2021-11-26 06:41:22

在Pandas的更新版本中，受文档启发（查看数据）：

df[df["colume_name"] == some_value] #Scalar, True/False..

df[df["colume_name"] == "some_value"] #String

通过将子句放在括号（）中，并用&和|（和/或）组合来组合多个条件。这样地：

df[(df["colume_name"] == "some_value1") & (pd[pd["colume_name"] == "some_value2"])]

其他过滤器

pandas.notna(df["colume_name"]) == True # Not NaN
df['colume_name'].str.contains("text") # Search for "text"
df['colume_name'].str.lower().str.contains("text") # Search for "text", after converting  to lowercase

2021-01-05 11:43:09

使用DuckDB选择行的DataFrames上的SQL语句

使用DuckDB，我们可以用SQL语句以高性能的方式查询panda DataFrames。

由于问题是如何根据列值从DataFrame中选择行？，问题中的示例是一个SQL查询，这个答案在本主题中看起来很合理。

例子：

In [1]: import duckdb

In [2]: import pandas as pd

In [3]: con = duckdb.connect()

In [4]: df = pd.DataFrame({"A": range(11), "B": range(11, 22)})

In [5]: df
Out[5]:
     A   B
0    0  11
1    1  12
2    2  13
3    3  14
4    4  15
5    5  16
6    6  17
7    7  18
8    8  19
9    9  20
10  10  21

In [6]: results = con.execute("SELECT * FROM df where A > 2").df()

In [7]: results
Out[7]:
    A   B
0   3  14
1   4  15
2   5  16
3   6  17
4   7  18
5   8  19
6   9  20
7  10  21

2022-04-21 09:42:40

如何根据列值从DataFrame中选择行？

推荐文章

最新文章

标签