在Pandas数据帧中选择多个列

如何从df中选择列a和b，并将它们保存到新的数据帧df1中？

index  a   b   c
1      2   3   4
2      3   4   5

尝试失败：

df1 = df['a':'b']
df1 = df.ix[:, 'a':'b']

当前回答

你可以使用熊猫。

我创建DataFrame：

import pandas as pd
df = pd.DataFrame([[1, 2,5], [5,4, 5], [7,7, 8], [7,6,9]],
                  index=['Jane', 'Peter','Alex','Ann'],
                  columns=['Test_1', 'Test_2', 'Test_3'])

数据帧：

       Test_1  Test_2  Test_3
Jane        1       2       5
Peter       5       4       5
Alex        7       7       8
Ann         7       6       9

要按名称选择一个或多个列，请执行以下操作：

df[['Test_1', 'Test_3']]

       Test_1  Test_3
Jane        1       5
Peter       5       5
Alex        7       8
Ann         7       9

您还可以使用：

df.Test_2

然后得到Test_2列：

Jane     2
Peter    4
Alex     7
Ann      6

您还可以使用.loc（）从这些行中选择列和行。这称为“切片”。请注意，我从列Test_1到Test_3：

df.loc[:, 'Test_1':'Test_3']

“切片”是：

       Test_1  Test_2  Test_3
Jane        1       2       5
Peter       5       4       5
Alex        7       7       8
Ann         7       6       9

如果你只想让Peter和Ann在Test_1和Test_3列中：

df.loc[['Peter', 'Ann'], ['Test_1', 'Test_3']]

你得到：

       Test_1  Test_3
Peter       5       5
Ann         7       9

2019-02-20 01:01:58

其他回答

您可以提供要删除的列的列表，并使用Pandas DataFrame上的drop（）函数仅返回所需的列。

只是说说而已

colsToDrop = ['a']
df.drop(colsToDrop, axis=1)

将返回仅包含列b和c的DataFrame。

此处记录了drop方法。

2014-09-03 11:30:59

def get_slize(dataframe, start_row, end_row, start_col, end_col):
    assert len(dataframe) > end_row and start_row >= 0
    assert len(dataframe.columns) > end_col and start_col >= 0
    list_of_indexes = list(dataframe.columns)[start_col:end_col]
    ans = dataframe.iloc[start_row:end_row][list_of_indexes]
    return ans

只需使用此功能

2021-05-02 21:20:23

一种不同且简单的方法：迭代行

使用迭代

 df1 = pd.DataFrame() # Creating an empty dataframe
 for index,i in df.iterrows():
    df1.loc[index, 'A'] = df.loc[index, 'A']
    df1.loc[index, 'B'] = df.loc[index, 'B']
    df1.head()

2018-10-15 11:43:43

假设你的列名（df.columns）是['index'，'a'，'b'，'c']，那么你想要的数据就在第三列和第四列。如果脚本运行时不知道它们的名称，可以执行以下操作

newdf = df[df.columns[2:4]] # Remember, Python is zero-offset! The "third" entry is at slot two.

正如EMS在回答中所指出的，df.ix对列进行了更简洁的切片，但.columns切片接口可能更自然，因为它使用了普通的一维Python列表索引/切片语法。

警告：“index”是DataFrame列的错误名称。同一标签也用于实际df.index属性，即index数组。因此，您的列由df['index']返回，而真正的DataFrame索引由df.index返回。index是一种特殊的系列，优化用于查找其元素值。对于df.index，它用于按标签查找行。df.columns属性也是一个pd.Index数组，用于按标签查找列。

2012-10-31 18:57:33

从0.11.0版起，可以使用.loc索引器以尝试的方式对列进行切片：

df.loc[:, 'C':'E']

相当于

df[['C', 'D', 'E']]  # or df.loc[:, ['C', 'D', 'E']]

并返回列C到E。

随机生成的DataFrame演示：

import pandas as pd
import numpy as np
np.random.seed(5)
df = pd.DataFrame(np.random.randint(100, size=(100, 6)),
                  columns=list('ABCDEF'),
                  index=['R{}'.format(i) for i in range(100)])
df.head()

Out:
     A   B   C   D   E   F
R0  99  78  61  16  73   8
R1  62  27  30  80   7  76
R2  15  53  80  27  44  77
R3  75  65  47  30  84  86
R4  18   9  41  62   1  82

要获取从C到E的列（请注意，与整数切片不同，列中包含E）：

df.loc[:, 'C':'E']

Out:
      C   D   E
R0   61  16  73
R1   30  80   7
R2   80  27  44
R3   47  30  84
R4   41  62   1
R5    5  58   0
...

这同样适用于基于标签选择行。从这些列中获取行R6到R10：

df.loc['R6':'R10', 'C':'E']

Out:
      C   D   E
R6   51  27  31
R7   83  19  18
R8   11  67  65
R9   78  27  29
R10   7  16  94

.loc还接受布尔数组，因此您可以选择数组中相应条目为True的列。例如，df.columns.isin（list（'BCD'））返回array（[False，True，True，False，False，False]，dtype=bool）-如果列名在列表['B'，'C'，'D']中，则返回True；否则为False。

df.loc[:, df.columns.isin(list('BCD'))]

Out:
      B   C   D
R0   78  61  16
R1   27  30  80
R2   53  80  27
R3   65  47  30
R4    9  41  62
R5   78   5  58
...

2016-04-30 12:39:08

在Pandas数据帧中选择多个列

推荐文章

最新文章

标签