在Pandas数据帧中选择多个列

如何从df中选择列a和b，并将它们保存到新的数据帧df1中？

index  a   b   c
1      2   3   4
2      3   4   5

尝试失败：

df1 = df['a':'b']
df1 = df.ix[:, 'a':'b']

当前回答

在最新版本的Pandas中，有一种简单的方法可以做到这一点。列名（字符串）可以按您喜欢的方式进行切片。

columns = ['b', 'c']
df1 = pd.DataFrame(df, columns=columns)

2016-02-04 14:05:35

其他回答

尝试使用pandas.DataFrame.get（请参阅文档）：

import pandas as pd
import numpy as np

dates = pd.date_range('20200102', periods=6)
df = pd.DataFrame(np.random.randn(6, 4), index=dates, columns=list('ABCD'))
df.get(['A', 'C'])

2020-08-02 19:10:36

您可以提供要删除的列的列表，并使用Pandas DataFrame上的drop（）函数仅返回所需的列。

只是说说而已

colsToDrop = ['a']
df.drop(colsToDrop, axis=1)

将返回仅包含列b和c的DataFrame。

此处记录了drop方法。

2014-09-03 11:30:59

假设你的列名（df.columns）是['index'，'a'，'b'，'c']，那么你想要的数据就在第三列和第四列。如果脚本运行时不知道它们的名称，可以执行以下操作

newdf = df[df.columns[2:4]] # Remember, Python is zero-offset! The "third" entry is at slot two.

正如EMS在回答中所指出的，df.ix对列进行了更简洁的切片，但.columns切片接口可能更自然，因为它使用了普通的一维Python列表索引/切片语法。

警告：“index”是DataFrame列的错误名称。同一标签也用于实际df.index属性，即index数组。因此，您的列由df['index']返回，而真正的DataFrame索引由df.index返回。index是一种特殊的系列，优化用于查找其元素值。对于df.index，它用于按标签查找行。df.columns属性也是一个pd.Index数组，用于按标签查找列。

2012-10-31 18:57:33

在最新版本的Pandas中，有一种简单的方法可以做到这一点。列名（字符串）可以按您喜欢的方式进行切片。

columns = ['b', 'c']
df1 = pd.DataFrame(df, columns=columns)

2016-02-04 14:05:35

我已经看到了几个答案，但其中一个仍然不清楚。你会如何选择那些感兴趣的专栏？

答案是，如果您将它们收集在列表中，则可以使用列表引用列。

实例

print(extracted_features.shape)
print(extracted_features)

(63,)
['f000004' 'f000005' 'f000006' 'f000014' 'f000039' 'f000040' 'f000043'
 'f000047' 'f000048' 'f000049' 'f000050' 'f000051' 'f000052' 'f000053'
 'f000054' 'f000055' 'f000056' 'f000057' 'f000058' 'f000059' 'f000060'
 'f000061' 'f000062' 'f000063' 'f000064' 'f000065' 'f000066' 'f000067'
 'f000068' 'f000069' 'f000070' 'f000071' 'f000072' 'f000073' 'f000074'
 'f000075' 'f000076' 'f000077' 'f000078' 'f000079' 'f000080' 'f000081'
 'f000082' 'f000083' 'f000084' 'f000085' 'f000086' 'f000087' 'f000088'
 'f000089' 'f000090' 'f000091' 'f000092' 'f000093' 'f000094' 'f000095'
 'f000096' 'f000097' 'f000098' 'f000099' 'f000100' 'f000101' 'f000103']

我有以下列表/NumPy数组extracted_features，指定了63列。原始数据集有103列，我想提取这些列，然后使用

dataset[extracted_features]

你最终会得到这个

这是你在机器学习中经常用到的东西（更具体地说，在特征选择中）。我也想讨论其他方式，但我认为其他Stack Overflower用户已经涵盖了这一点。

2019-05-26 19:21:50

在Pandas数据帧中选择多个列

推荐文章

最新文章

标签