如何更改DataFrame列的顺序？

我有以下DataFrame（df）：

import numpy as np
import pandas as pd

df = pd.DataFrame(np.random.rand(10, 5))

我通过分配添加更多列：

df['mean'] = df.mean(1)

如何将列的意思移到前面，即将其设置为第一列，而其他列的顺序保持不变？

当前回答

一种简单的方法是使用set（），特别是当您有一长串列并且不想手动处理它们时：

cols = list(set(df.columns.tolist()) - set(['mean']))
cols.insert(0, 'mean')
df = df[cols]

2017-09-12 02:06:24

其他回答

我想在一个数据帧前面加上两列，我不知道所有列的确切名称，因为它们是从之前的pivot语句生成的。所以，如果你也遇到同样的情况：把你知道名字的列放在前面，然后让它们跟着“所有其他列”，我提出了以下一般解决方案：

df = df.reindex_axis(['Col1','Col2'] + list(df.columns.drop(['Col1','Col2'])), axis=1)

2017-07-27 09:21:39

此函数避免了您只需列出数据集中的每个变量来对其中的几个变量进行排序。

def order(frame,var):
    if type(var) is str:
        var = [var] #let the command take a string or list
    varlist =[w for w in frame.columns if w not in var]
    frame = frame[var+varlist]
    return frame

它需要两个参数，第一个是数据集，第二个是要放到前面的数据集中的列。

所以在我的例子中，我有一个名为Frame的数据集，其中包含变量A1、A2、B1、B2、Total和Date。如果我想把道达尔带到前面，那么我所要做的就是：

frame = order(frame,['Total'])

如果我想将Total和Date带到前台，那么我会：

frame = order(frame,['Total','Date'])

编辑：

另一种有用的使用方法是，如果您有一个不熟悉的表，并且正在查找其中包含特定术语的变量，例如VAR1、VAR2，。。。您可以执行以下操作：

frame = order(frame,[v for v in frame.columns if "VAR" in v])

2014-07-29 19:30:18

我很喜欢Shoresh的回答：当你不知道位置时，使用集合功能来删除列，但这不符合我的目的，因为我需要保持原始的列顺序（具有任意的列标签）。

不过，我通过使用boltons包中的IndexedSet实现了这一点。

我还需要重新添加多个列标签，因此对于更一般的情况，我使用了以下代码：

from boltons.setutils import IndexedSet
cols = list(IndexedSet(df.columns.tolist()) - set(['mean', 'std']))
cols[0:0] =['mean', 'std']
df = df[cols]

希望这对搜索此线程以寻求通用解决方案的任何人都有用。

2017-12-09 04:14:45

您可以使用一个集合，它是唯一元素的无序集合，以保持“其他列的顺序不变”：

other_columns = list(set(df.columns).difference(["mean"])) #[0, 1, 2, 3, 4]

然后，可以通过以下方式使用lambda将特定列移动到前面：

In [1]: import numpy as np                                                                               

In [2]: import pandas as pd                                                                              

In [3]: df = pd.DataFrame(np.random.rand(10, 5))                                                         

In [4]: df["mean"] = df.mean(1)                                                                          

In [5]: move_col_to_front = lambda df, col: df[[col]+list(set(df.columns).difference([col]))]            

In [6]: move_col_to_front(df, "mean")                                                                    
Out[6]: 
       mean         0         1         2         3         4
0  0.697253  0.600377  0.464852  0.938360  0.945293  0.537384
1  0.609213  0.703387  0.096176  0.971407  0.955666  0.319429
2  0.561261  0.791842  0.302573  0.662365  0.728368  0.321158
3  0.518720  0.710443  0.504060  0.663423  0.208756  0.506916
4  0.616316  0.665932  0.794385  0.163000  0.664265  0.793995
5  0.519757  0.585462  0.653995  0.338893  0.714782  0.305654
6  0.532584  0.434472  0.283501  0.633156  0.317520  0.994271
7  0.640571  0.732680  0.187151  0.937983  0.921097  0.423945
8  0.562447  0.790987  0.200080  0.317812  0.641340  0.862018
9  0.563092  0.811533  0.662709  0.396048  0.596528  0.348642

In [7]: move_col_to_front(df, 2)                                                                         
Out[7]: 
          2         0         1         3         4      mean
0  0.938360  0.600377  0.464852  0.945293  0.537384  0.697253
1  0.971407  0.703387  0.096176  0.955666  0.319429  0.609213
2  0.662365  0.791842  0.302573  0.728368  0.321158  0.561261
3  0.663423  0.710443  0.504060  0.208756  0.506916  0.518720
4  0.163000  0.665932  0.794385  0.664265  0.793995  0.616316
5  0.338893  0.585462  0.653995  0.714782  0.305654  0.519757
6  0.633156  0.434472  0.283501  0.317520  0.994271  0.532584
7  0.937983  0.732680  0.187151  0.921097  0.423945  0.640571
8  0.317812  0.790987  0.200080  0.641340  0.862018  0.562447
9  0.396048  0.811533  0.662709  0.596528  0.348642  0.563092

2020-07-04 10:19:40

我想到了和Dmitriy Work一样的答案，显然是最简单的：

df["mean"] = df.mean(1)
l =  list(np.arange(0,len(df.columns) -1 ))
l.insert(0,-1)
df.iloc[:,l]

2021-05-05 09:49:51

如何更改DataFrame列的顺序？

推荐文章

最新文章

标签