根据日期过滤Pandas数据框架

我有一个熊猫DataFrame与“日期”列。现在我需要过滤掉DataFrame中日期在未来两个月之外的所有行。实际上，我只需要保留接下来两个月内的行。

实现这一目标的最佳方式是什么?

当前回答

如果您的datetime列具有Pandas datetime类型(例如datetime64[ns])，为了进行适当的过滤，您需要pd。时间戳对象，例如:

from datetime import date

import pandas as pd

value_to_check = pd.Timestamp(date.today().year, 1, 1)
filter_mask = df['date_column'] < value_to_check
filtered_df = df[filter_mask]

2018-06-18 00:38:24

其他回答

在pandas版本1.1.3中，我遇到了基于python datetime的索引降序排列的情况。在这种情况下

df.loc['2021-08-01':'2021-08-31']

返回空的。而

df.loc['2021-08-31':'2021-08-01']

返回预期的数据。

2021-10-12 02:38:45

如果你的日期是通过导入datetime包来标准化的，你可以简单地使用:

df[(df['date']>datetime.date(2016,1,1)) & (df['date']<datetime.date(2016,3,1))]

使用datetime包来标准化你的日期字符串，你可以使用这个函数:

import datetime
datetime.datetime.strptime

2017-01-25 07:02:52

因此，在加载csv数据文件时，我们需要将日期列设置为索引，如下所示，以便根据日期范围筛选数据。现在已弃用的方法:pd.DataFrame.from_csv()不需要这样做。

如果您只想显示1月至2月两个月的数据，例如2020-01-01至2020-02-29，您可以这样做:

import pandas as pd
mydata = pd.read_csv('mydata.csv',index_col='date') # or its index number, e.g. index_col=[0]
mydata['2020-01-01':'2020-02-29'] # will pull all the columns
#if just need one column, e.g. Cost, can be done:
mydata['2020-01-01':'2020-02-29','Cost']

这已经在Python 3.7中进行了测试。希望这对你有用。

2020-04-07 11:42:39

如果date列是索引，则使用.loc进行基于标签的索引，或使用.iloc进行位置索引。

例如:

df.loc['2014-01-01':'2014-02-01']

详情见这里http://pandas.pydata.org/pandas-docs/stable/dsintro.html#indexing-selection

如果列不是索引，你有两个选择:

将其作为索引(如果是时间序列数据，可以是临时索引，也可以是永久索引) df [(df(“日期”)> 2013-01-01)& (df(“日期”)< ' 2013-02-01 '))

请看这里的一般解释

注意:.ix已弃用。

2014-04-06 19:32:50

如果您的datetime列具有Pandas datetime类型(例如datetime64[ns])，为了进行适当的过滤，您需要pd。时间戳对象，例如:

from datetime import date

import pandas as pd

value_to_check = pd.Timestamp(date.today().year, 1, 1)
filter_mask = df['date_column'] < value_to_check
filtered_df = df[filter_mask]

2018-06-18 00:38:24

根据日期过滤Pandas数据框架

推荐文章

最新文章

标签