将包含nan的Pandas列转换为dtype ' int '

我将数据从.csv文件读取到Pandas数据框架，如下所示。对于其中一列，即id，我想将列类型指定为int。问题是id系列有缺失/空值。

当我试图在读取.csv时将id列强制转换为整数时，我得到:

df= pd.read_csv("data.csv", dtype={'id': int}) 
error: Integer column has NA values

或者，我尝试转换列类型后，阅读如下，但这一次我得到:

df= pd.read_csv("data.csv") 
df[['id']] = df[['id']].astype(int)
error: Cannot convert NA to integer

我该如何解决这个问题?

当前回答

如果你想在链接方法时使用它，你可以使用assign:

df = (
     df.assign(col = lambda x: x['col'].astype('Int64'))
)

2020-10-23 15:30:43

其他回答

类似于@hibernado的答案，但保持为整数(而不是字符串)

df[col] = df[col].fillna(-1)
df[col] = df[col].astype(int)
df[col] = np.where(df[col] == -1, np.nan, df[col])

2022-08-09 08:59:19

import pandas as pd

df= pd.read_csv("data.csv")
df['id'] = pd.to_numeric(df['id'])

2020-06-06 00:09:14

整数列中缺少NaN代表是熊猫的“陷阱”。

通常的解决方法是简单地使用浮动。

2014-01-22 17:42:28

假设您的DateColumn格式3312018.0应该转换为03/31/2018作为字符串。并且，一些记录丢失或为0。

df['DateColumn'] = df['DateColumn'].astype(int)
df['DateColumn'] = df['DateColumn'].astype(str)
df['DateColumn'] = df['DateColumn'].apply(lambda x: x.zfill(8))
df.loc[df['DateColumn'] == '00000000','DateColumn'] = '01011980'
df['DateColumn'] = pd.to_datetime(df['DateColumn'], format="%m%d%Y")
df['DateColumn'] = df['DateColumn'].apply(lambda x: x.strftime('%m/%d/%Y'))

2018-04-06 14:40:04

如果可以修改存储的数据，可以使用一个标记值来替换缺失的id。一个常见的用例，由列名推断，id是一个严格大于零的整数，您可以使用0作为前哨值，这样就可以编写

if row['id']:
   regular_process(row)
else:
   special_process(row)

2016-04-25 08:38:01

将包含nan的Pandas列转换为dtype ' int '

推荐文章

最新文章

标签