我将数据从.csv文件读取到Pandas数据框架,如下所示。对于其中一列,即id,我想将列类型指定为int。问题是id系列有缺失/空值。

当我试图在读取.csv时将id列强制转换为整数时,我得到:

df= pd.read_csv("data.csv", dtype={'id': int}) 
error: Integer column has NA values

或者,我尝试转换列类型后,阅读如下,但这一次我得到:

df= pd.read_csv("data.csv") 
df[['id']] = df[['id']].astype(int)
error: Cannot convert NA to integer

我该如何解决这个问题?


当前回答

对于任何需要在包含NULL/ nan的列中具有int值,但在其他答案中提到的不能使用pandas版本0.24.0可空整数特性的约束下工作的人,我建议使用pd.where将列转换为对象类型:

df = df.where(pd.notnull(df), None)

这将数据帧中的所有nan转换为None,将混合类型的列作为对象,但将int值保留为int,而不是float。

其他回答

我的用例是在加载到DB表之前修改数据:

df[col] = df[col].fillna(-1)
df[col] = df[col].astype(int)
df[col] = df[col].astype(str)
df[col] = df[col].replace('-1', np.nan)

删除nan,转换为int,转换为str,然后重新插入nan。

它不漂亮,但它完成了工作!

使用pd.to_numeric ()

df["DateColumn"] = pd.to_numeric(df["DateColumn"])

简单干净

我也遇到过类似的问题。这就是我的解决方案:

def toint(zahl = 1.1):
    try:
        zahl = int(zahl)
    except:
        zahl = np.nan
    return zahl

print(toint(4.776655), toint(np.nan), toint('test'))

4 楠楠

df = pd.read_csv("data.csv") 
df['id'] = df['id'].astype(float)
df['id'] = toint(df['id'])

类似于@hibernado的答案,但保持为整数(而不是字符串)

df[col] = df[col].fillna(-1)
df[col] = df[col].astype(int)
df[col] = np.where(df[col] == -1, np.nan, df[col])

首先,您需要指定新的整数类型Int8(…Int64),它可以处理空整数数据(pandas版本>= 0.24.0)

df = df.astype('Int8')

但是你可能想要只针对包含NaN/null的整数数据的特定列:

df = df . astype((’col1’:’Int8’’col2’:’Int8’、’col3’:’Int8’)

此时,NaN将被转换为<NA>,如果您希望使用df.fillna()更改默认空值,则需要在希望更改的列上强制使用对象数据类型,否则您将看到 TypeError: <U1不能转换为IntegerDtype

你可以通过 Df = Df .astype(对象)如果你不介意将每个列的数据类型更改为对象(单独地,每个值的类型仍然保留)…或 Df = Df。如果您喜欢针对单个列,则Astype ({"col1":对象,"col2":对象})。

这应该有助于强制将混合了null值的整数列保持为整数格式,并将空值更改为您喜欢的任何值。我不能说这种方法的效率,但它适用于我的格式化和打印目的。