将包含nan的Pandas列转换为dtype ' int '

我将数据从.csv文件读取到Pandas数据框架，如下所示。对于其中一列，即id，我想将列类型指定为int。问题是id系列有缺失/空值。

当我试图在读取.csv时将id列强制转换为整数时，我得到:

df= pd.read_csv("data.csv", dtype={'id': int}) 
error: Integer column has NA values

或者，我尝试转换列类型后，阅读如下，但这一次我得到:

df= pd.read_csv("data.csv") 
df[['id']] = df[['id']].astype(int)
error: Cannot convert NA to integer

我该如何解决这个问题?

当前回答

首先删除包含NaN的行。然后对其余行进行整型转换。最后再次插入删除的行。希望能奏效

2018-08-01 10:05:17

其他回答

从Pandas 1.0.0开始，你可以使用Pandas了。NA的价值观。这不会强制缺少值的整数列为浮点数。

在读取数据时，您需要做的是:

df= pd.read_csv("data.csv", dtype={'id': 'Int64'})

注意'Int64'被引号括起来，I是大写的。这区分了Panda的'Int64'和numpy的'Int64'。

作为旁注，这也适用于.astype()

df['id'] = df['id'].astype('Int64')

文件在这里 https://pandas.pydata.org/pandas-docs/stable/user_guide/integer_na.html

2020-09-15 03:26:41

首先删除包含NaN的行。然后对其余行进行整型转换。最后再次插入删除的行。希望能奏效

2018-08-01 10:05:17

我认为@消化1010101的方法更适合Pandas 1.2。+版本，像这样的东西应该做的工作:

df = df.astype({
            'col_1': 'Int64',
            'col_2': 'Int64',
            'col_3': 'Int64',
            'col_4': 'Int64', })

2021-06-29 03:47:43

import pandas as pd

df= pd.read_csv("data.csv")
df['id'] = pd.to_numeric(df['id'])

2020-06-06 00:09:14

我在使用pyspark时遇到了这个问题。由于这是运行在jvm上的代码的python前端，它需要类型安全，使用float而不是int是不可取的。我把熊猫包裹起来，解决了这个问题。函数中的Read_csv，该函数将在将用户定义的列转换为所需类型之前，用用户定义的填充值填充用户定义的列。这是我最终使用的:

def custom_read_csv(file_path, custom_dtype = None, fill_values = None, **kwargs):
    if custom_dtype is None:
        return pd.read_csv(file_path, **kwargs)
    else:
        assert 'dtype' not in kwargs.keys()
        df = pd.read_csv(file_path, dtype = {}, **kwargs)
        for col, typ in custom_dtype.items():
            if fill_values is None or col not in fill_values.keys():
                fill_val = -1
            else:
                fill_val = fill_values[col]
            df[col] = df[col].fillna(fill_val).astype(typ)
    return df

2018-05-23 08:45:36

将包含nan的Pandas列转换为dtype ' int '

推荐文章

最新文章

标签