将Pandas或Numpy Nan替换为None以用于MysqlDB

我试图写一个熊猫数据帧(或可以使用numpy数组)到mysql数据库使用MysqlDB。MysqlDB似乎不理解'nan'，我的数据库抛出一个错误，说nan不在字段列表中。我需要找到一种方法将“nan”转换为NoneType。

什么好主意吗?

你可以在numpy数组中用None替换nan:

>>> x = np.array([1, np.nan, 3])
>>> y = np.where(np.isnan(x), None, x)
>>> print y
[1.0 None 3.0]
>>> print type(y[1])
<type 'NoneType'>

2013-01-04 18:57:52

@bogatron是对的，你可以用where，值得注意的是，你可以在熊猫的原生环境中这样做:

df1 = df.where(pd.notnull(df), None)

注意:这将所有列的dtype更改为object。

例子:

In [1]: df = pd.DataFrame([1, np.nan])

In [2]: df
Out[2]: 
    0
0   1
1 NaN

In [3]: df1 = df.where(pd.notnull(df), None)

In [4]: df1
Out[4]: 
      0
0     1
1  None

注意:你不能做的是重铸DataFrames dtype以允许所有的数据类型，使用astype，然后使用DataFrame fillna方法:

df1 = df.astype(object).replace(np.nan, 'None')

不幸的是，这和使用replace都不能与None一起工作，看到这个(关闭)问题。

顺便说一句，值得注意的是，对于大多数用例，您不需要将NaN替换为None，请参阅这个关于pandas中NaN和None之间差异的问题。

然而，在这个特定的情况下，你似乎是这样的(至少在回答这个问题的时候)。

2013-01-04 19:01:25

很老了，但我偶然发现了同样的问题。试着这样做:

df['col_replaced'] = df['col_with_npnans'].apply(lambda x: None if np.isnan(x) else x)

2016-11-09 14:48:22

经过一番摸索，这招对我很管用:

df = df.astype(object).where(pd.notnull(df),None)

2017-08-02 19:47:59

df = df.replace({np.nan: None})

注意:对于<1.4的pandas版本，这会将所有受影响列的dtype更改为object。为了避免这种情况，请使用以下语法:

df = df.replace(np.nan, None)

这要归功于Github上的这个家伙和Killian Huyghe的评论。

2019-01-28 14:07:22

只是给@安迪·海登的回答补充了一句:

因为DataFrame。mask是DataFrame的孪生兄弟。其中，它们具有完全相同的签名，但含义相反:

DataFrame。where用于替换条件为False的值。 DataFrame。mask用于替换条件为True的值。

所以在这个问题中，使用df.mask(df.isna()， other=None, inplace=True)可能更直观。

2019-04-29 04:21:44

另一个补充:在替换倍数和将列的类型从object转换回float时要小心。如果你想确保你的None不会翻回np。NaN使用@andy-hayden的建议使用pd.where。说明替换仍然可能出错:

In [1]: import pandas as pd

In [2]: import numpy as np

In [3]: df = pd.DataFrame({"a": [1, np.NAN, np.inf]})

In [4]: df
Out[4]:
     a
0  1.0
1  NaN
2  inf

In [5]: df.replace({np.NAN: None})
Out[5]:
      a
0     1
1  None
2   inf

In [6]: df.replace({np.NAN: None, np.inf: None})
Out[6]:
     a
0  1.0
1  NaN
2  NaN

In [7]: df.where((pd.notnull(df)), None).replace({np.inf: None})
Out[7]:
     a
0  1.0
1  NaN
2  NaN

2019-10-10 13:35:17

我相信最干净的方法是使用pandas. datafframe .to_numpy()方法中的na_value参数(docs):

na_value:任意，可选用于缺失值的值。默认值取决于dtype和DataFrame列的dtypes。 1.1.0新版功能。

例如，你可以使用None替换NaN的字典

columns = df.columns.tolist()
dicts_with_nan_replaced = [
    dict(zip(columns, x))
    for x in df.to_numpy(na_value=None)
]

2021-07-13 12:51:09

您是否有代码块需要检查?

使用.loc, pandas可以基于逻辑条件(过滤)访问记录并对它们执行操作(当使用=时)。将.loc掩码设置为某个值将会就地改变返回数组(所以这里要小心;我建议在使用代码块之前测试一个df副本)。

df.loc[df['SomeColumn'].isna(), 'SomeColumn'] = None

外层的函数是df。loc[row_label, column_label] =无。我们将使用.isna()方法为row_label使用布尔掩码，在SomeColumn列中查找“NoneType”值。

我们将使用.isna()方法返回列SomeColumn中的行/记录布尔数组，作为我们的row_label: df['SomeColumn'].isna()。它将分离SomeColumn中含有熊猫用.isna()方法检查的任何'NoneType'项的所有行。

我们将在屏蔽row_label的数据帧时使用column_label，并在标识我们想要用于.loc掩码的列时使用column_label。

最后，我们将.loc掩码设置为None，因此返回的行/记录将根据掩码索引更改为None。

下面是关于.loc和.isna()的pandas文档链接。

引用: https://pandas.pydata.org/docs/reference/api/pandas.DataFrame.loc.html https://pandas.pydata.org/docs/reference/api/pandas.DataFrame.isna.html

2021-10-05 19:52:34

这招对我很管用:

df = df.fillna(0)

2021-11-25 13:54:49

在替换为where语句之前，将numpy NaN转换为pandas NA:

df = df.replace(np.NaN, pd.NA).where(df.notnull(), None)

2021-12-01 07:07:55

在熊猫更新到1.3.2后，我发现推荐的答案和替代建议都不适合我的应用程序，我用蛮力方法解决了安全问题:

buf = df.to_json(orient='records')
recs = json.loads(buf)

2021-12-02 20:16:35

取代np。nan和None在不同版本的熊猫中完成的不同:

if version.parse(pd.__version__) >= version.parse('1.3.0'):
    df = df.replace({np.nan: None})
else:
    df = df.where(pd.notnull(df), None)

这解决了熊猫版本<1.3.0的问题，如果df中的值已经为None，则df.replace({np. replace)nan: None})将切换回np。Nan(反之亦然)。

2022-01-26 11:37:27

还有另一个选择，它确实对我有用:

df = df.astype(object).replace(np.nan, None)

2022-03-04 15:35:57

令人惊讶的是，之前的答案都不适合我，所以我不得不对每一列都这样做。

for column in df.columns:
            df[column] = df[column].where(pd.notnull(df[column]), None)

2022-05-12 13:43:02

现在对我来说，徒手做是唯一可行的方法。

@rodney cox的回答几乎在所有情况下都对我有效。

下面的代码将所有列设置为对象数据类型，然后将任何空值替换为None。将列数据类型设置为object非常重要，因为这样可以防止pandas进一步更改类型。

for col in df.columns:
    df[col] = df[col].astype(object)
    df.loc[df[col].isnull(), col] = None

警告:此解决方案效率不高，因为它处理的列可能没有np。nan值。

2022-05-30 16:16:26

有时使用此代码更好。注意np指的是numpy:

df = df.fillna(np.nan).replace([np.nan], [None])

2023-01-30 16:05:40

将Pandas或Numpy Nan替换为None以用于MysqlDB

推荐文章

最新文章

标签