标记数据错误

我试图使用熊猫操作.csv文件，但我得到这个错误:

pandas.parser.CParserError:标记数据错误。C错误:第3行有2个字段，见12

我试着读过熊猫的文件，但一无所获。

我的代码很简单:

path = 'GOOG Key Ratios.csv'
#print(open(path).read())
data = pd.read_csv(path)

我该如何解决这个问题?我应该使用csv模块还是其他语言?

文件来自晨星公司

当前回答

下面的命令序列工作(我丢失了数据的第一行-no header=None present-，但至少它加载):

Df = pd.read_csv(文件名， usecols =范围(0,42)) df。列=[‘年’,‘莫’,‘天’,“人力资源”,“分”,“秒”,“猎狗”, ' error '， ' rectype '， ' lane '， ' speed '， ' class '， ' length ' ' gvw ' ' esal ' ' w1 ' ' s1 ' ' w2 ' ' s2 ' ' w3 ' ' s3 ' ' w4 ' ' s4 ' ' w5 ' ' s5 ' ' w6 ' ' s6 ' ' w7 ' ' s7 ' ' w8 ' ' s8 ' ' w9 ' ' s9 ' ' w10 ' ' s10 ' ' w11 '， ' s11 '， ' w12 '， ' s12 '， ' w13 '， ' s13 '， ' w14 ']

以下不工作:

Df = pd.read_csv(文件名，名称=[‘年’,‘莫’,‘天’,“人力资源”,“分”,“秒”,“猎狗”, ' error '， ' rectype '， ' lane '， ' speed '， ' class '， ' length ' ' gvw ' ' esal ' ' w1 ' ' s1 ' ' w2 ' ' s2 ' ' w3 ' ' s3 ' ' w4 ' ' s4 ' ' w5 ' ' s5 ' ' w6 ' ' s6 ' ' w7 ' ' s7 ' ' w8 ' ' s8 ' ' w9 ' ' s9 ' ' w10 ' ' s10 ' ' w11 '， ' s11 '， ' w12 '， ' s12 '， ' w13 '， ' s13 '， ' w14 ']， usecols =范围(0,42))

CParserError:标记数据错误。C错误:在1605634行中预期有53个字段，看到54 以下不工作:

df = pd read_csv(文件) 标题=郎)

CParserError:标记数据错误。C错误:在1605634行中预期有53个字段，看到54

因此，在你的问题中，你必须传递usecols=range(0,2)

2018-05-23 11:45:25

其他回答

解析器被文件头弄糊涂了。它读取第一行并从该行推断列数。但是前两行并不能代表文件中的实际数据。

用data = pd试试。read_csv(路径,skiprows = 2)

2013-08-04 02:24:35

在处理类似的解析错误时，我发现另一种方法很有用，它使用CSV模块将数据重新路由到pandas df。例如:

import csv
import pandas as pd
path = 'C:/FileLocation/'
file = 'filename.csv'
f = open(path+file,'rt')
reader = csv.reader(f)

#once contents are available, I then put them in a list
csv_list = []
for l in reader:
    csv_list.append(l)
f.close()
#now pandas has no problem getting into a df
df = pd.DataFrame(csv_list)

我发现CSV模块对于格式不佳的逗号分隔的文件更加健壮，因此已经成功地用这种方法解决了诸如此类的问题。

2018-01-26 20:54:38

大多数有用的答案已经提到了，但是我建议将pandas数据框架保存为parquet文件。Parquet文件没有这个问题，同时它们是内存高效的。

2019-06-11 09:47:59

在我的例子中，问题是熊猫版本，所以熊猫1.3.5就像一个魅力。

2022-10-29 15:06:46

这看起来很丑，但你会有你的数据框架

import re
path = 'GOOG Key Ratios.csv'

try:
    data = pd.read_csv(path)
except Exception as e:
    val = re.findall('tokenizing.{1,100}\s*Expected\s*(\d{1,2})\s*',str(e),re.I)
    data = pd.read_csv(path, skiprows=int(val[0])-1)

2021-08-26 20:17:07

标记数据错误

推荐文章

最新文章

标签