标记数据错误

我试图使用熊猫操作.csv文件，但我得到这个错误:

pandas.parser.CParserError:标记数据错误。C错误:第3行有2个字段，见12

我试着读过熊猫的文件，但一无所获。

我的代码很简单:

path = 'GOOG Key Ratios.csv'
#print(open(path).read())
data = pd.read_csv(path)

我该如何解决这个问题?我应该使用csv模块还是其他语言?

文件来自晨星公司

当前回答

我自己也遇到过几次这样的问题。几乎每次，原因都是我试图打开的文件一开始就不是一个正确保存的CSV。这里的“适当”是指每一行都有相同数量的分隔符或列。

通常发生这种情况是因为我在Excel中打开了CSV，然后不恰当地保存了它。尽管文件扩展名仍然是. CSV，但纯CSV格式已经被改变了。

任何以pandas to_csv保存的文件都将被正确格式化，不应该有这个问题。但如果你用另一个程序打开它，它可能会改变结构。

希望这能有所帮助。

2016-07-07 17:22:00

其他回答

在我的例子中，分隔符不是默认的“，”，而是Tab。

pd.read_csv(file_name.csv, sep='\\t',lineterminator='\\r', engine='python', header='infer')

注意:“\t”并不像某些来源所建议的那样有效。“\\t”是必需的。

2020-05-04 18:27:09

这可能是个问题

数据中的分隔符第一行，正如@TomAugspurger所指出的

要解决这个问题，请在调用read_csv时尝试指定sep和/或头参数。例如,

df = pandas.read_csv(filepath, sep='delimiter', header=None)

在上面的代码中，sep定义了您的分隔符和header=None，告诉pandas您的源数据没有作为标题/列标题的行。因此，文档说:“如果文件不包含标题行，那么你应该显式地传递header=None”。在这种情况下，pandas会自动为每个字段{0,1,2，…}创建整数索引。

根据文档，分隔符应该不是问题。文档中说“如果sep为None[未指定]，将尝试自动确定此值。”然而，我在这方面运气不太好，包括带有明显分隔符的实例。

另一种解决方案可能是尝试自动检测分隔符

# use the first 2 lines of the file to detect separator
temp_lines = csv_file.readline() + '\n' + csv_file.readline()
dialect = csv.Sniffer().sniff(temp_lines, delimiters=';,')

# remember to go back to the start of the file for the next time it's read
csv_file.seek(0) 

df = pd.read_csv(csv_file, sep=dialect.delimiter)

2014-10-28 02:18:23

在我的例子中，问题是熊猫版本，所以熊猫1.3.5就像一个魅力。

2022-10-29 15:06:46

你也可以试试;

data = pd.read_csv('file1.csv', on_bad_lines='skip')

请注意，这将导致有问题的行被跳过。

Edit

对于熊猫< 1.3.0尝试

data = pd.read_csv("file1.csv", error_bad_lines=False)

根据熊猫API参考。

2013-08-08 14:47:15

这看起来很丑，但你会有你的数据框架

import re
path = 'GOOG Key Ratios.csv'

try:
    data = pd.read_csv(path)
except Exception as e:
    val = re.findall('tokenizing.{1,100}\s*Expected\s*(\d{1,2})\s*',str(e),re.I)
    data = pd.read_csv(path, skiprows=int(val[0])-1)

2021-08-26 20:17:07

标记数据错误

推荐文章

最新文章

标签