标记数据错误

我试图使用熊猫操作.csv文件，但我得到这个错误:

pandas.parser.CParserError:标记数据错误。C错误:第3行有2个字段，见12

我试着读过熊猫的文件，但一无所获。

我的代码很简单:

path = 'GOOG Key Ratios.csv'
#print(open(path).read())
data = pd.read_csv(path)

我该如何解决这个问题?我应该使用csv模块还是其他语言?

文件来自晨星公司

当前回答

我遇到过这样的错误，一个丢失的引号。我使用映射软件，当导出以逗号分隔的文件时，它会在文本项周围加上引号。使用引号的文本(例如:' =英尺和' =英寸)可能会导致分隔符冲突。考虑下面这个例子，5英寸的测井曲线打印很差:

UWI_key,经度,纬度,备注 US42051316890000, 30.4386484, -96.4330734,“可怜的5””

用5英寸作为5英寸的简写，最终会给工作带来麻烦。Excel会简单地去掉额外的引号，但是Pandas没有上面提到的error_bad_lines=False参数就会失效。

2019-04-30 02:14:28

其他回答

我从同事那里收到了.csv文件，当我试图使用pd.read_csv()读取csv文件时，我收到了类似的错误。显然，它试图使用第一行来为数据框架生成列，但许多行包含的列比第一行所暗示的要多。我最终通过简单地打开文件并重新保存为.csv并再次使用pd.read_csv()来解决这个问题。

2018-07-13 17:31:54

在我的例子中，问题是熊猫版本，所以熊猫1.3.5就像一个魅力。

2022-10-29 15:06:46

你也可以试试;

data = pd.read_csv('file1.csv', on_bad_lines='skip')

请注意，这将导致有问题的行被跳过。

Edit

对于熊猫< 1.3.0尝试

data = pd.read_csv("file1.csv", error_bad_lines=False)

根据熊猫API参考。

2013-08-08 14:47:15

解析器被文件头弄糊涂了。它读取第一行并从该行推断列数。但是前两行并不能代表文件中的实际数据。

用data = pd试试。read_csv(路径,skiprows = 2)

2013-08-04 02:24:35

对我来说，问题是一个新列被附加到我的CSV盘中。如果我使用error_bad_lines=False，接受的答案解决方案将不起作用，因为未来的每一行都将被丢弃。

这种情况下的解决方案是使用pd.read_csv()中的usecols参数。通过这种方式，我可以只指定需要读入CSV中的列，并且只要标题列存在(并且列名不改变)，我的Python代码将对未来的CSV更改保持弹性。

usecols : list-like or callable, optional Return a subset of the columns. If list-like, all elements must either be positional (i.e. integer indices into the document columns) or strings that correspond to column names provided either by the user in names or inferred from the document header row(s). For example, a valid list-like usecols parameter would be [0, 1, 2] or ['foo', 'bar', 'baz']. Element order is ignored, so usecols=[0, 1] is the same as [1, 0]. To instantiate a DataFrame from data with element order preserved use pd.read_csv(data, usecols=['foo', 'bar'])[['foo', 'bar']] for columns in ['foo', 'bar'] order or pd.read_csv(data, usecols=['foo', 'bar'])[['bar', 'foo']] for ['bar', 'foo'] order.

例子

my_columns = ['foo', 'bar', 'bob']
df = pd.read_csv(file_path, usecols=my_columns)

这样做的另一个好处是，如果我只使用一个有18-20列的CSV中的3-4列，我可以将更少的数据加载到内存中。

2019-03-01 14:19:06

标记数据错误

推荐文章

最新文章

标签