标记数据错误

我试图使用熊猫操作.csv文件，但我得到这个错误:

pandas.parser.CParserError:标记数据错误。C错误:第3行有2个字段，见12

我试着读过熊猫的文件，但一无所获。

我的代码很简单:

path = 'GOOG Key Ratios.csv'
#print(open(path).read())
data = pd.read_csv(path)

我该如何解决这个问题?我应该使用csv模块还是其他语言?

文件来自晨星公司

当前回答

在我的例子中，这是因为csv文件的第一行和最后两行格式与文件的中间内容不同。

因此，我所做的是将csv文件作为字符串打开，解析字符串的内容，然后使用read_csv获取数据帧。

import io
import pandas as pd

file = open(f'{file_path}/{file_name}', 'r')
content = file.read()

# change new line character from '\r\n' to '\n'
lines = content.replace('\r', '').split('\n')

# Remove the first and last 2 lines of the file
# StringIO can be considered as a file stored in memory
df = pd.read_csv(StringIO("\n".join(lines[2:-2])), header=None)

2019-11-27 01:13:44

其他回答

我遇到过这样的错误，一个丢失的引号。我使用映射软件，当导出以逗号分隔的文件时，它会在文本项周围加上引号。使用引号的文本(例如:' =英尺和' =英寸)可能会导致分隔符冲突。考虑下面这个例子，5英寸的测井曲线打印很差:

UWI_key,经度,纬度,备注 US42051316890000, 30.4386484, -96.4330734,“可怜的5””

用5英寸作为5英寸的简写，最终会给工作带来麻烦。Excel会简单地去掉额外的引号，但是Pandas没有上面提到的error_bad_lines=False参数就会失效。

2019-04-30 02:14:28

在参数中使用分隔符

pd.read_csv(filename, delimiter=",", encoding='utf-8')

它会读。

2018-11-21 13:03:24

你可以试试;

data = pd.read_csv('file1.csv', sep='\t')

2020-09-08 15:58:01

我遇到过这样的错误，一个丢失的引号。我使用映射软件，当导出以逗号分隔的文件时，它会在文本项周围加上引号。使用引号的文本(例如:“=英尺”和“=英寸”)可能会有问题。考虑下面这个例子，5英寸的测井曲线打印很差:

UWI_key,经度,纬度,备注 US42051316890000, 30.4386484, -96.4330734,“可怜的5””

用5英寸作为5英寸的简写，最终会给工作带来麻烦。Excel会简单地去掉额外的引号，但是Pandas没有上面提到的error_bad_lines=False参数就会失效。

一旦你知道了错误的本质，在导入之前，从文本编辑器(例如Sublime text 3或notepad++)中进行查找-替换可能是最简单的。

2019-04-30 02:20:32

这可能是个问题

数据中的分隔符第一行，正如@TomAugspurger所指出的

要解决这个问题，请在调用read_csv时尝试指定sep和/或头参数。例如,

df = pandas.read_csv(filepath, sep='delimiter', header=None)

在上面的代码中，sep定义了您的分隔符和header=None，告诉pandas您的源数据没有作为标题/列标题的行。因此，文档说:“如果文件不包含标题行，那么你应该显式地传递header=None”。在这种情况下，pandas会自动为每个字段{0,1,2，…}创建整数索引。

根据文档，分隔符应该不是问题。文档中说“如果sep为None[未指定]，将尝试自动确定此值。”然而，我在这方面运气不太好，包括带有明显分隔符的实例。

另一种解决方案可能是尝试自动检测分隔符

# use the first 2 lines of the file to detect separator
temp_lines = csv_file.readline() + '\n' + csv_file.readline()
dialect = csv.Sniffer().sniff(temp_lines, delimiters=';,')

# remember to go back to the start of the file for the next time it's read
csv_file.seek(0) 

df = pd.read_csv(csv_file, sep=dialect.delimiter)

2014-10-28 02:18:23

标记数据错误

推荐文章

最新文章

标签