我目前正在使用Beautiful Soup来解析HTML文件并调用get_text(),但似乎我留下了很多\xa0 Unicode表示空格。在python2.7中是否有一种有效的方法将它们全部删除,并将它们更改为空格?我想更普遍的问题应该是,有没有办法移除Unicode格式?

我尝试使用:line = line。replace(u'\xa0',' '),正如另一个线程所建议的那样,但这将\xa0改为u,所以现在我到处都是“u”。):

编辑:这个问题似乎可以通过str.replace(u'\xa0', ' ').encode('utf-8')来解决,但是仅仅使用.encode('utf-8')而不使用replace()似乎会导致它吐出更奇怪的字符,例如\xc2。有人能解释一下吗?


当前回答

0xA0 (Unicode)是UTF-8中的0xC2A0. .encode('utf8')只会取你的Unicode 0xA0并替换为UTF-8的0xC2A0。因此出现了0xc2…编码不是替代,正如您现在可能已经意识到的那样。

其他回答

我用python从sqlite3数据库中提取一些数据时遇到了同样的问题。上面的答案对我没用(不知道为什么),但这个做到了:line = line.decode('ascii', 'ignore')然而,我的目标是删除\xa0,而不是用空格替换它们。

我从Ned Batchelder的超级有用的unicode教程中得到了这个。

你可以试试string.strip() 这对我很管用!:)

\xa0在拉丁语1 (ISO 8859-1)中实际上是不间断空格,也叫chr(160)。你应该把它换成空格。

字符串=字符串。替换(u'\xa0', u' ')

当.encode('utf-8')时,它将unicode编码为utf-8,这意味着每个unicode可以由1到4个字节表示。在本例中,\xa0由2字节\xc2\xa0表示。

阅读http://docs.python.org/howto/unicode.html。

请注意:这个答案在2012年,Python已经前进,你应该能够使用unicodedata。现在正常

带有正则表达式的通用版本(它将删除所有控制字符):

import re
def remove_control_chart(s):
    return re.sub(r'\\x..', '', s)

在尝试了几种方法之后,总结一下,我是这样做的。下面是两种避免/从解析的HTML字符串中删除\xa0字符的方法。

假设我们有我们的原始html如下:

raw_html = '<p>Dear Parent, </p><p><span style="font-size: 1rem;">This is a test message, </span><span style="font-size: 1rem;">kindly ignore it. </span></p><p><span style="font-size: 1rem;">Thanks</span></p>'

所以让我们尝试清理这个HTML字符串:

from bs4 import BeautifulSoup
raw_html = '<p>Dear Parent, </p><p><span style="font-size: 1rem;">This is a test message, </span><span style="font-size: 1rem;">kindly ignore it. </span></p><p><span style="font-size: 1rem;">Thanks</span></p>'
text_string = BeautifulSoup(raw_html, "lxml").text
print text_string
#u'Dear Parent,\xa0This is a test message,\xa0kindly ignore it.\xa0Thanks'

上面的代码在字符串中生成这些字符\xa0。要正确地去除它们,我们可以使用两种方法。

方法一(推荐): 第一个是BeautifulSoup的get_text方法,条带参数为True 所以我们的代码变成:

clean_text = BeautifulSoup(raw_html, "lxml").get_text(strip=True)
print clean_text
# Dear Parent,This is a test message,kindly ignore it.Thanks

方法二: 另一种选择是使用python的库unicodedata

import unicodedata
text_string = BeautifulSoup(raw_html, "lxml").text
clean_text = unicodedata.normalize("NFKD",text_string)
print clean_text
# u'Dear Parent,This is a test message,kindly ignore it.Thanks'

我也在这个博客上详细介绍了这些方法,你可能想要参考。