检测编码并使所有内容都为UTF-8

我从各种RSS订阅中阅读大量文本，并将它们插入到我的数据库中。

当然，在提要中使用了几种不同的字符编码，例如UTF-8和ISO 8859-1。

不幸的是，文本的编码有时会有问题。例子:

“Fußball”中的“ß”在我的数据库中应该是这样的:“ÂŸ”。如果是“ÂŸ”，则显示正确。有时，“Fußball”中的“ß”在我的数据库中看起来像这样:“ÃƒÂŸ”。当然，这样就会显示错误。在其他情况下，“ß”被保存为“ß”-因此没有任何变化。然后它也会被错误地显示。

我怎么做才能避免情况2和3?

我如何使所有的编码相同，最好是UTF-8?什么时候我必须使用utf8_encode()，什么时候我必须使用utf8_decode()(很清楚的效果是什么，但什么时候我必须使用函数?)，什么时候我必须对输入什么都不做?

如何让所有编码都相同呢?也许使用函数mb_detect_encoding()?我能写一个函数吗?所以我的问题是:

如何找出文本使用的编码? 我如何将其转换为UTF-8 -无论旧的编码是什么?

这样的函数可行吗?

function correct_encoding($text) {
    $current_encoding = mb_detect_encoding($text, 'auto');
    $text = iconv($current_encoding, 'UTF-8', $text);
    return $text;
}

我已经测试过了，但是不行。有什么问题吗?

当前回答

if(!mb_check_encoding($str)){
    $str = iconv("windows-1251", "UTF-8", $str);
}

这对我很有帮助

2022-12-16 05:15:18

其他回答

提醒一下。您说在您的数据库中“ß”应该显示为“ÂŸ”。

这可能是因为你正在使用一个Latin-1字符编码的数据库，或者你的PHP-MySQL连接设置错误，也就是说，P认为你的MySQL设置为使用UTF-8，所以它发送数据为UTF-8，但你的MySQL认为PHP发送的数据编码为ISO 8859-1，所以它可能再次尝试将你发送的数据编码为UTF-8，造成这种麻烦。

看一下mysql_set_charset。它可能对你有帮助。

2011-06-27 16:12:12

当你试着掌握多种语言时，比如日语和韩语，你可能会遇到麻烦。

带有'auto'参数的Mb_convert_encoding不能很好地工作。设置mb_detect_order('ASCII,UTF-8,JIS,EUC- jp,SJIS,EUC- kr,UHC')没有帮助，因为它会错误地检测EUC-*。

我的结论是，只要输入字符串来自HTML，它就应该在元元素中使用“字符集”。我使用Simple HTML DOM Parser，因为它支持无效的HTML。

下面的代码片段从网页中提取title元素。如果您想转换整个页面，那么您可能需要删除一些行。

<?php
require_once 'simple_html_dom.php';

echo convert_title_to_utf8(file_get_contents($argv[1])), PHP_EOL;

function convert_title_to_utf8($contents)
{
    $dom = str_get_html($contents);
    $title = $dom->find('title', 0);
    if (empty($title)) {
        return null;
    }
    $title = $title->plaintext;
    $metas = $dom->find('meta');
    $charset = 'auto';
    foreach ($metas as $meta) {
        if (!empty($meta->charset)) { // HTML5
            $charset = $meta->charset;
        } else if (preg_match('@charset=(.+)@', $meta->content, $match)) {
            $charset = $match[1];
        }
    }
    if (!in_array(strtolower($charset), array_map('strtolower', mb_list_encodings()))) {
        $charset = 'auto';
    }
    return mb_convert_encoding($title, 'UTF-8', $charset);
}

2011-09-14 23:29:02

这很简单:当您得到一些不是UTF-8的东西时，您必须将其编码为UTF-8。

因此，当你获取某个ISO 8859-1的提要时，通过utf8_encode解析它。

但是，如果您正在获取UTF-8提要，则不需要做任何事情。

2009-05-26 13:55:14

ÂŸ是Mojibake for ß。在你的数据库中，你可能有以下十六进制值之一(使用SELECT hex (col)…)来找出):

DF如果列是"latin1"， C39F如果列是utf8—OR—它是latin1，但是“双编码” C383C5B8如果被双编码为utf8列

你不应该在PHP中使用任何编码/解码函数;相反，您应该正确地设置数据库和到数据库的连接。

如果涉及MySQL，请参阅:UTF-8字符的问题;我看到的不是我储存的

2016-08-19 18:46:58

制定RSS提要的字符编码似乎很复杂。即使是普通的网页也经常忽略或谎报它们的编码。

因此，您可以尝试使用正确的方法来检测编码，然后退回到某种形式的自动检测(猜测)。