检测编码并使所有内容都为UTF-8

我从各种RSS订阅中阅读大量文本，并将它们插入到我的数据库中。

当然，在提要中使用了几种不同的字符编码，例如UTF-8和ISO 8859-1。

不幸的是，文本的编码有时会有问题。例子:

“Fußball”中的“ß”在我的数据库中应该是这样的:“ÂŸ”。如果是“ÂŸ”，则显示正确。有时，“Fußball”中的“ß”在我的数据库中看起来像这样:“ÃƒÂŸ”。当然，这样就会显示错误。在其他情况下，“ß”被保存为“ß”-因此没有任何变化。然后它也会被错误地显示。

我怎么做才能避免情况2和3?

我如何使所有的编码相同，最好是UTF-8?什么时候我必须使用utf8_encode()，什么时候我必须使用utf8_decode()(很清楚的效果是什么，但什么时候我必须使用函数?)，什么时候我必须对输入什么都不做?

如何让所有编码都相同呢?也许使用函数mb_detect_encoding()?我能写一个函数吗?所以我的问题是:

如何找出文本使用的编码? 我如何将其转换为UTF-8 -无论旧的编码是什么?

这样的函数可行吗?

function correct_encoding($text) {
    $current_encoding = mb_detect_encoding($text, 'auto');
    $text = iconv($current_encoding, 'UTF-8', $text);
    return $text;
}

我已经测试过了，但是不行。有什么问题吗?

当前回答

对于汉字，通常采用GBK编码。此外，在测试时，投票最多的答案不成立。这里有一个简单的修复方法，让它也能正常工作:

function toUTF8($raw) {
    try{
        return mb_convert_encoding($raw, "UTF-8", "auto"); 
    }catch(\Exception $e){
        return mb_convert_encoding($raw, "UTF-8", "GBK"); 
    }
}

注:这个解决方案是在2017年编写的，应该可以修复当时PHP的问题。我还没有测试最新的PHP是否已经正确理解自动。

2017-06-29 03:51:00

其他回答

我一直在寻找编码的解决方案，这个页面可能是多年搜索的结论!我测试了你提到的一些建议，以下是我的笔记:

这是我的测试字符串:

这是一个“wròng wrìtten”字符串bùt I nèed到pù‘sòme’的特殊 Chàrs看thèm, convertèd看fùnctìon!!&就是这样!

我执行INSERT操作将该字符串保存在数据库中的字段中，该字段设置为utf8_general_ci

我的页面的字符集是UTF-8。

如果我像这样做一个INSERT，在我的数据库中，我有一些字符可能来自火星…

所以我需要把它们转换成一些“理智的”UTF-8。我尝试utf8_encode()，但仍然外星人字符入侵我的数据库…

所以我尝试使用函数forceeutf8张贴在数字8，但在数据库中保存的字符串看起来像这样:

这是一个“wrÃ²ng wrÃ tten”的字符串bÃ¹t I nÃ¨ed to pÃ¹'sÃ²me'特殊 ChÃ rs看thÃ¨m, convertÃ¨d由fÃ¹nctÃ on!!&就是这样!

所以在这个页面上收集更多的信息，并将它们与其他页面上的其他信息合并，我用这个解决方案解决了我的问题:

$finallyIDidIt = mb_convert_encoding(
  $string,
  mysql_client_encoding($resourceID),
  mb_detect_encoding($string)
);

现在在我的数据库中，我有了编码正确的字符串。

注意:

唯一需要注意的是mysql_client_encoding函数! 您需要连接到数据库，因为这个函数需要一个资源ID作为参数。

但是，我只是在插入之前重新编码，所以对我来说这不是问题。

2011-12-01 00:15:08

制定RSS提要的字符编码似乎很复杂。即使是普通的网页也经常忽略或谎报它们的编码。

因此，您可以尝试使用正确的方法来检测编码，然后退回到某种形式的自动检测(猜测)。

2009-05-26 14:02:41

对于汉字，通常采用GBK编码。此外，在测试时，投票最多的答案不成立。这里有一个简单的修复方法，让它也能正常工作:

function toUTF8($raw) {
    try{
        return mb_convert_encoding($raw, "UTF-8", "auto"); 
    }catch(\Exception $e){
        return mb_convert_encoding($raw, "UTF-8", "GBK"); 
    }
}

注:这个解决方案是在2017年编写的，应该可以修复当时PHP的问题。我还没有测试最新的PHP是否已经正确理解自动。

2017-06-29 03:51:00

if(!mb_check_encoding($str)){
    $str = iconv("windows-1251", "UTF-8", $str);
}

这对我很有帮助

2022-12-16 05:15:18

关于mb_detect_encoding和mb_convert_encoding有趣的事情是，您建议的编码顺序确实很重要:

// $input is actually UTF-8

mb_detect_encoding($input, "UTF-8", "ISO-8859-9, UTF-8");
// ISO-8859-9 (WRONG!)

mb_detect_encoding($input, "UTF-8", "UTF-8, ISO-8859-9");
// UTF-8 (OK)

因此，在指定预期的编码时，您可能希望使用特定的顺序。不过，请记住，这并非万无一失。

2012-03-11 17:58:32

检测编码并使所有内容都为UTF-8

推荐文章

最新文章

标签