是否有一种方法可以摆脱重音，并将整个字符串转换为常规字母?

除了使用String.replaceAll()方法并逐个替换字母之外，还有更好的方法来摆脱重音并使这些字母规则吗? 例子:

输入:或者čpžsíáýd

输出:orcpzsiayd

它不需要包括所有有口音的字母，比如俄语字母或汉语字母。

当前回答

根据语言的不同，这些可能不被认为是重音(改变字母的发音)，而是变音符符号

https://en.wikipedia.org/wiki/Diacritic#Languages_with_letters_containing_diacritics

“波斯尼亚语和克罗地亚语都有符号“č”、“ovic”、“đ”、“š”和“ž”，这些符号被认为是单独的字母，在字典和其他按字母顺序排列单词的语境中都是这样列出的。”

删除它们可能会从本质上改变单词的意思，或者将字母变成完全不同的字母。

2010-07-23 20:41:03

其他回答

如果你没有库，使用regex和Normalizer的最好方法之一是:

    public String flattenToAscii(String s) {
                if(s == null || s.trim().length() == 0)
                        return "";
                return Normalizer.normalize(s, Normalizer.Form.NFD).replaceAll("[\u0300-\u036F]", "");
}

这比replaceAll("[^\p{ASCII}]"， ""))更有效，而且如果你不需要变音符符(就像你的例子一样)。

否则，您必须使用p{ASCII}模式。

的问候。

2018-12-13 08:28:35

根据语言的不同，这些可能不被认为是重音(改变字母的发音)，而是变音符符号

https://en.wikipedia.org/wiki/Diacritic#Languages_with_letters_containing_diacritics

删除它们可能会从本质上改变单词的意思，或者将字母变成完全不同的字母。

2010-07-23 20:41:03

System.out.println(Normalizer.normalize("àèé", Normalizer.Form.NFD).replaceAll("\\p{InCombiningDiacriticalMarks}+", ""));

为我工作。上面代码段的输出给出了“aee”，这是我想要的，但是

System.out.println(Normalizer.normalize("àèé", Normalizer.Form.NFD).replaceAll("[^\\p{ASCII}]", ""));

没有做任何替换。

2010-11-19 14:02:47

从2011年开始，你可以使用Apache Commons stringutils . stripaccent (input)(从3.0开始):

    String input = StringUtils.stripAccents("Tĥïŝ ĩš â fůňķŷ Šťŕĭńġ");
    System.out.println(input);
    // Prints "This is a funky String"

注意:

接受的答案(Erick Robertson的)对于Ø或Ł不适用。Apache Commons 3.5也不能用于Ø，但它可以用于Ł。在阅读了维基百科上关于Ø的文章后，我不确定它是否应该被“O”取代:它在挪威语和丹麦语中是一个单独的字母，在“z”之后按字母顺序排列。这是“条形强调”方法局限性的一个很好的例子。

2015-01-05 23:53:28

编辑:如果你不困于Java <6，速度不是关键，/或翻译表太有限，请使用David的回答。重点是使用Normalizer(在Java 6中引入)，而不是在循环中使用转换表。

虽然这不是“完美”的解决方案，但当你知道范围(在我们的例子中是latin1,2)时，它工作得很好，在Java 6之前工作(虽然不是一个真正的问题)，并且比大多数建议的版本快得多(可能是也可能不是一个问题):

    /**
 * Mirror of the unicode table from 00c0 to 017f without diacritics.
 */
private static final String tab00c0 = "AAAAAAACEEEEIIII" +
    "DNOOOOO\u00d7\u00d8UUUUYI\u00df" +
    "aaaaaaaceeeeiiii" +
    "\u00f0nooooo\u00f7\u00f8uuuuy\u00fey" +
    "AaAaAaCcCcCcCcDd" +
    "DdEeEeEeEeEeGgGg" +
    "GgGgHhHhIiIiIiIi" +
    "IiJjJjKkkLlLlLlL" +
    "lLlNnNnNnnNnOoOo" +
    "OoOoRrRrRrSsSsSs" +
    "SsTtTtTtUuUuUuUu" +
    "UuUuWwYyYZzZzZzF";

/**
 * Returns string without diacritics - 7 bit approximation.
 *
 * @param source string to convert
 * @return corresponding string without diacritics
 */
public static String removeDiacritic(String source) {
    char[] vysl = new char[source.length()];
    char one;
    for (int i = 0; i < source.length(); i++) {
        one = source.charAt(i);
        if (one >= '\u00c0' && one <= '\u017f') {
            one = tab00c0.charAt((int) one - '\u00c0');
        }
        vysl[i] = one;
    }
    return new String(vysl);
}

在我使用32位JDK的HW上进行的测试表明，这在~100ms内执行了从àèéľšťč89FDČ到aeelstc89FDC的100万次转换，而Normalizer方式使其在3.7s(慢37倍)。如果您的需求与性能有关，并且您知道输入范围，那么这可能适合您。

喜欢:-)

2012-05-31 10:20:32

是否有一种方法可以摆脱重音，并将整个字符串转换为常规字母?

推荐文章

最新文章

标签