如何从字符串中剥离非ascii字符?(c#)

当前回答

这并不是最优的性能，而是一种非常直接的Linq方法:

string strippedString = new string(
    yourString.Where(c => c <= sbyte.MaxValue).ToArray()
    );

缺点是，所有“幸存的”字符首先被放入char[]类型的数组中，然后在字符串构造函数不再使用它后将其丢弃。

2013-09-03 17:08:42

其他回答

我使用这个正则表达式来过滤掉文件名中的坏字符。

Regex.Replace(directory, "[^a-zA-Z0-9\\:_\- ]", "")

这应该是文件名所允许的所有字符。

2017-06-09 18:17:02

如果你不想剥离，而是真正地将拉丁重音字符转换为非重音字符，看看这个问题:我如何将8位字符转换为7位字符?(即Ü到U)

2012-04-05 22:30:39

受philcruz的正则表达式解决方案的启发，我做了一个纯LINQ解决方案

public static string PureAscii(this string source, char nil = ' ')
{
    var min = '\u0000';
    var max = '\u007F';
    return source.Select(c => c < min ? nil : c > max ? nil : c).ToText();
}

public static string ToText(this IEnumerable<char> source)
{
    var buffer = new StringBuilder();
    foreach (var c in source)
        buffer.Append(c);
    return buffer.ToString();
}

这是未经测试的代码。

2010-01-27 19:00:39

public string ReturnCleanASCII(string s)
    {
        StringBuilder sb = new StringBuilder(s.Length);
        foreach (char c in s)
        {
            if ((int)c > 127) // you probably don't want 127 either
                continue;
            if ((int)c < 32)  // I bet you don't want control characters 
                continue;
            if (c == '%')
                continue;
            if (c == '?')
                continue;
            sb.Append(c);
        }
        return sb.ToString();
    }

2022-07-27 08:18:46

如果你想要一个只有ISO-8859-1字符并且排除非标准字符的字符串，你应该使用这个表达式:

var result = Regex.Replace(value, @"[^\u0020-\u007E\u00A0-\u00FF]+", string.Empty);

注意:使用Encoding.GetEncoding("ISO-8859-1")方法将不能完成这项工作，因为未定义的字符不会被排除在外。

.Net小提琴样本

维基百科ISO-8859-1代码页获取更多详细信息。

2022-07-16 11:12:43

如何从字符串中剥离非ascii字符?(c#)

推荐文章

最新文章

标签