如何在不手动指定编码的情况下获得C#中字符串的一致字节表示？

如何在.NET（C#）中将字符串转换为字节[]而不手动指定特定编码？

我要加密字符串。我可以在不进行转换的情况下对其进行加密，但我仍然想知道为什么编码会在这里发挥作用。

此外，为什么还要考虑编码？我不能简单地获取字符串存储的字节数吗？为什么依赖字符编码？

当前回答

我不确定，但我认为字符串将其信息存储为一个Chars数组，这对字节来说效率很低。具体来说，Char的定义是“表示Unicode字符”。

以以下示例为例：

String str = "asdf éß";
String str2 = "asdf gh";
EncodingInfo[] info =  Encoding.GetEncodings();
foreach (EncodingInfo enc in info)
{
    System.Console.WriteLine(enc.Name + " - " 
      + enc.GetEncoding().GetByteCount(str)
      + enc.GetEncoding().GetByteCount(str2));
}

请注意，在这两种情况下，Unicode答案都是14个字节，而UTF-8答案第一种只有9个字节，第二种只有7个字节。

因此，如果您只想要字符串所使用的字节，只需使用Encoding.Unicode，但存储空间会很低。

2009-01-23 14:34:03

其他回答

随着C#7.2发布的Span<T>的出现，将字符串的底层内存表示捕获到托管字节数组中的规范技术是：

byte[] bytes = "rubbish_\u9999_string".AsSpan().AsBytes().ToArray();

将其转换回去应该是一件不容易的事，因为这意味着您实际上正在以某种方式解释数据，但为了完整性：

string s;
unsafe
{
    fixed (char* f = &bytes.AsSpan().NonPortableCast<byte, char>().DangerousGetPinnableReference())
    {
        s = new string(f);
    }
}

NonPortableCast和DangerousGetPinnableReference这两个名称应该进一步证明您可能不应该这样做。

注意，使用Span<T>需要安装System.Memory NuGet包。

无论如何，实际的原始问题和后续评论暗示底层内存没有被“解释”（我假设这意味着没有修改或读取，超出了按原样编写的需要），这表明应该使用Stream类的某些实现，而不是将数据作为字符串进行推理。

2018-01-10 20:21:12

只需使用此选项：

byte[] myByte= System.Text.ASCIIEncoding.Default.GetBytes(myString);

2015-06-30 14:39:07

最快的方式

public static byte[] GetBytes(string text)
{
    return System.Text.ASCIIEncoding.UTF8.GetBytes(text);
}

编辑正如Makotosan所说，这是现在最好的方式：

Encoding.UTF8.GetBytes(text)

2010-03-22 08:40:52

byte[] strToByteArray(string str)
{
    System.Text.ASCIIEncoding enc = new System.Text.ASCIIEncoding();
    return enc.GetBytes(str);
}

2009-01-23 13:43:18

公认的答案非常非常复杂。为此，请使用包含的.NET类：

const string data = "A string with international characters: Norwegian: ÆØÅæøå, Chinese: 喂 谢谢";
var bytes = System.Text.Encoding.UTF8.GetBytes(data);
var decoded = System.Text.Encoding.UTF8.GetString(bytes);

如果你不需要。。。

2012-04-30 07:26:07

如何在不手动指定编码的情况下获得C#中字符串的一致字节表示？

推荐文章

最新文章

标签