理解“随机性”

我无法理解这个，哪个更随机？

rand()

OR:

rand() * rand()

我发现这是一个真正的脑筋急转弯，你能帮我吗？

编辑：

直觉上，我知道数学上的答案是它们是同样随机的，但我不禁想，如果你在将两者相乘时“运行随机数算法”两次，你会创建比只做一次更随机的东西。

当前回答

没有比这更随机的了。它要么是随机的，要么不是随机的。随机意味着“难以预测”。这并不意味着不确定性。如果random（）是随机的，那么random（（）和random（*random）都是随机的。就随机性而言，分布是无关紧要的。如果出现不均匀分布，则意味着某些值比其他值更有可能；它们仍然是不可预测的。由于涉及伪随机性，所以这些数字非常具有确定性。然而，在概率模型和模拟中，伪随机性通常是足够的。众所周知，使伪随机数生成器复杂化只会使其难以分析。不太可能提高随机性；它经常导致它无法通过统计测试。随机数的期望财产很重要：重复性和再现性、统计随机性、（通常）均匀分布和大周期是少数几个。关于随机数上的变换：正如有人所说，两个或多个均匀分布的和产生正态分布。这是加法中心极限定理。无论源分布如何，只要所有分布都是独立和相同的，它都适用。乘性中心极限定理表示两个或多个独立且一致分布的随机变量的乘积是对数正态的。其他人创建的图形看起来是指数型的，但实际上是对数正态的。因此random（）*random（（）是对数正态分布的（尽管它可能不是独立的，因为数字是从同一个流中提取的）。这在某些应用中可能是期望的。然而，通常最好生成一个随机数并将其转换为对数正态分布数。Random（）*Random（）可能很难分析。

欲了解更多信息，请访问www.performorama.org查阅我的书。这本书正在建设中，但相关材料已经存在。请注意，章节和章节编号可能会随时间而变化。第8章（概率论）——第8.3.1和8.3.3节，第10章（随机数）。

2011-06-02 18:15:53

其他回答

大多数rand（）实现都有一定的周期。也就是说，在大量的调用之后，序列会重复。rand（）*rand（（）的输出序列在一半时间内重复，因此在这个意义上它“不那么随机”。

此外，如果没有仔细的构造，对随机值执行算术往往会导致较少的随机性。上面的一张海报引用了“rand（）+rand（（）+rand（）…”（例如，k倍），这实际上会倾向于rand（返回值范围的平均值的k倍。（这是一种随机行走，步数与平均值对称。）

具体来说，假设rand（）函数返回[0,1）范围内的均匀分布随机实数。（是的，这个例子允许无限精度。这不会改变结果。)您没有选择特定的语言，不同的语言可能会做不同的事情，但以下分析适用于对rand（）的任何非反常实现的修改。乘积rand（）*rand（（）也在[0,1）范围内，但不再均匀分布。事实上，乘积在区间[0,1/4）和区间[1/4,1）中的可能性一样大。更多的乘法将使结果进一步趋向于零。这使得结果更可预测。在广义上，更可预测的==更少的随机性。

几乎所有对均匀随机输入的操作序列都是非均匀随机的，从而提高了可预测性。小心的话，我们可以克服这一特性，但这样就可以更容易地在实际需要的范围内生成一个均匀分布的随机数，而不是在算术上浪费时间。

2010-10-18 04:10:06

当你对随机数的组合会发生什么感到怀疑时，你可以利用你在统计理论中学到的经验。

在OP的情况下，他想知道X*X=X^2的结果是什么，其中X是沿统一[0,1]分布的随机变量。我们将使用CDF技术，因为它只是一对一映射。

由于X~Uniform[0,1]，其cdf为：fX（X）=1我们需要转换Y<-X^2，因此Y=X^2求逆x（y）：sqrt（y）=x，这给出了x作为y的函数。接下来，求导数dx/dy:d/dy（sqrt（y））=1/（2sqrt（y）

Y的分布如下：fY（Y）=fX（x（Y））|dx/dy |=1/（2 sqrt（Y）

我们还没有完成，我们必须得到Y的域，因为0<=x<1，0<=x^2<1因此Y在范围[0，1）内。如果你想检查Y的pdf是否真的是pdf，请在域中集成它：从0到1集成1/（2 sqrt（Y）），实际上，它会弹出为1。此外，请注意所述函数的形状看起来像belisarious发布的内容。

至于X1+X2+…+Xn，（其中Xi ~一致[0,1]），我们可以求助于中心极限定理，它适用于存在矩的任何分布。这就是Z检验存在的原因。

用于确定生成的pdf的其他技术包括雅可比变换（这是cdf技术的广义版本）和MGF技术。

编辑：作为澄清，请注意，我所说的是结果转换的分布，而不是其随机性。这实际上是一个单独的讨论。我实际上得到的是（rand（））^2。对于rand（）*rand（（），它要复杂得多，无论如何，这不会导致任何类型的均匀分布。

2010-10-18 14:02:34

只是一个澄清

尽管每当你试图发现伪随机变量或其乘法的随机性时，前面的答案都是正确的，但你应该知道，虽然random（）通常是均匀分布的，但random（*random）却不是。

实例

这是通过伪随机变量模拟的均匀随机分布样本：

        BarChart[BinCounts[RandomReal[{0, 1}, 50000], 0.01]]

这是两个随机变量相乘后得到的分布：

        BarChart[BinCounts[Table[RandomReal[{0, 1}, 50000] * 
                                 RandomReal[{0, 1}, 50000], {50000}], 0.01]]

所以，两者都是“随机”的，但它们的分布是非常不同的。

另一个例子

当2*Random（）均匀分布时：

        BarChart[BinCounts[2 * RandomReal[{0, 1}, 50000], 0.01]]

随机（）+随机（）不是！

        BarChart[BinCounts[Table[RandomReal[{0, 1}, 50000] + 
                                 RandomReal[{0, 1}, 50000], {50000}], 0.01]]

中心极限定理

中心极限定理指出，随着项的增加，Random（）的和趋于正态分布。

只需四个术语即可获得：

BarChart[BinCounts[Table[RandomReal[{0, 1}, 50000] + RandomReal[{0, 1}, 50000] +
                   Table[RandomReal[{0, 1}, 50000] + RandomReal[{0, 1}, 50000],
                   {50000}],
         0.01]]

在这里，通过将1、2、4、6、10和20个均匀分布的随机变量相加，可以看到从均匀分布到正态分布的道路：

Edit

几个学分

感谢Thomas Ahle在评论中指出，最后两张图片中显示的概率分布称为Irwin Hall分布

感谢Heike出色的撕裂功能

2010-10-18 04:03:16

我们可以通过使用Kolmogorov复杂性如果数字序列不能被压缩，那么它是我们在这个长度上可以达到的最随机的。。。我知道这种测量更多的是理论上的选择。。。

2012-05-25 09:46:33

答案将是，这取决于，希望rand（）*rand（（）比rand）更随机，但如下所示：

两个答案都取决于你的值的位数在大多数情况下，你根据伪随机算法生成（它主要是一个数字生成器，依赖于你的计算机时钟，而不是那么随机）。让你的代码更可读（不要用这种咒语来召唤一些随机的巫毒神）。

好吧，如果你检查上面的任何一个，我建议你使用简单的“rand（）”。因为你的代码会更可读（不会问自己为什么要写这个，时间……嗯……超过2秒），易于维护（如果你想用super_rand替换rand函数）。

如果你想要更好的随机性，我建议你从任何提供足够噪声的源（无线电静态）流式传输，然后一个简单的rand（）就足够了。