在很久之前学习概率论的时候呢,有这么一个比较奇怪的地方,方差的无偏估计:
,这里无偏估计是总感觉有点反直觉。这篇文章就是想介绍一下无偏估计,以及这个是从何而来的。
无偏估计的定义是这样:如果是的一个无偏估计,那么$E[t]
=t
tt$为中心的。可以想象一个打靶的过程,你实际打的地方就是你瞄准的地方的无偏估计,前提是你可能打上打左打右打下等等。如果你瞄准的就不是靶心,那么你打的地方就不是靶心的无偏估计了。
现在来说明一些比较简单的无偏估计,它是我们推导的前提。
假如是对X的独立随机采样,那么,是X的均值,是X的方差。
上式中.
上面的式子前两个都不难理解,我们可以证明一下(3):
但是实际中,我们也往往无法得到的值。想象一下,如果需要统计全世界人的平均身高,你要统计60亿人的身高才能得到精确的,如果有个人死掉了,有个人出生了,又变了。实际中根本不会这么做。我们一般会根据来估计。因此对于方差的估计也是用来完成的。这时候就出现了诡异的式子了:
也就是说,$S^2 = _ {i=1}^n (X_i - X)^2
^2$的无偏估计。
为什么?
先给大家一个直观的理解。首先,我们知道这个式子,在时候取得最大值。如果你不知道这个,很好证明,之前数据学习一篇文章中也提到过k-means
clustering.
但是,我们得到的$X
$多少是有些偏差的,这意味着:
也就是,我们如果这样估计:
结果是偏小的。
但是具体要增加多少才能达到无偏估计呢?下面开始推导:
现在我们想要弄明白的是:
上式中倒数第一步由(3)式得到,倒数第三步是因为我们采样是独立的。
所以我们得到:
这也就证明了,对于方差的无偏估计是,其中:
下面我们将这个拓展到多维度变量的协方差矩阵。多维度变量协方差矩阵的定义为:
现在假设有m个采样,而这些采样的平均值为.
现在我们证明为的无偏估计。其中:
实际上证明是大同小异的,幸运的是矩阵的多数运算都和标量非常相似。
而其中:
所以我们得到: