这周的数据学习课更不知道该起什么题目了。主要是加上一些假设,从Softmax函数开始推导,最后得到一个非常简单的形式,从而大大简化了算法。这次的derivation和上篇讲得东西还是有一些相关的。
## Review ##
首先回顾一下上篇博客介绍的内容,从HGR maximal
correlation开始推导。依然是离散变量与。不过稍微做点拓展,我们在提取x,y的信息时,把他们映射到一个k维度的向量,也就是:
这时候,和之前一样,做一些推导吧。这时候的相关系数变成了相关矩阵:
我们的约束变成: $$
\mathbb{E}[f (x)] = \mathbb{E}[ g(y)] = \mathbf{0}\\
\mathbb{E}[ f^2(x)] = \mathbb{E}[ g^2(y)] = I_ {k \times k}
$$
问题描述变为:
其中: $$
\Phi = \begin{bmatrix}
\phi(x_1),\phi(x_2),...,\phi(x_ {|X|})
\end{bmatrix}^T_ {|X|\times k},\\
\Psi = \begin{bmatrix}
\psi(y_1),\psi(y_2),...,\psi(y_ {|Y|})
\end{bmatrix}^T_ {|Y|\times k},\\
B_ {y,x} = \frac{p_ {XY}(x,y)}{\sqrt{p_X(x)p_Y(y)} },B_ {|Y| \times
|X|}.
$$
而这时候的与实际上是由B的第右左特征向量组成:
$$
\Phi = \begin{bmatrix}
\upsilon_2,...,\upsilon_ {k+1}
\end{bmatrix}\\
\Psi = \begin{bmatrix}
\mu_2,...,\mu_ {k+1}
\end{bmatrix}
$$
.
HGR & Softmax
假设是离散的,并且几乎独立(weakly
dependent),也就是非常小。
还记得softmax function:
在这里,我们把再次进行信息提取,分布为.
由于与Y值相关,我们可以将看作是g(y)。因此写成更通用的形式:
现在我们定义:,则:
可以看到,如果,.
由于我们的假设可以知道,,则,根据泰勒展开:
而:
而由泰勒展开得到:
结合上面的(1),(2),我们得到:
现在我们令.得到:
现在我们利用这个式子构建,实际上也就是.最小化经验风险(empirical
risk)实际上也就是最大化,也是极大似然估计。
上述过程用到了泰勒展开:.
$[Q_ {Y|X}(Y|X)] = [p_Y(Y)] + [f^T(X)(Y) ] + [(Y) ] - [
[(fT(X)(Y))2 + (Y) + 2 f^T(X)(Y)(Y)]] $
现在,我们来说明一些必要的东西:由假设得到,表示的无穷小量(这么说其实不准确,因为我们最后要最大化这种无穷小量,显然不合理,可以当作为衡量有多小的量级)。
因为
同理可以得到,我们假设对所有的都进行了normalize,也就是,则:
*
*
*
而我们知道在之前是可以被忽略的。因此最终:
上式中,第一项为常数,最后一项为非负值,且与前面几项没有约束关系,因此为了最大化上式只需简单令,因此最终我们要做的是:
如果我们将$ [f^T(x)g(y)]
f(x)$求导,可以得到:
$$
\frac{\partial \Delta}{\partial f(x)} = 0\\
f(x) = \land ^{-1}_ {\tilde g (Y)} \mathbb{E}[\tilde g(Y)|X = x]
$$
其中,也就是我们得到了最佳的.
同理我们也得到:
也就是如果我们向softmax函数中喂入(形式固定),那么softmax尽量在学的东西,也就是实际上是,当然不一定能成功学到这样的形式。
同样的,利用神经网络进行softmax可以看作是在寻找X的特征,它找到的最佳形式应该是.
简直是头大。实际上我不能保证这篇博客的正确性。