PLSA隐变量主题模型的公式推导解惑

Posted 终有扬眉吐气天

tags:

篇首语:本文由小常识网(cha138.com)小编为大家整理,主要介绍了PLSA隐变量主题模型的公式推导解惑相关的知识,希望对你有一定的参考价值。

PLSA隐变量主题模型,公式推导网上也好,还是书上也好,都属于从略。

但是无论对于新手来说,还是老手,从略是不合适的,这不是一个科学对待的态度。机器学习就这么几个模型,从略是不是也对不起自己了

好了,闲话少说:

技术分享

这是第一步,都是使用的条件概率公式,当然,分母p(di,wj)的分解,使用的是CK方程,一会再说。

要使第一步成立,则如图所示,p(wj|zk,di)必须等于p(wj|zk)

而wj,di是条件独立的,于是有了如下证明:

p(w|z,d) = p(w,z,d)/p(z,d) = p(w,d|z)*p(z)/p(d|z)*p(z) = p(w,d|z)/p(d|z) = p(w|z)*p(d|z)/p(d/z) = p(w|z)

证明完毕!

 

补充:我们知道,PLSA是所谓的贝叶斯head-to-tail模型,也就是马尔可夫模型。

上面已经说到,分母p(di,wj)的分解,使用的就是CK方程,这是马尔可夫里面的东西,其实上面分子如果从马尔可夫模型角度来看,完全就是定义,也就是说

这个PLSA的隐变量模型,其实就是从马尔可夫模型推导的,因为无论是分子还是分母,都是直接给结论啊。

 

再延伸开来,我们知道,最大熵也好,极大似然也好,机器学习中求的就是条件概率p(y|x)。实际上都可以用马尔可夫模型来套。

以上是关于PLSA隐变量主题模型的公式推导解惑的主要内容,如果未能解决你的问题,请参考以下文章

LDA(文档主题模型)

主题模型——隐含狄利克雷分布总结

主题模型——隐含狄利克雷分布总结

从零开始学推荐系统二:隐语义模型

主题模型LDALSALSIpLSA

003-LDA