Word2vec负采样

全栈程序员-用户IM • 2022年6月20日下午8:46 • 未分类

Word2vec负采样下文中的模型都是以Skip-gram模型为主。1、论文发展word2vec中的负采样(NEG)最初由Mikolov在论文《DistributedRepresentationsofWordsandPhrasesandtheirCompositionality》中首次提出来，是Noise-ContrastiveEstimation（简写NCE，噪声对比估计）的简化版本…

大家好，又见面了，我是你们的朋友全栈君。

下文中的模型都是以Skip-gram模型为主。

1、论文发展

word2vec中的负采样(NEG)最初由 Mikolov在论文《Distributed Representations of Words and Phrases and their Compositionality》中首次提出来，是Noise-Contrastive Estimation（简写NCE，噪声对比估计）的简化版本。在论文中针对Skip-gram模型直接提出负采样的优化目标函数为：

Word2vec负采样

Word2vec负采样

Word2vec负采样

其中Pn(w)是目标词不是w的上下文的概率分布。

论文中没有给出证明，到了2014年，Yoav Goldberg在论文《word2vec Explained: Deriving Mikolov et al.’s Negative-Sampling Word-Embedding Method》里对上述目标函数给出了推导。

2、原始的skip-gram模型的目标函数

如果没有采用负采样的话，那么skip-gram模型的目标函数为：

Word2vec负采样

Word2vec负采样

其中p(c|w)表示的是当前词预测到的目标上下文的概率最大，C(w)是目标词w的所有上下文集合。

相应地可以简化为

Word2vec负采样

Word2vec负采样

式中D是语料中所有单词和上下文的集合。

如果我们采用softmax函数的话，那么我们可以得到对应每个上下文的概率大小为：

Word2vec负采样

Word2vec负采样

其中Vc和Vw可以看成是对应词c和词w的词向量。关于如何得到这个式子可以参考后面，那么将该式子代入上式并取log可以得到：

Word2vec负采样

Word2vec负采样

对上述目标函数求最大化，可以让相似的词具有相似的向量值。

3、采用负采样的目标函数

但是对上述目标函数进行优化，第二项需要对词典里的所有词进行优化，所以计算量比较大。如果换个角度考虑，如果我们将正常的上下问组合看成是1，不正常的上下文组合看成是0，那么问题转换为二分类问题，那么我们目标就是最大化下面的目标函数。

Word2vec负采样

Word2vec负采样

将输出层的softmax函数改为sigmoid函数，那么

Word2vec负采样

Word2vec负采样

同样代入上式可以得到

Word2vec负采样

但是这个目标函数存在问题，如果Vc=Vw，并且VcxVw足够大的话，就能取到最大值，这样所有词向量都是一样的，得到的词向量没有意义。所以考虑负采样，即引入负样本，那么

Word2vec负采样

令

Word2vec负采样

Word2vec负采样

那么得到

Word2vec负采样

Word2vec负采样

则与Mikolov提出的式子是一致的。

4、如何推导得到目标函数

Word2vec负采样

Word2vec负采样

5、举例

以“今天|天气|非常|不错|啊”举例，假设上下文只有一个词，选择目标词是“天气”，那么出现的情况有：

今天|天气，非常|天气，不错|天气，啊|天气

由于我们假设上下文只有一个词，那么在这些情况中只有【今天|天气，非常|天气】是正确的样本。

当我们采用【今天|天气】这个样本时，我们希望输入【天气】，会输出标签【今天】，其他概率都是0。

对于原始的skip-gram模型来说，这对应是一个4分类问题，当输入【今天|天气】时，那么我们可能出现的概率是P(今天|天气)、P(非常|天气)、P(不错|天气)和P(啊|天气)，我们的目标就是让P(今天|天气)这个概率最大，但是我们得同时计算其他三类的概率，并在利用反向传播进行优化的时候需要对所有词向量都进行更新。这样计算量很大，比如我们这里就要更新5*100=500个参数（假设词向量维度是100维的）。

但是如果采用负采样，当输入【今天|天气】时，我们从【非常|不错|啊】中选出1个进行优化，比如【不错|天气】，即我们只需计算P(D=1|天气，今天)和P(D=0|天气，不错)，并且在更新的时候只更新【不错】、【天气】和【今天】的词向量，这样只需更新300个参数，计算量大大减少了。

6、参考资料

[1]word2vec Parameter Learning Explained

[2]word2vec Explained: Deriving Mikolov et al.’s Negative-Sampling Word-Embedding Method

[3]Note on Word Representation

[4]Distributed Representations of Words and Phrases and their Compositionality

转载于:https://www.cnblogs.com/linhao-0204/p/9126037.html

版权声明：本文内容由互联网用户自发贡献，该文观点仅代表作者本人。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容，请发送邮件至举报，一经查实，本站将立刻删除。

发布者：全栈程序员-用户IM，转载请注明出处：https://javaforall.cn/151251.html原文链接：https://javaforall.cn

【正版授权，激活自己账号】： Jetbrains全家桶Ide使用，1年售后保障，每天仅需1毛

【官方授权正版激活】： 官方授权正版激活支持Jetbrains家族下所有IDE 使用个人JB账号...

赞 (0)

全栈程序员-用户IM

0 0

较完整的 bean生命周期[通俗易懂]

较完整的 bean生命周期[通俗易懂]首先需要说明的是，Bean的生命周期主要指的是singletonbean，标签的scope默认就是singleton。对prototypebean来说，当用户getBean获得prototypebean的实例后，IOC容器就不再对当前实例进行管理，而是把管理权交由用户，此后再getBean生成的是新的实例。普通JavaBean和SpringBean普通java对象就是new出来，然后不再使用的时候通过垃圾回收机制进行回收；而springBean是由spring容器来控制的，并且..

全栈程序员-用户IM
2022年9月16日
linux进程通信之信号[通俗易懂]

linux进程通信之信号

全栈程序员-用户IM
2022年1月21日
10款sublime插件推荐

10款sublime插件推荐1. PackageControl作为安装SublimeText插件的必备利器，PackageControl是这款编辑器的标配，可以方便开发人员快速安装需要的插件。2. Git在工作中，版本控制软件最常用的软件之一，而最流行的VCS是 Git。你是否厌倦了保存文本文件，并切换回终端运行一些Git命令。如果你能从文本编辑器本身执行Git命令

全栈程序员-用户IM
2022年6月24日
微信公众号基本配置url_配置url

微信公众号基本配置url_配置url启用开发模式需要先成为开发者，而且编辑模式和开发模式只能选择一个，进入微信公众平台-开发模式，如下：需要填写url和token，当时本人填写这个的时候花了好久，我本以为填写个服务器的url就可以了（

全栈程序员-用户IM
2022年8月6日
Ubuntu如何卸载软件_ubuntu卸载桌面

Ubuntu如何卸载软件_ubuntu卸载桌面ubuntu卸载软件方法

全栈程序员-用户IM
2022年10月5日
Dell服务器误删阵列恢复操作

Dell服务器误删阵列恢复操作确认机器是否阵列（此例为阵列五）已丢失，然后配置idrac配置完成退出BIOS，让机器自然运行，进不去系统没关系正常磁盘掉线状态为Foreign，目前操作是误删了阵列所以磁盘全为ready模式，Foreign那块是后加的raid0（导回即可）这边机器退出BIOS开机以后，需要idrac收集一份日志（日志系统日志与存储日志）然后排查日志，发现日志有删除动作，但是没有格式化磁盘（应该是误删操作）在误删阵列，但是没有格式化的情况下啊，大概率实现资料恢复（先确认机器之前是什.

全栈程序员-用户IM
2022年6月15日

发表回复

关注全栈程序员社区公众号