学年计算语言学课件-0词向量_第1页
学年计算语言学课件-0词向量_第2页
学年计算语言学课件-0词向量_第3页
学年计算语言学课件-0词向量_第4页
学年计算语言学课件-0词向量_第5页
已阅读5页,还剩33页未读 继续免费阅读

付费下载

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

词向量常宝宝

计算语言学概要词向量概要式词向量学习模型Collobert&Weston模型CBOW模型/SkipGram模型矩阵分解式词向量学习模型SVD分解模型GloVe模型词向量评价类比词相似度评价词的表示不同的词是不同的符号标识桌子、椅子、苹果、学习无异于四个不同的词和词在语义或语法方面的共性桌子、椅子都是家具、苹果是水果、学习是一种行为))分布相似性木头桌子(√)、木头椅子(√)、木头苹果(×)、木头学一把椅子(√)、一张桌子(√)、一个苹果(√)、一个学……词的表示12⋯𝑖⋯𝑉𝑣

𝑤𝑖=

(

00⋯1⋯0)词的one-hot向量表示令𝑉代表词表,𝑤𝑖

∈𝑉可表示成一个|𝑉|维向量,词表中每个词单独对应一个向量维度。唯有与𝑤𝑖对应的维度为1,其余维度为0特点:稀疏、正交,若𝑤𝑖,𝑤𝑗

∈𝑉且𝑖≠𝑗𝑣

𝑤𝑖

𝑣

𝑤𝑗

=

0不能有效表示词和词之间的句法语义共性词向量词的嵌入表示——词向量(word

vector/embedding)把词表示成低

中的向量。句法语义特性相近的词在空间中距离相近𝑣

桌子

𝑣

椅子

0更为细致的语义结构信息——类比特性𝑣

𝑏𝑟𝑜𝑡ℎ𝑒𝑟 −

𝑣

𝑠𝑖𝑠𝑡𝑒𝑟 ≈

𝑣

𝑛𝑒𝑝ℎ𝑒𝑤 −

𝑣

𝑛𝑖𝑒𝑐𝑒𝑣

𝑛𝑒𝑝ℎ𝑒𝑤 ≈

𝑣

𝑛𝑖𝑒𝑐𝑒 +𝑣(𝑏𝑟𝑜𝑡ℎ𝑒𝑟)

𝑣(𝑠𝑖𝑠𝑡𝑒𝑟)词向量的习得词义相似性常常反映为分布相似性分布假设(Distributional

Hypothesis)Words

that

occur

in

similar

contexts

tend

to

havesimilar

meanings.根据词的分布规律学习词的表示基于词的分布特性自动习得词向量–大规模未标注语料库概要词向量概要式词向量学习模型Collobert&Weston模型CBOW模型/SkipGram模型矩阵分解式词向量学习模型SVD分解模型GloVe模型词向量评价类比词相似度评价式模型给定上下文语境

目标词𝑝(𝑤𝑡|𝑤𝑡−𝑙𝑤𝑡−𝑙+1

𝑤𝑡−1𝑤𝑡+1

𝑤𝑡+𝑙)语境和目标词–

左侧语境𝑤𝑡−𝑙𝑤𝑡−𝑙+1

⋯𝑤𝑡−1–

右侧语境𝑤t+1𝑤𝑡+2

⋯𝑤𝑡+𝑙–

语境窗口宽度𝑙寻求如下函数𝑝 𝑤𝑡

𝑤𝑡−𝑙

𝑤𝑡−1𝑤𝑡+1

𝑤𝑡+𝑙=

𝑓

𝑣

𝑤𝑡−𝑙

,

,

𝑣

𝑤𝑡−1

,

𝑣

𝑤𝑡+1,

,

𝑣

𝑤𝑡+𝑙填空他

书椅子?桌子?苹果?学习?椅子

桌子

苹果×

学式模型训练数据𝑇𝑒𝑥𝑡=𝑤1𝑤2

…𝑤𝑇利用未标注语料按照窗口宽度提取训练例子,

(𝑤𝑇−1𝑒,

𝑤𝑇)𝑏𝑤2,

𝑤1

, 𝑤1𝑤3,

𝑤2

,

, 𝑤𝑇−2𝑤𝑇,

𝑤𝑇−1目标函数–平均对数似然函数𝑇1𝐽𝜃

=

𝑇

෍ log

𝑝(𝑤𝑡|𝑤𝑡−𝑙

𝑤𝑡−1𝑤𝑡+1

𝑤𝑡+𝑙;

𝜃)𝑡=1最大似然估计:寻求能使目标函数值最大化的词向量赋值方案𝜃෍

=

argmax𝜃

𝐽𝜃𝜃

=

𝑣

𝑤1

,

𝑣

𝑤2

,

,

𝑣 𝑤

𝑉神经网络建模;

;

𝑣

𝑤𝑡+𝑙

]输入层𝑥

=

[𝑣

𝑤𝑡−𝑙非线性变换层;

;

𝑣

𝑤𝑡−1

;

𝑣

𝑤𝑡+1ℎ

=

𝑔(𝑊(1)𝑥

+

𝑏(1))线性变换softmax层𝑜

=

𝑊(2)ℎ

+

𝑏(2)𝑝

𝑤

𝑤𝑡

𝑡−𝑙𝑡−1

𝑡+1,

,

𝑤

𝑤 ,

,

𝑤𝑡+𝑙=exp(𝑜𝑤𝑡)σ𝑤∈𝑉

exp(𝑜𝑤)神经网络建模计算代价昂贵,无法针对大词表生成词向量目标词 模型⇒

语言片段打分模型学习区分正确的语言片段和错误的语言片段负例生成(将目标词𝑤𝑡随机替换为𝑤′)𝑤⋯

𝑤 𝑤

𝑤 ⋯

𝑤 ⇒

𝑤

⋯𝑡𝑤𝑡−𝑙

𝑡−1

𝑡

𝑡+1

𝑡+𝑙

𝑡−𝑙

𝑡−1𝑡+1𝑡+𝑙𝑤′𝑤 ⋯

𝑤𝑡给定𝑇𝑒𝑥𝑡=𝑤1𝑤2

⋯𝑤𝑇,提取训练数据1𝑏𝑤′

𝑤2)2𝑤1

𝑤′

𝑤3)⋮(𝑏𝑤1𝑤2,(𝑤1𝑤2𝑤3,⋮(𝑤𝑇−2𝑤𝑇−1𝑤𝑇,(𝑤𝑇−1𝑤𝑇𝑒,𝑇−1𝑤𝑇−2𝑤′𝑤𝑇)𝑇𝑤𝑇−1

𝑤′

𝑒)判断他坐在椅子上看书(√)他坐在苹果上看书(×)Score(他坐在椅子上看书)>Score(他坐在苹果上看书)神经网络建模;

;

𝑣

𝑤𝑡+𝑙

]输入层𝑥

=

[𝑣

𝑤𝑡−𝑙

;

;

𝑣

𝑤𝑡−1

;

𝑣

𝑤𝑡

;

𝑣

𝑤𝑡+1非线性变换层ℎ

=

𝑔(𝑊(1)𝑥

+

𝑏(1))线性变换𝑓𝜃(𝑤𝑡−𝑙

𝑤𝑡−1𝑤𝑡𝑤𝑡+1

𝑤𝑡+𝑙)

=

𝑤⊤ℎ

+

𝑏排序损失(pairwiserank

lost)𝐽𝜃

=

෍ max

0,1

𝑓

𝑠+

𝑓(𝑠𝑤)𝑠∈𝑆

𝑤∈𝑉𝑠正确语言片段,𝑠𝑤

是把𝑠中目标词随机替换为𝑤得到的语言片段正确语言片段得分高于错误语言片段,二者间隔至少是1Collobert

&

Weston模型语言片段长度为11,即𝑙=5非线性激活函数HardTanh𝑉 =

30000隐层维度100词向量维度50训练语料:

Wikipedia(631M

words)CBOW模型(continuousbag-of-words)给定上下文语境

目标词𝑝(𝑤𝑡|𝑤𝑡−𝑙𝑤𝑡−𝑙+1

𝑤𝑡−1𝑤𝑡+1

𝑤𝑡+𝑙)输入层𝑥

=

෍𝑤∈𝐶

𝑤𝑡𝑣𝑒𝑐(𝑤)输出层(取消隐层)𝑜

=

𝑈𝑥,

𝑈

𝑉

×𝑑Softmax层𝑝

𝑤𝑡

𝑤𝑡−𝑙

,

,

𝑤𝑡−1

𝑤𝑡+1

,

,

𝑤𝑡+𝑙=

σexp(𝑜𝑤𝑡)𝑤∈𝑉𝑤exp(𝑜

)CBOW模型语境词序无影响,词袋模型式模型给定目标词语境中的词𝑝 𝑤𝑡+𝑖

𝑤𝑡𝑖

=

−𝑙,

,

−1,

+1,

,

+𝑙训练数据𝑇𝑒𝑥𝑡=𝑤1𝑤2

…𝑤𝑇利用未标注语料按照窗口宽度提取训练例子𝑤1,

𝑤2

, 𝑤2,

𝑤1

, 𝑤2,

𝑤3

, 𝑤𝑇−1,

𝑤𝑇

,

(𝑤𝑇,

𝑤𝑇−1)目标函数–平均对数似然函数𝑇1𝐽𝜃

=

𝑇

෍ log

𝑝(𝑤𝑡+𝑖|𝑤𝑡;

𝜃)𝑡=1

−𝑙≤𝑖≤𝑙,𝑖≠0填空椅子↓

↓他坐在↓

↓上看书SkipGram输入层𝑥

=

𝑣𝑒𝑐

𝑤𝑡

=

𝑣𝑤𝑡输出层(线性变换)𝑜

=

𝑈𝑣𝑤,

𝑈

𝑉

×𝑑Softmax层𝑝 𝑤𝑐

𝑤𝑡

=exp(𝑜𝑤𝑐)σ𝑤∈𝑉

exp(𝑜𝑤)𝑜𝑤𝑐

=

𝑣𝑤𝑐

𝑣𝑤𝑡𝑣𝑤𝑐

是矩阵𝑈中词𝑤𝑐对应的行(输出层词向量)SkipGram负采样训练基于整个词表归一,softmax归一代价大Negative

sampling给定目标词𝑤源自训练数据的样本𝑤,𝑐

正例随机生成负样本(𝑤,𝑐′)负例二分类:(𝑤,𝑐)是否源自训练数据𝑝(𝐷=1|𝑤,𝑐;𝜃)代表(𝑤,𝑐)源自训练数据的概率𝑝(𝐷=0|𝑤,𝑐;𝜃)代表(𝑤,𝑐)不是源自训练数据的概率𝑝

𝐷

=

0

𝑤,

𝑐;

𝜃 =

1

𝑝(𝐷

=

1|𝑤,

𝑐;

𝜃)

负采样训练

𝑝

𝐷

=

1

𝑤,

𝑐;

𝜃1=1

+

exp

−𝑣 ∙

𝑣𝑤

𝑐=

𝜎

𝑣 ∙

𝑣𝑤

𝑐𝑝

𝐷

=

0

𝑤,

𝑐;

𝜃 =

1−

𝑝

𝐷

=

1

𝑤,

𝑐;

𝜃 =

𝜎(−𝑣𝑤

𝑣𝑐)对数似然函数/最大似然估计𝐽𝜃

=

log

ෑ𝑤,𝑐

∈𝐷𝑝

𝐷

=

1

𝑤,

𝑐;

𝜃

ෑ𝑤,𝑐

∈𝐷′𝑝

𝐷

=

0

𝑤,

𝑐;

𝜃=

෍𝑤,𝑐

∈𝐷=

෍𝑤,𝑐

∈𝐷log

𝑝(𝐷

=

1|𝑤,

𝑐;

𝜃)

+෍𝑤,𝑐

∈𝐷′log

𝑝(𝐷

=

0|𝑤,

𝑐;

𝜃)log

𝜎(−𝑣𝑤

𝑣𝑐)log

𝜎(𝑣𝑤

𝑣𝑐)

+

෍𝑤,𝑐

∈𝐷′𝜃෍=

argmax

𝐽𝜃

=

argmax𝜃

𝜃෍

log

𝜎(𝑣𝑤

𝑣𝑐)

+𝑤,𝑐

∈𝐷log

𝜎(−𝑣𝑤𝑣𝑐)෍𝑤,𝑐

∈𝐷′负例构造方式

负例生成对任意𝑤,

𝑐∈𝐷,按如下分布随机生成𝑐𝑖13令𝑐𝑖

𝑍

𝑈

𝑤

4,

𝑖

=

1,2,

,

𝑘𝑤,

𝑐𝑖

𝐷′概要词向量概要式词向量学习模型Collobert&Weston模型CBOW模型/SkipGram模型矩阵分解式词向量学习模型SVD分解模型GloVe模型词向量评价类比词相似度评价矩阵分解式模型目标词𝑤及其语境中出现的词𝑐𝑤

𝑉𝑤

,

𝑐

𝑉𝑐

, 𝑤,

𝑐 ∈

𝐷定义𝑤和𝑐的共现矩阵𝑀–|𝑉𝑤

|行,每行对应𝑉𝑤

中的词𝑤–|𝑉𝑐

|列,每列对应𝑉𝑐

中的词𝑐–𝑀𝑖𝑗代表𝑤𝑖和𝑐𝑗的某种关联度最简单的关联度是𝑤和𝑐的共现次数𝑀𝑖𝑗

=

#(𝑤𝑖,

𝑐𝑗)原始共现频次的缺陷–分布方差巨大,高频词(如虚词)影响高估共现矩阵MPMI和PPMI点间互信息(PMI)𝑃𝑀𝐼 𝑤,

𝑐𝑝Ƹ(𝑤,=

log𝑝Ƹ𝑐)𝑤#(𝑤,

𝑐)

|𝐷|=

log𝑝Ƹ(𝑐)若#(𝑤,

𝑐)=0,则𝑃𝑀#𝐼(𝑤𝑤),∙𝑐#(𝑐=)−∞正点间互信息(PPMI)𝑃𝑃𝑀𝐼 𝑤,

𝑐 =

max

𝑃𝑀𝐼 𝑤,

𝑐 ,

0令𝑀𝑖𝑗

=

𝑃𝑃𝑀𝐼(𝑤𝑖,

𝑐𝑗)矩阵分解奇异值分解(SVD)𝑀

=

𝑈

Σ∙

𝑉⊤𝑈和𝑉的列向量均为单位正交向量Σ为奇异值降序排列的对角矩阵通过奇异值截断,寻求矩阵的低秩

近矩阵𝑑𝑀𝑑

=

𝑈𝑑

Σ𝑑

𝑉⊤保留Σ中𝑑个最大的奇异值矩阵分解基于SVD的非对称词向量𝑊𝑆𝑉𝐷

=

𝑈𝑑

Σ𝑑𝐶𝑆𝑉𝐷

=

𝑉𝑑矩阵的行对应𝑤和𝑐的向量表示基于SVD的对称词向量𝑊𝑆𝑉𝐷

=

𝑈𝑑

Σ𝑑𝐶𝑆𝑉𝐷

=

𝑉𝑑

Σ𝑑矩阵分解词𝑤𝑖

的表示取决于同其语境中词𝑤𝑘的共现关系寻求如下的矩阵分解𝑊

𝐶⊤

𝑀分解使得词向量压缩表示了词的语境信息,反映了词的句法语义信息两个词的语境接近,两个词就含有接近的句法语义信息GloVe𝑤和𝑐的关联度定义𝑀𝑖𝑗

=

log #(𝑤𝑖,

𝑐𝑗)寻求如下的矩阵分解𝑀

𝑊

𝐶⊤

+

𝑏𝑤𝐼⊤

+

𝐼𝑏𝑐即𝑤

𝑐Ԧ+

𝑏𝑤

+𝑏𝑐

log

#(𝑤,

𝑐)

∀ 𝑤,

𝑐 ∈

𝐷分解误差𝐽

=

෍ 𝑓

#(𝑤𝑖,

𝑐𝑗) 𝑤𝑖

𝑐Ԧ𝑗

+

𝑏𝑤𝑖

+

𝑏𝑐𝑗

𝑀𝑖𝑗𝑖,𝑗2GloVe权重函数(weighting

function)𝑓

𝑥1,=

ቊ𝑥/𝑥𝑚𝑎𝑥

𝛼, 𝑖𝑓

𝑥

<

𝑥𝑚𝑎𝑥𝑜𝑡ℎ𝑒𝑟𝑤𝑖𝑠𝑒.Glove的优化目标𝜃መ=

argmin

𝐽𝜃𝜃𝛼

=

3/4概要词向量概要式词向量学习模型Collobert&Weston模型CBOW模型/SkipGram模型矩阵分解式词向量学习模型SVD分解模型GloVe模型词向量评价类比词相似度评价词向量的评价-wordogy

task具有同样类比关系的词,计算准确率。aistobascisto

?例子:AthensistoGreeceasBerlinisto

?

(Germany)danceistodancingasflyisto

?

(flying)可否通过词向量计算找到具有同样类比关系的词?把词和词之间的关系表达为向量差,则应有𝑤𝑎

𝑤𝑏

𝑤𝑐

𝑥Ԧ𝑥Ԧ

𝑤𝑏

𝑤𝑎

+

𝑤𝑐𝑑መ=

argmax 𝑠𝑖𝑚𝑖𝑙𝑎𝑟𝑖𝑡𝑦(𝑤𝑑,

𝑥Ԧ)𝑑∈𝑉

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论