Word2vec

Word2vec是一群用來產生詞向量的相關模型。這些模型為淺层雙層的神經網路，用來訓練以重新建構語言學之詞文本。網路以詞表現，並且需猜測相鄰位置的輸入詞，在word2vec中词袋模型假設下，詞的順序是不重要的。

訓練完成之後，word2vec模型可以把每個詞映射到一個向量，來表示詞与詞之間的關係。該向量為神經網路的隱藏層^[1]。

Word2vec依賴skip-grams或連續詞袋（CBOW）來建立神經詞嵌入。Word2vec為托馬斯·米科洛夫（Tomas Mikolov）在Google帶領的研究團隊創造。該演算法漸漸被其他人所分析和解釋^[2]^[3]。

Skip-grams和CBOW 编辑

CBOW把一個詞從詞窗剔除。在CBOW下給定 $n$ 詞圍繞著詞 $w$ ，word2vec預測一個句子中其中一個缺漏的詞 $c$ ，即以機率 $p(c|w)$ 來表示。相反地，Skip-gram給定詞窗中的文本，預測當前的詞 $p(w|c)$ 。

延伸编辑

Word2vec用來建構整份文件（而分獨立的詞）的延伸應用已被提出^[4]，該延伸稱為paragraph2vec或doc2vec，並且用C、Python^[5]^[6]和 Java/Scala^[7]實做成工具（參考下方）。Java和Python也支援推斷文件嵌入於未觀測的文件。

分析编辑

對word2vec框架為何做词嵌入如此成功知之甚少，約阿夫·哥德堡（Yoav Goldberg）和歐莫·列維（Omer Levy）指出word2vec的功能導致相似文本擁有相似的嵌入（用余弦相似性計算）並且和約翰·魯伯特·弗斯的分佈假說（英语：Distributional semantics）有關。

實作编辑

C （页面存档备份，存于互联网档案馆）
Python （页面存档备份，存于互联网档案馆）
Python （页面存档备份，存于互联网档案馆）

參見编辑

向量空間模型

参考文献编辑

^ Mikolov, Tomas; et al. (PDF). [2015-08-14]. （原始内容 (PDF)存档于2022-05-09）.
^ Goldberg, Yoav; Levy, Omar. (PDF). [2015-08-14]. （原始内容 (PDF)存档于2022-01-22）.
^ Řehůřek, Radim. (Youtube video). [2015-08-14]. （原始内容存档于2020-05-22）.
^ Le, Quoc; et al. (PDF). [2016-02-18]. （原始内容 (PDF)存档于2021-11-23）.
^ . [2015-08-02]. （原始内容存档于2021-01-23）.
^ Doc2vec for IMDB sentiment analysis. [2016-02-18]. （原始内容于2020-01-07）.
^ . [2016-01-13]. （原始内容存档于2015-12-31）.

[mikolov-1] Mikolov, Tomas; et al. (PDF). [2015-08-14]. （原始内容 (PDF)存档于2022-05-09）.

[explain-2] Goldberg, Yoav; Levy, Omar. (PDF). [2015-08-14]. （原始内容 (PDF)存档于2022-01-22）.

[extensions-3] Řehůřek, Radim. (Youtube video). [2015-08-14]. （原始内容存档于2020-05-22）.

[doc2vec-4] Le, Quoc; et al. (PDF). [2016-02-18]. （原始内容 (PDF)存档于2021-11-23）.

[doc2vec_python-5] . [2015-08-02]. （原始内容存档于2021-01-23）.

[doc2vec_imdb-6] Doc2vec for IMDB sentiment analysis. [2016-02-18]. （原始内容于2020-01-07）.

[doc2vec_java-7] . [2016-01-13]. （原始内容存档于2015-12-31）.

[1]

[2]

[3]

[4]

[5]

[6]

[7]

www.wiki2.zh-cn.nina.az

Word2vec

目录

Skip-grams和CBOW 编辑

延伸编辑

分析编辑

實作编辑

參見编辑

参考文献编辑

瑞士格施塔德公开赛

瑞士法语广播电视

瑞士湖泊列表

瑞士联邦理工大学

瑞士联邦主席列表

瑞士自由民主黨

瑞士軍工

瑞士雲克多夫球場

瑞士-易捷航空

瑞奇蒙 (夸祖魯-納塔爾省)

上海龙华庙会

上流社会

上流寺 (宁乡市)

上深沟堡墓群

上游水库 (汨罗)

文章

Skip-grams和CBOW 编辑

延伸 编辑

分析 编辑

實作 编辑

參見 编辑

参考文献 编辑

文章

延伸编辑

分析编辑

實作编辑

參見编辑

参考文献编辑