当前位置：网站首页 > 技术博客 > 正文

gensim word2vec源码

技术博客来源：网络编辑：小编发布时间：2025-01-08 11:30:05 浏览量：265

本篇博客是Gensim的进阶教程，主要介绍用于词向量建模的word2vec模型和用于长文本向量建模的doc2vec模型在Gensim中的实现。

Word2vec并不是一个模型——它其实是2013年Mikolov开源的一款用于计算词向量的工具。关于Word2vec更多的原理性的介绍，可以参见我的另一篇博客：word2vec前世今生

在Gensim中实现word2vec模型非常简单。首先，我们需要将原始的训练语料转化成一个sentence的迭代器；每一次迭代返回的sentence是一个word（utf8格式）的列表：

接下来，我们用这个迭代器作为输入，构造一个Gensim内建的word2vec模型的对象（即将原始的one-hot向量转化为word2vec向量）：

如此，便完成了一个word2vec模型的训练。

我们也可以指定模型训练的参数，例如采用的模型（Skip-gram或是CBoW）；负采样的个数；embedding向量的维度等。具体的参数列表在这里

同样，我们也可以通过调用和方法完成word2vec模型的持久化。此外，word2vec对象也支持原始bin文件格式的读写。

Word2vec对象还支持online learning。我们可以将更多的训练数据传递给一个已经训练好的word2vec对象，继续更新模型的参数：

若要查看某一个word对应的word2vec向量，可以将这个word作为索引传递给训练好的模型对象：

Doc2vec是Mikolov在word2vec基础上提出的另一个用于计算长文本向量的工具。它的工作原理与word2vec极为相似——只是将长文本作为一个特殊的token id引入训练语料中。在Gensim中，doc2vec也是继承于word2vec的一个子类。因此，无论是API的参数接口还是调用文本向量的方式，doc2vec与word2vec都极为相似。

主要的区别是在对输入数据的预处理上。Doc2vec接受一个由LabeledSentence对象组成的迭代器作为其构造函数的输入参数。其中，LabeledSentence是Gensim内建的一个类，它接受两个List作为其初始化的参数：word list和label list。

类似地，可以构造一个迭代器对象，将原始的训练数据文本转化成LabeledSentence对象：

准备好训练数据，模型的训练便只是一行命令：

该代码将同时训练word和sentence label的语义向量。如果我们只想训练label向量，可以传入参数以固定词向量参数。更多参数的含义可以参见这里的API文档。

注意，在目前版本的doc2vec实现中，每一个Sentence vector都是常驻内存的。因此，模型训练所需的内存大小同训练语料的大小正相关。

上一篇： class类详解

下一篇：图的遍历实现流程图

版权声明：
本文来源网络，所有图片文章版权属于原作者，如有侵权，联系删除。

本文网址：https://www.mushiming.com/mjsbk/12796.html

相关文章：

class类详解2025-01-08 11:30:05

在线代码分析2025-01-08 11:30:05

css怎么清除浮动2025-01-08 11:30:05

jdk调试2025-01-08 11:30:05

shtml和html的区别2025-01-08 11:30:05

图的遍历实现流程图2025-01-08 11:30:05

javascript模块化编程2025-01-08 11:30:05

对比数据怎么做2025-01-08 11:30:05

方舟生存神器代码大全2025-01-08 11:30:05

移动端常用ui组件2025-01-08 11:30:05