
ETM:词嵌入文本连续空间主题模型的实现
5星
- 浏览量: 0
- 大小:None
- 文件类型:None
简介:
ETM简介:本项目实现了词嵌入与LDA模型结合的文本主题抽取技术——ETM,旨在提供更高质量的主题建模服务。 这段简介简洁明了地介绍了ETM项目的性质和目标,长度适中。若需要进一步详细说明实现细节或应用场景,请告知我以便于调整内容。
词嵌入的连续空间主题模型描述了带有单词嵌入的连续空间主题模型(Continuous Space Topic Model, CSTM),这是Daichi Mochihashi提出的增强版本。该环境使用C++ 14+、lang ++ 9.0、提升库1.71.0、glog 0.4.0和gflag 2.2.2,以及boost-python3和python3。
为了训练ETM(Enhanced Topic Model),首先需要准备基于文档的语料库,并将其分为训练数据集和验证数据集。然后使用马尔可夫链蒙特卡洛方法进行模型训练:
1. 编译代码:`$ make`
2. 运行程序:
```
$ ./cstm -ndim_d=20 -ignore_word_count=4 -epoch=100 \
-num_threads=1 -data_path=./data/train/ \
-validation_data_path=./data/validation/ \
-model_path=./model/cstm.model
```
参数说明:
- `-ndim_d`:指定文档向量的维度。
- `-ignore_word_count`:忽略出现次数少于该值的单词。
- `-epoch`:设置训练迭代次数。
- `-num_threads`:使用线程数,以提高计算效率。
- `-data_path`:指向用于训练的数据集路径。
- `-validation_data_path`:验证数据集的位置。
- `-model_path`:保存训练后模型文件的路径。
全部评论 (0)


