
利用CNN进行中文文本分类的方法(适用于垃圾邮件过滤和情感分析等领域)
5星
- 浏览量: 0
- 大小:None
- 文件类型:None
简介:
本文探讨了使用卷积神经网络(CNN)对中文文本进行自动分类的技术,并展示了其在识别垃圾邮件及执行情感分析等实际应用中的有效性。
基于CNN的中文文本分类算法(适用于垃圾邮件过滤、情感分析等情况)采用word2vec获取测试数据集中每个字的向量表示,然后输入卷积网络进行分类。
运行方法:
- 训练:通过命令行执行 `python train.py` 来使用包含垃圾邮件和非垃圾邮件文件的数据集训练CNN(仅支持中文!)。请根据需要修改配置文件路径。
- 查看TensorBoard总结信息:在终端中运行 `tensorboard --logdir /{PATH_TO_CODE}/runs/{TIME_DIR}/summaries/`,然后通过浏览器访问相关地址查看汇总数据。
- 测试分类:使用命令行执行 `python eval.py --checkpoint_dir /{PATH_TO_CODE/runs/{TIME_DIR}/checkpoints}` 进行测试或分类操作。
如果您需要对自定义文件进行分类,请调整相应的输入参数。为了评估准确率,您需提供对应的标签文件(`input_label_file`)。在eval.py中,如果有这个对照的标签文件,则会输出预测结果的准确性。
推荐运行环境:
- Python 2.7.13 :: Anaconda 4.3.1 (64-bit)
- TensorFlow 1.0.0
- Gensim 1.0.1
- Ubuntu16.04 64bit
全部评论 (0)
还没有任何评论哟~


