Advertisement

基于MATLAB的hiernmf2代码:适用于文档聚类与主题建模的二级层次NMF

  • 5星
  •     浏览量: 0
  •     大小:None
  •      文件类型:None


简介:
本作品提供了一个基于MATLAB实现的hiernmf2代码,专门用于执行文档的二级层次非负矩阵分解(NMF),以支持高效的文档聚类和主题建模任务。 等级2的NMF(HierNMF2)是一种用于大型文档聚类与主题建模的无监督算法,在质量上大约是LDA的二十倍,并且在生物信息学领域也取得了成功应用的成绩。这个Matlab软件包是为了支持以下论文而开发:DaKuang, HaesunPark 和 Fastrank-2 nonnegative matrix factorization for hierarchical document clustering,发表于 The 19th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (KDD13),页码739至747。如果发现该代码有用,请引用上述论文。 所有这些Matlab函数均已进行了文档记录。要开始使用软件包,请运行脚本test.m,此脚本会利用Reuters数据集生成具有20个叶节点的主题层次结构。在每个M文件的开头可以找到帮助文本以获取更多选项信息。 通常来说,HierNMF2算法更适用于术语文档矩阵,在这种情况下,每一个数据点代表一篇文档。

全部评论 (0)

还没有任何评论哟~
客服
客服
  • MATLABhiernmf2NMF
    优质
    本作品提供了一个基于MATLAB实现的hiernmf2代码,专门用于执行文档的二级层次非负矩阵分解(NMF),以支持高效的文档聚类和主题建模任务。 等级2的NMF(HierNMF2)是一种用于大型文档聚类与主题建模的无监督算法,在质量上大约是LDA的二十倍,并且在生物信息学领域也取得了成功应用的成绩。这个Matlab软件包是为了支持以下论文而开发:DaKuang, HaesunPark 和 Fastrank-2 nonnegative matrix factorization for hierarchical document clustering,发表于 The 19th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (KDD13),页码739至747。如果发现该代码有用,请引用上述论文。 所有这些Matlab函数均已进行了文档记录。要开始使用软件包,请运行脚本test.m,此脚本会利用Reuters数据集生成具有20个叶节点的主题层次结构。在每个M文件的开头可以找到帮助文本以获取更多选项信息。 通常来说,HierNMF2算法更适用于术语文档矩阵,在这种情况下,每一个数据点代表一篇文档。
  • Matlab(凝).zip
    优质
    本资源提供了一套用于执行凝聚层次聚类分析的MATLAB代码。通过该工具,用户能够便捷地对数据集进行分层聚类以探索其内在结构,并生成树状图展示结果。 聚类就是单纯的聚类算法。别的我也不知道。
  • .zip__MATLAB实现_
    优质
    本资源提供了一套使用MATLAB编写的层次聚类算法代码。通过该代码,用户可以便捷地进行数据分层和集群分析,适用于科研及工程应用中对复杂数据集的处理需求。 用MATLAB实现层次聚类法,不是通过调用库函数完成的,而是严格按照算法原理一步步编写代码来实现的。
  • Matlab
    优质
    本段落介绍了一种在MATLAB环境中实现的数据分析技术——层次聚类算法。通过简洁高效的代码示例,帮助用户掌握如何应用该方法对数据进行分组和分类研究。 层次聚类的MATLAB代码需要使用字符串格式的数据,并且数据类型必须一致以确保计算准确性和数据可用性。这样的处理方式简单实用,能够提高数据分析的质量。
  • MATLAB_Hierarchical.zip_MATLAB
    优质
    该资源包提供了利用MATLAB进行层次聚类分析的代码和示例数据。适用于数据分析、机器学习等领域,帮助用户理解和应用层次聚类算法。 层次聚类算法的MATLAB实现,不使用内置函数。
  • MATLABSymNMF:利对称NMF进行图
    优质
    本简介介绍了一种使用MATLAB实现的SymNMF算法,该算法通过应用对称非负矩阵分解(SymNMF)技术来执行高效的图数据聚类分析。 对称非负矩阵因式分解(SymNMF)是一种无监督的图聚类算法,在生物信息学和基因组研究等领域发现了许多应用及其扩展。该Matlab软件包是为了支持以下论文开发的:DaKuang, ChrisDing, HaesunPark, SymmetricNonnegativeMatrixFactorizationforGraphClustering, The 12th SIAM International Conference on Data Mining (SDM12), pp. 106--117, 2012。以及期刊版本:DaKuang, SangwoonYun, HaesunPark, SymNMF: Nonnegativelow-rankapproximationofasimilaritymatrixforgraphclustering, Journal of Global Optimization, 62(3):545-574, 2015。如果发现该代码有用,请引用上述论文。 问题陈述: S
  • MATLAB
    优质
    本段介绍了一种基于MATLAB实现的凝聚型层次聚类算法代码。该代码能够有效地进行数据分组和模式识别,在数据分析中具有广泛应用价值。 代码仅供学习研究使用,请勿擅自商用。输入文件格式为N行两列的形式,分别对应数据点的X轴和Y轴坐标。 示例如下: ``` 0.821794 -0.0462153 1.03929 0.060835 1.12046 0.0745568 1.02233 0.0514739 ``` 代码支持的凝聚层次聚类算法包括: - 单连接算法(默认,最近邻聚类算法,最短距离法,最小生成树算法) - 全连接算法(最远邻聚类算法,最长距离法) - 未加权平均距离法 - 加权平均法 - 质心距离法 - 加权质心距离法 - 内平方距离法(最小方差算法) 代码支持的距离或相似度度量公式包括: - 欧氏距离(默认) - 标准化欧氏距离 - 马氏距离 - 布洛克距离(曼哈顿距离,城市街区距离) - 闵可夫斯基(明可夫斯基)距离 - 余弦相似度 - 相关性相似度 - 汉明距离 - Jaccard相似度 - 切比雪夫距离
  • MATLAB
    优质
    本段落提供了一种使用MATLAB进行凝聚型层次聚类的代码示例。通过该代码,用户可以对数据集执行层次聚类分析,并可视化树状图以理解不同群组间的层级关系。 代码仅供学习研究使用,请勿未经许可用于商业用途。 1. 输入文件格式:输入的文件需要包含N行两列的数据,其中每行的第一列表示数据点在X轴上的坐标值,第二列表示Y轴上的坐标值。例如: ``` 0.821794 -0.046215 3.103929 0.060835 1.12046 0.074556 ... ``` 2. 支持的凝聚层次聚类算法:通过调整代码中函数参数,可以支持多种不同的凝聚方法。默认设置为单连接法(最近邻、最短距离),其他可选的方法包括全连接法(最远邻、最长距离)、未加权平均距离法、加权平均法、质心距离法、加权质心距离法和内平方距离法(最小方差算法)。 3. 支持的距离或相似度计算公式:代码可以使用不同的方法来衡量两个数据点之间的差异,支持的选项包括欧氏距离(默认)、标准化欧氏距离、马氏距离、布洛克距离(曼哈顿/城市街区),闵可夫斯基(明可夫斯基)距离、余弦相似度、相关性相似度、汉明距离以及Jaccard相似度和切比雪夫距离。
  • 算法: Ruby agglomerative_clustering
    优质
    层次凝聚聚类算法是使用Ruby语言实现的一种数据分析方法,通过递归地将单个数据对象合并到更大的群集,形成层级结构的数据分类系统。 凝聚聚类分层算法可以处理三维点集,并根据欧几里德距离将这些点分为最近的 k 个集群。这种算法支持四种不同的链接方式:单链(基于两个簇间最近两点的距离)、全链(基于最远两点的距离)、平均链(基于所有点之间的平均距离)和中心链(以各簇中心为基准)。为了使用此功能,首先需要在 Gemfile 中添加以下行: ```ruby gem agglomerative_clustering ``` 然后执行 `bundle install` 命令。或者直接通过命令安装: ```shell $ gem install agglomerative_clustering ``` 有关如何使用的示例,请参阅 cluster.rb 文件,待我有空时会在此处添加更多说明。要为项目贡献代码,请创建一个新分支(例如 `git checkout -b my-new-feature`),提交您的更改,并进行推送。