
跨领域挖掘揭示了生成模型在文本分类中的差异与相似之处。
5星
- 浏览量: 0
- 大小:None
- 文件类型:None
简介:
近年来,不同领域间的分布差异已成为跨域文本分类的重要研究方向。在此基础上,本研究揭示了两个重要的发现。首先,数据分布的差异通常源于各个领域采用不同的索引词来表达相同的概念。其次,概念性元素与文档类之间的关联性在跨领域上能够保持相对的稳定性。这些观察结果实质上表明了跨领域的区别以及它们所共有的特征。受到上述观察的启发,我们设计了一种生成统计模型,命名为协作双重PLSA(CD-PLSA),旨在同时捕捉多个领域间的区别和共性。与仅包含一个潜在变量的概率潜在语义分析(PLSA)模型不同,该模型引入了两个潜在因子y和z,分别对应于单词的概念和文档类别。这些潜在因子之间共享公共性信息,并且这种公共性也充当了知识转换的关键纽带。为了解决CD-PLSA模型的问题,我们开发了一种期望最大化(EM)算法,并进一步利用其分布式版本以避免将所有原始数据集中上传处理,从而有效地减轻了潜在的隐私风险。在训练阶段,我们首先利用来自多个领域的全部数据进行训练,随后建议仅使用相应的本地数据来优化模型的实时输出性能。总而言之,我们提出了一种用于跨域文本分类的两阶段策略:第一阶段致力于对所有数据进行协作训练;第二阶段则专注于局部优化过程。最后,我们通过对数百个具有多个源域和多个目标域的分类任务进行了广泛而深入的实验验证来评估所提出的方法的有效性。
全部评论 (0)
还没有任何评论哟~


