
CVSE: 图像-文本匹配中共识感知视觉语义嵌入的官方源代码(发表于ECCV 2020)
5星
- 浏览量: 0
- 大小:None
- 文件类型:None
简介:
CVSE是针对图像-文本匹配任务开发的一种共识感知视觉语义嵌入方法,通过融合多模态数据提升跨模态理解能力。该技术论文在2020年欧洲计算机视觉大会(ECCV)上发表,并提供官方源代码供学术研究和应用参考。
本段落介绍的是共识感知视觉语义嵌入(CVSE)模型的官方源代码实现,该模型基于PyTorch构建。图像文本匹配在连接视觉与语言方面扮演着关键角色。大多数现有的方法仅依赖于图-文实例对来学习它们的表现形式,并利用其配对关系进行相应的对齐操作。然而,这样的方式仅仅使用了成对数据中的表面关联信息,而没有考虑任何外部常识知识的存在,这可能限制了模型推理图像和文本之间更深层次联系的能力。
为了解决这一问题,在本段落中我们提出了一种新的共识感知视觉语义嵌入(CVSE)模型。该模型旨在将共识信息整合到图-文匹配任务中。具体来说,通过计算来自图片描述数据集中的语义概念之间的统计共现相关性,并构建一个共享的概念关联图以生成具有共识意识的概念表示(CAC) ,来利用这些共识知识。
在获取了这样的共识之后,CVSE模型进一步基于所获得的共识以及图像与文本各自的实例级表现形式,学习出它们之间更为深层次的关系和对齐方式。实验结果表明,在两个公开数据集上的大量测试证明了该方法的有效性。
全部评论 (0)
还没有任何评论哟~


