
Python作业:使用Flickr30k数据集进行图像文本跨模态搜索(含源码、数据集、测试界面及项目说明).7z
5星
- 浏览量: 0
- 大小:None
- 文件类型:None
简介:
本项目提供基于Python的Flickr30k数据集图像文本跨模态搜索解决方案,包含完整源代码、数据集、交互式测试界面和详细文档。下载后可直接运行进行实验与研究。
Python作业:基于Flickr30k数据集实现图像文本跨模态搜索的源码、数据集及项目说明。
【数据预处理】在Preprocessing目录下:
- data_split_1.py:划分训练集、测试集和验证集。
- resize_data_2.py:保持长宽比例不变,将短边拉伸至256像素。
- count_vocab_3.py:统计每个单词的词频。
- convert_annotations_4.py:将.txt格式的标注文件转换为.json格式。
- build_dictionary_5.py:构建单词编号查询字典。
【模型训练】在数据预处理完成后,需配置config.py中的各文件路径及训练参数,并下载谷歌新闻上预训练的Word2Vec模型。之后使用以下脚本进行训练:
- trainStage1.py:使用分类损失对模型进行初步训练。
- trainStage2.py:采用三元组损失和对抗损失微调模型。
【测试界面】在QueryApp目录下的图文互搜.exe提供了简单的测试环境,便于用户验证功能实现。
全部评论 (0)
还没有任何评论哟~


