
Vision Transformer网络对30种水果图像分类数据集的分类,包含训练权重和数据集信息
5星
- 浏览量: 0
- 大小:None
- 文件类型:7Z
简介:
该网络采用了基于Transformer架构的ViT模型该数据集合是三十分类的水果数据集(例如:苹果、香蕉、苦瓜和猕猴桃等)。
在网络训练过程中,首先会对数据集的训练集图像进行灰度通道均值与方差的计算,并通过预处理操作包括随机裁剪和中心裁剪等方式对图像进行增强。接着,在网络初始化阶段,系统会自动加载ViT官方提供的经过调优的参数初始化值(因为基于transformer架构的设计需要较长的时间才能收敛到理想的效果,因此本代码实现了这一功能)。4.train.py会自动生成数据集类别对应的json文件,因此无需自行定义。在完成训练后,程序将计算并输出训练集与测试集的损失值、准确率,并将其以曲线的形式存储在run_results文件夹中。完成训练后,程序还会计算出训练集和测试集的混淆矩阵,并计算相应的召回率、特异度等指标。该预测代码为 predict.py。只需将待预测的图片放置于 inference 文件夹内。代码将自动识别所有图片,并在每个图片的左上方标注出最高 ranked 的前三类及对应概率。如果想要训练自己的数据集,参考README文件
本项目训练了40个epoch,准确率为0.963,加大轮次可以增加精度
如果需要进行数据集训练,请参照README文件遵循指导
目前该项目经过40个 epoch的训练,达到96.3%的精度。通过增加训练轮数,可以使模型的预测准确性进一步提升。
如果需要进行数据集训练,请参照README文件遵循指导
目前该项目经过40个 epoch的训练,达到96.3%的精度。通过增加训练轮数,可以使模型的预测准确性进一步提升。
全部评论 (0)
还没有任何评论哟~


