
DcaseNet: 用于复制的作者存储库,包含一种预训练的集成深度神经网络,适用于声音场景分类任务,...
5星
- 浏览量: 0
- 大小:None
- 文件类型:ZIP
简介:
DCASENet是一款专为声音场景分类设计的预训练集成深度神经网络模型,广泛应用于声音识别和分类领域,助力研究者便捷开展相关研究。
概述:
该GitHub项目包含一个用于再现实验的PyTorch实现,并已在IEEE ICASSP 2021上展示。
DcaseNet是一个深度神经网络(DNN),能够同时执行声学场景分类(ASC)、音频标记(TAG)和声音事件检测(SED)。它采用两阶段训练方法。在第一阶段,三个任务的联合训练被执行;随后针对每个单独的任务对模型进行微调。
用法:
环境设定
实验是在Nvidia GPU Cloud上完成的,使用了一个Nvidia Titan RTX GPU用于培训工作。
下载和配置DCASE 2020挑战任务1-a、DCASE 2019挑战任务2以及DCASE 2020挑战任务3的数据集。
(可选)使用NGC进入虚拟环境。
设置参数
运行train.sh脚本。如果您更倾向于使用预先训练的联合DcaseNet模型并仅进行微调,可以删除“Joint”实验,并将预训练模型复制到您的工作目录中。
全部评论 (0)
还没有任何评论哟~


