
SpeakerDiarization_RNN_CNN_LSTM:在音频中分离扬声器的分类问题,可涉及任意数量的发言人,...
5星
- 浏览量: 0
- 大小:None
- 文件类型:None
简介:
《SpeakerDiarization_RNN_CNN_LSTM》提出了一种结合RNN、CNN和LSTM网络结构的方法,有效解决音频文件中多发言人身份识别与分离的技术难题。
引文:如果您发现我们的项目有帮助,请引用我们的 arxiv 报告:
@misc{sharma2020speaker,
title={Speaker Diarization: Using Recurrent Neural Networks},
author={Vishal Sharma and Zekun Zhang and Zachary Neubert and Curtis Dyreson},
year={2020},
eprint={2006.05596},
archivePrefix={arXiv},
primaryClass={eess.AS}}
说话人分类是指在音频中区分不同发言者的过程。可以有任意数量的发言人,最终结果需要标明每个发言者的开始和结束时间。在这个项目里,我们处理了包含两个通道且各有一个扬声器的情况(即每个扬声器占据单独的一个通道)。
全部评论 (0)
还没有任何评论哟~


