Advertisement

Wenet 2万小时的开源语音数据集

  • 5星
  •     浏览量: 0
  •     大小:None
  •      文件类型:None


简介:
Wenet是一个包含2万小时高质量录音的开源中文语音数据集,旨在促进学术界和工业界的语音识别研究与应用开发。 Wenet数据集的开源版本包含超过20000小时的数据(2万小时以上),可用于训练自动语音识别和声纹识别系统。

全部评论 (0)

还没有任何评论哟~
客服
客服
  • Wenet 2
    优质
    Wenet是一个包含2万小时高质量录音的开源中文语音数据集,旨在促进学术界和工业界的语音识别研究与应用开发。 Wenet数据集的开源版本包含超过20000小时的数据(2万小时以上),可用于训练自动语音识别和声纹识别系统。
  • Wenet Windows版自动识别发库及测试程序(ASR)
    优质
    Wenet Windows版提供了一套先进的自动语音识别(ASR)开发工具包和配套测试程序,适用于Windows系统环境下的开发者与研究人员。 Wenet 是一个自动语音识别开发库及测试程序(ASR),在 Windows 版本的编译过程中存在较大难度。
  • MASR中文识别模型——基于AIShell(179)
    优质
    简介:MASR为一款高效中文语音识别模型,训练基础为包含179小时丰富语料的AIShell数据集,适用于各类语音转文本的应用场景。 MASR是一个中文语音识别模型,并且在aishell数据集上进行了训练,该数据集包含179小时的录音。
  • TIMIT
    优质
    TIMIT语音数据集是一个包含大量美国英语口语录音的数据集合,广泛应用于语音识别和声学模型训练中。 TIMIT语音数据集是一个广泛使用的英语语音数据库,在语音识别研究领域具有重要地位。它包含了大量不同发音人的录音样本,涵盖了各种音素、单词以及句子的发音变化,为研究人员提供了丰富的实验材料。该数据集的设计旨在促进对连续话语中声音信号的理解和处理技术的发展,并且已经被用于开发多种自动语音识别系统和技术评估基准测试之中。
  • TIMIT
    优质
    TIMIT语音数据集是一套广泛应用于语音识别和声学建模研究的标准数据库,包含大量美国英语发音样本及其转录文本。 一个语音数据库,旨在为希望对音频信号进行处理及分析的人提供帮助。
  • TIMIT
    优质
    TIMIT语音数据集是一个广泛使用的英语语音数据库,包含了大量的录音和转录文本,用于语音识别研究和技术开发。 常用TIMIT语音数据库在语音信号处理方面非常实用,包含的都是WAV文件,可以直接调用。
  • Wenet:面向生产端到端识别工具包
    优质
    Wenet是一款集成了多种先进模型和算法的端到端语音识别开源工具包,旨在为开发者提供高效、准确的语音转文本解决方案。 WeNet的主要目标是缩小研究与生产端到端(E2E)语音识别模型之间的差距,减少将这些模型投入生产的复杂性,并探索更适合实际应用的新型E2E架构。 强调以下几点: - 生产至准备就绪:WeNet的Python代码符合TorchScript的要求,这意味着通过WeNet训练出来的模型可以直接使用LibTorch进行推理而无需额外转换或编写其他代码。 - 流与非流ASR的一体化解决方案:它提供了一个框架来实现准确、快速且统一的端到端语音识别系统,便于行业采用。 - 可移植的运行环境:将展示如何在各种平台(包括服务器和设备)上部署经过WeNet训练好的模型。 - 简洁高效的设计:为专门针对E2E语音识别而构建,其代码结构清晰简洁。完全基于PyTorch及其生态系统开发,不依赖于Kaldi等其他工具或库。
  • timit.rar
    优质
    TIMIT语音数据集是一款包含大量美国英语发音的数据资源包,用于语言识别、声学模型训练及评估。 著名的MIT语音库已经处理完毕,可以直接播放或测试使用。由于库文件较大,这里仅提供部分内容。该库包含63个人的录音,每人约有10段录音片段。
  • 信号
    优质
    本数据集包含丰富的语音信号样本,旨在为语音识别、声纹识别等领域的研究与开发提供支持。涵盖多种语言及口音,促进相关技术的进步与发展。 这是《MATLAB神经网络43个案例分析》这本书中的语音特征信号数据集。
  • TensorFlow TTS:基于TensorFlow 2合成-Python
    优质
    简介:TensorFlow TTS是一款利用TensorFlow 2框架实现的Python库,专注于高效、高质量的实时语音合成功能,适用于开发者和研究人员。 TensorflowTTS基于TensorFlow 2提供实时的最新语音合成架构,例如Tacotron-2、MelGAN、Multiband-MelGAN 和 FastSpeech/FastSpeech2。利用TensorFlow 2的优势,我们可以加速训练与推理过程,并通过伪量化感知和修剪进一步优化程序,使文本到语音(TTS)模型运行速度超过实时水平,并且能够在移动设备或嵌入式系统上部署。