
各类中文NLP数据集的集合
5星
- 浏览量: 0
- 大小:None
- 文件类型:ZIP
简介:
该集合整合了多种中文NLP相关数据,并旨在完成以下几项功能:首先收集并整理不同应用场景下的中文语料;其次便于自身及各位用户后续使用这些资源;最后主要用于研究和训练语义相似度相关任务。其中包含的具体内容包括:ATEC语义相似度学习赛中的语料集合以及该集合专注于研究与处理语义相似性相关的任务。这些材料均存储于ATEC平台中CCKS 2018 智能客服问句匹配大赛的数据集微众银行其分类依据为语义相似度评估标准存储路径标记为CCKS_2018_3号文件
CCKS 2018 智能客服问句匹配大赛的数据集微众银行其分类依据为语义相似度评估标准存储路径标记为CCKS_2018_3号文件由ATEC与CCKS 2018组成的联合数据集,在处理互金客服场景相关语料时表现出良好的适用性。该集合整合了来自ATEC及CCKS 2018两个比赛所提供的语料资源,并通过分层抽样的方法对整合后的语料进行划分,并从中提取出训练集、验证集以及测试集
训练集、验证集和测试集中正类的比例均约为34%。
训练集中包含24万条样本,
验证集与测试集各自仅有1万条样本。
该数据集的属性为语义相似度,
存储路径为ATEC_CCKS文件夹。哈尔滨工业大学BERT-based Question Answering数据集
全部评论 (0)
还没有任何评论哟~


