Advertisement

汇总的数据集集合,涵盖中文摘要、中文片段抽取式问答、中文文本相似度及中文命名实体识别数据集

  • 5星
  •     浏览量: 0
  •     大小:None
  •      文件类型:ZIP


简介:
本资料库汇集了多种关键任务相关的中文语言处理数据集,包括摘要生成、片段抽取式问答、文本相似度评估和命名实体识别,助力自然语言处理研究与应用。 整理了一些数据集,包括中文摘要数据集、中文片段抽取式阅读理解问答(QA)数据集、中文文本相似度数据集以及中文命名实体识别(NER)数据集。

全部评论 (0)

还没有任何评论哟~
客服
客服
  • 优质
    本资料库汇集了多种关键任务相关的中文语言处理数据集,包括摘要生成、片段抽取式问答、文本相似度评估和命名实体识别,助力自然语言处理研究与应用。 整理了一些数据集,包括中文摘要数据集、中文片段抽取式阅读理解问答(QA)数据集、中文文本相似度数据集以及中文命名实体识别(NER)数据集。
  • NER
    优质
    中文NER(Named Entity Recognition)数据集是一套专门用于识别中文文本中人名、地名和组织机构等命名实体的语料库,旨在促进自然语言处理技术的发展。 中文命名实体识别数据集非常实用。它涵盖了组织、机构和个人三个方面的实体。
  • Weibo
    优质
    本数据集为中文微博文本设计,旨在进行命名实体识别研究,涵盖人名、地名与组织名等类别,促进自然语言处理技术的发展。 自然语言处理的子任务命名实体识别在中文数据集方面非常全面。
  • 优质
    中文长文本摘要数据集是由一系列中文文档及其人工编写的摘要构成,旨在促进自动文摘技术的研究与应用。 1. 中文数据集 2. 长文本数据集 3. 摘要生成、摘要抽取任务数据集
  • 优质
    本数据集专注于提供大规模、高质量的中文文本语料,旨在促进对中文实体名称(如人名、地名等)的自动识别研究与应用开发。 BIO标签集用于标记文本中的命名实体。其中,“B-PER”表示人名的首字,“I-PER”表示人名字中间非首字;“B-LOC”代表地名的起始字符,而“I-LOC”则标识该地名中除开头外的部分文字。“B-ORG”的使用场景是组织机构名称中的第一个汉字,“I-ORG”用于标记这些实体名称内的后续部分。此外,“O”标签表示对应的文字不属于任何命名实体的一部分。
  • 关系
    优质
    中文文学实体关系抽取数据集是一份专为中文文本设计的数据集合,包含大量文学作品中的实体及其实体间的关系信息,旨在促进自然语言处理领域内的研究与应用。 基于几个可用的命名实体识别(NER)和关系抽取(RE)数据集,定义了7个实体标签和9个关系标签。每个实体都由带有多个属性的T标签标识;每个关系则通过R标签进行标注,并且该标签可以具有多种属性。
  • 社科论 - CASSum.zip
    优质
    CASSum 是一个包含大量中文社会科学论文摘要的数据集合,旨在为研究者提供丰富的资源用于长文本摘要的研究与开发。 头歌实践教学平台答案中文长文本摘要数据集 - 社科论文-摘要数据集_CASSum.zip
  • (MSRA+人民日报+Boson)
    优质
    本数据集整合了MSRA、人民日报及Boson三个来源的中文文本,涵盖大量人名、地名、组织名等实体标签,适用于训练高质量的中文命名实体识别模型。 适合作为命名实体识别的补充语料包括微软亚洲研究院MSRA:46365条语料、人民日报:23061条语料以及Boson: 2000条语料,这些数据都已经标注过,非常实用,适合新手作为模型练习使用。
  • 推理和匹配——XNLI
    优质
    XNLI是一个多语种自然语言理解的数据集,它基于英文的GLUE基准测试中的MNLI数据集,并将其扩展到包括简体中文在内的十五种低资源语言中。该数据集旨在促进跨语言自然语言推理任务的研究与应用,帮助模型更好地理解和处理不同语言间的逻辑关系和语义差异。 中文文本相似度、文本推理和文本匹配数据集——XNLI提供了一个多语言自然语言理解的基准测试平台。该数据集基于英文自然逻辑推理(MNLI)语料库,并通过众包翻译扩展到了15种不同的语言,包括阿拉伯语、德语、希腊语等。XNLI旨在评估模型在跨语言任务中的表现能力,特别是在缺乏大量标注训练数据的情况下如何进行有效的迁移学习和多语言建模。
  • 、推理和匹配——CCKS2018
    优质
    中文文本相似度、推理和匹配数据集——CCKS2018是针对中文自然语言处理设计的数据集合,旨在促进文本理解、语义分析及知识图谱构建的研究与应用。 中文文本相似度/文本推理/文本匹配数据集——CCKS2018