Advertisement

通过Bi-LSTM和CRF模型进行人名识别,采用人民日报98年1月标注的数据集,训练集与验证集与测试集的比例为3:1:1。

  • 5星
  •     浏览量: 0
  •     大小:None
  •      文件类型:None


简介:
通过使用Bi-LSTM和CRF模型,对人名识别任务进行了处理。具体而言,该方法利用了人民日报于1998年1月标注的人名数据集进行训练。为了保证模型的稳定性和泛化能力,训练集、验证集和测试集的比例设定为3:1:1。原始数据文件位于/data/rmrb199801.txt,并经过data_process.py脚本的大量预处理操作。实验结果表明,模型的准确率(acc)达到了0.99,而F1值(f1)则为0.9。

全部评论 (0)

还没有任何评论哟~
客服
客服
  • NLP_NER:运Bi-LSTMCRF,基于199813:1:1
    优质
    本项目利用Bi-LSTM结合CRF模型对中文文本中的人名进行准确识别,基于1998年1月《人民日报》的数据集,并以3:1:1的比例划分了训练、验证及测试数据。 nlp_ner 使用 Bi-LSTM 和 CRF 进行人名识别,数据集为人民日报 1998 年 1 月的标注数据。训练、验证和测试的比例是3:1:1。原始数据文件位于 /data/rmrb199801.txt,经过 data_process.py 文件处理后,结果表明准确率(acc)为 0.99,F1 值为 0.9。
  • 优质
    本数据集包含大量经过标注的验证码图像,旨在用于机器学习模型的训练和测试,以提高验证码识别系统的准确性和效率。 验证码识别的训练集和测试集已经做好了标签,可以直接用于训练。
  • -
    优质
    简介:本项目提供一个人脸识别的数据集,包含用于模型训练和评估的独立子集。这些数据为研究者提供了宝贵的资源以改进人脸识别技术。 使用大约10000个训练集和4000个数据集进行工作。
  • 3、ReID1
    优质
    ReID标注数据集1是一个专为行人再识别研究设计的大型标注数据库,包含丰富多样的行人图像及其详细标注信息,旨在推动相关领域的算法开发与性能提升。 每个任务中有两个绿色的按钮:一个是“开始ReID标注”,点击该按钮会进入一个专门用于标注的页面。在这个新页面上方有一个工具栏区域,其中包含三个额外的功能按钮:“列出相近的ReID标注”。
  • 划分
    优质
    本文介绍了如何有效地将数据集划分成测试集、验证集和训练集,为机器学习模型提供科学的数据准备方法。 将数据集划分为测试集、验证集和训练集。
  • 无需
    优质
    本项目提出了一种创新方法,利用未标记的数据集进行行人检测模型的训练,旨在减少人工标注工作量的同时保持高精度识别能力。 用于行人检测的已标注数据集仅包含“person”一个类别,可以直接使用。
  • 中国交志CTSDB1
    优质
    中国交通标志CTSDB数据集训练集1包含了广泛的中国道路交通标志图像,旨在用于计算机视觉和机器学习研究中的模型训练与测试。 中国交通标志CTSDB数据集的训练集2包含800个选项,其中一半是txt文件,另一半是图片。
  • Py-Faster-RCNN划分(
    优质
    简介:本文介绍了如何对Py-Faster-RCNN项目中的数据集进行合理划分,包括训练集、验证集、训练验证集及测试集的分配方法与实践技巧。 将数据集划分为py-faster-rcnn所需的集合(训练集、验证集、训练验证集、测试集),并读取xml文件生成对应的txt文件。
  • LCQMC,涵盖
    优质
    LCQMC数据集是一款专为中文语境设计的机器阅读理解与问答任务的数据集合,包含全面的训练集、验证集及测试集,旨在促进自然语言处理技术的发展。 LCQMC数据集包含训练集、验证集和测试集问题语义匹配数据集,其目标是判断两个问题的语义是否相同。
  • 优质
    本文章主要探讨和分析在开发数字识别器过程中,如何有效利用测试集与训练集以提升模型精度及泛化能力的方法和技术。 MNIST(“修改后的国家标准与技术研究所”)是计算机视觉领域的事实上的“Hello World”数据集。自1999年发布以来,这个经典的 handwritten 图像数据集已经成为分类算法基准测试的基础。随着新的机器学习技术的出现,MNIST 仍然是研究者和学习者的可靠资源。