Advertisement

使用PyTorch进行命名实体识别和信息抽取的Python代码(兼容中英文、LSTM与CRF等模型)及数据集.zip

  • 5星
  •     浏览量: 0
  •     大小:None
  •      文件类型:None


简介:
本资源提供了一个基于PyTorch框架实现的命名实体识别和信息抽取工具,支持中文和英文文本处理。该工具采用深度学习技术如LSTM和CRF,并附带相关训练数据集。 基于Pytorch的命名实体识别/信息抽取框架支持LSTM+CRF、Bert+CRF、RoBerta+CRF等多种模型,能够解决非嵌套命名实体识别问题,并且可以处理中英文的数据集。 ### 支持的模型: - LSTM + CRF - Transformer + CRF - Bert + CRF - AlBert + CRF - RoBerta + CRF - DistilBert + CRF #### 训练步骤: 1. 准备好训练数据后,通过终端运行命令 `python3 run.py` 来执行。 2. 评估:加载已训练好的模型,并使用验证集进行测试。输出文件保存在 `./dataset/${your_dataset}/output.txt` 目录下。 3. 预测:对未知标签的数据集进行预测并将其保存为文件,同样存放在 `./dataset/${your_dataset}/output.txt` 中。 注意需要根据实际情况修改config文件中的变量值。

全部评论 (0)

还没有任何评论哟~
客服
客服
  • 使PyTorchPythonLSTMCRF.zip
    优质
    本资源提供了一个基于PyTorch框架实现的命名实体识别和信息抽取工具,支持中文和英文文本处理。该工具采用深度学习技术如LSTM和CRF,并附带相关训练数据集。 基于Pytorch的命名实体识别/信息抽取框架支持LSTM+CRF、Bert+CRF、RoBerta+CRF等多种模型,能够解决非嵌套命名实体识别问题,并且可以处理中英文的数据集。 ### 支持的模型: - LSTM + CRF - Transformer + CRF - Bert + CRF - AlBert + CRF - RoBerta + CRF - DistilBert + CRF #### 训练步骤: 1. 准备好训练数据后,通过终端运行命令 `python3 run.py` 来执行。 2. 评估:加载已训练好的模型,并使用验证集进行测试。输出文件保存在 `./dataset/${your_dataset}/output.txt` 目录下。 3. 预测:对未知标签的数据集进行预测并将其保存为文件,同样存放在 `./dataset/${your_dataset}/output.txt` 中。 注意需要根据实际情况修改config文件中的变量值。
  • LSTM+CRF、BiLSTM+CRFLSTM CRF PyTorch
    优质
    本项目提供基于LSTM-CRF、BiLSTM-CRF模型的命名实体识别(NER)PyTorch实现,适合自然语言处理任务中的实体抽取。 需要提供可以直接运行的使用pytorch实现的LSTM+CRF、BiLSTM+CRF以及LSTM CRF进行命名实体识别的代码和数据。
  • BERT-BiLSTM-CRF(含Python).zip
    优质
    本资源提供基于BERT-BiLSTM-CRF架构的中文命名实体识别解决方案,包括详尽的Python实现代码、项目文档以及训练所需的数据集。 基于BERT-BiLSTM-CRF模型实现的中文命名实体识别项目是一个经过导师指导并认可通过的高分毕业设计作品,适用于计算机相关专业的毕设学生及需要实战练习的学习者,同样适合课程设计或期末大作业使用。该项目包含完整的Python源码和详细说明,并利用了CLUENER2020数据集进行训练与测试,所有代码均经过严格调试以确保其可运行性。
  • 使BERT-BiLSTM-CRF(含Python、项目
    优质
    本项目采用BERT-BiLSTM-CRF架构实现高效准确的中文命名实体识别,并提供详尽的Python代码、项目文档及训练数据,助力自然语言处理研究与应用。 基于BERT-BiLSTM-CRF模型实现中文命名实体识别的项目包含Python源码、详细的项目说明以及数据集,并且代码配有注释,适合新手理解使用。该项目是我个人精心制作的作品,在导师那里得到了高度认可。无论是毕业设计还是期末大作业和课程设计,这个资源都是获取高分的理想选择。下载后只需简单部署即可开始使用。 此模型结合了BERT的强大语言表示能力、BiLSTM的双向长短期记忆网络以及CRF条件随机场的优点来准确识别中文文本中的命名实体,非常适合自然语言处理任务中需要提取特定信息的应用场景。
  • 项目践——基于TensorFlowPyTorchBiLSTM+CRF
    优质
    本项目专注于利用TensorFlow和PyTorch框架实现BiLSTM结合CRF算法进行中文文本中的命名实体识别及实体提取,旨在提升模型在自然语言处理任务中的表现。 中文命名实体识别涉及实体抽取技术,可以使用TensorFlow或PyTorch框架结合BiLSTM+CRF模型进行处理。数据文件夹内包含三个开源的数据集:玻森数据、1998年人民日报标注数据以及MSRA微软亚洲研究院的开源数据。其中,玻森数据包含了六种不同的实体类型;而人民日报语料和MSRA通常只提取人名、地名及组织名称这三种类型的实体信息。首先运行文件夹内的Python脚本以处理这些原始数据集,并为后续模型训练做好准备。
  • PyTorch LSTM-CRF:
    优质
    本项目提供了一个基于PyTorch框架实现的LSTM-CRF模型,用于执行高效的命名实体识别任务。代码简洁易懂,适合自然语言处理研究者和开发人员参考学习。 该存储库实现了用于命名实体识别的LSTM-CRF模型。此模型与另一模型相似,只是我们省略了BiLSTM之后的最后一个tanh层。我们在CoNLL-2003和OntoNotes 5.0英文数据集上均达到了最先进的性能(请通过使用Glove和ELMo来检查我们的结果,并通过对BERT进行微调以查看其他人的结果)。此外,我们实现了允许O(log N)推断和回溯的模块。 以下是模型在不同情况下的表现: - 基于BERT的情况 + CRF:在CONLL-2003数据集上的精确度为91.69%,召回率为92.05%,F1分数为91.87%;在OntoNotes 5.0数据集上,精确度为89.57%,召回率89.45% - Roberta-base + CRF:在CONLL-2003数据集上的精确度为91.88%,召回率为93.01%,F1分数为92.44%
  • CRF
    优质
    CRF命名实体识别模型是一种利用条件随机场算法进行自然语言处理中命名实体抽取的有效方法,广泛应用于文本挖掘与信息提取领域。 NER技术能够实现命名实体识别,可以从中找出人名、地名、年份以及组织机构名称等信息。
  • 基于PyTorchBiLSTM-CRF
    优质
    本研究利用PyTorch框架开发了一种基于BiLSTM-CRF模型的系统,专门针对中文文本进行高效的命名实体识别,提升了对复杂句子结构的理解能力。 基于PyTorch+BiLSTM_CRF的中文命名实体识别 文件结构说明: - checkpoints:模型保存的位置 - data:数据位置 - |-- cnews:数据集名称 - | |-- raw_data:原始数据存储位置 - | `-- final_data:标签、词汇表等信息存储位置 - logs:日志存储位置 - utils:辅助函数存放位置,包括解码、评价指标设置、随机种子设定和日志配置等功能 文件列表: - config.py:配置文件 - dataset.py:数据转换为PyTorch的DataSet格式 - main.py:主运行程序 - main.sh:运行命令脚本 - models.py:模型定义 - process.py:预处理,包括数据处理并转换成DataSet格式 运行命令示例: ``` python main.py --data_dir=data/cnews/final_data --log_dir=logs --output_dir=checkpoints --num_tags=33 --seed=123 --gpu_ids=0 --max_seq_len=128 ```
  • 基于CRF训练
    优质
    本项目提供了一套基于条件随机场(CRF)模型的中文命名实体识别系统及相关训练数据集,旨在促进自然语言处理领域的研究与应用。 中文命名实体识别基于条件随机场(Conditional Random Field, CRF)的NER模型 数据集使用的是ACL 2018论文《Chinese NER using Lattice LSTM》中收集的简历数据,数据格式如下:每一行由一个字及其对应的标注组成,采用BIOES标注体系。句子之间用空行隔开。 ``` 美 B-LOC国 E-LOC的 O华 B-PER莱 I-PER士 E-PER我 O跟 O他 O谈 O笑 O风 O生 O ``` 该数据集位于项目目录下的`data`文件夹里。 运行结果的具体输出可以查看`output.txt`文件。在评估模型时,会打印出精确率、召回率、F1分数值以及混淆矩阵等信息。 环境配置方面,请先安装依赖项: ```shell pip3 install -r requirement.txt ``` 完成之后,可以通过以下命令训练和测试模型: ```shell python3 main.py > output.txt ```
  • 基于PyTorchBERT-BiLSTM-CRF
    优质
    本研究利用PyTorch框架开发了一种结合BERT、BiLSTM和CRF模型的系统,专门针对中文文本进行高效的命名实体识别,提升了实体边界检测与分类精度。 依赖:python==3.6(可选)、pytorch==1.6.0(可选)、pytorch-crf==0.7.2、transformers==4.5.0、numpy==1.22.4、packaging==21.3 温馨提示:新增了转换为onnx并进行推理的功能,具体内容在convert_onnx下,使用命令python convert_onnx.py执行。仅支持对单条数据的推理。在CPU环境下,原本的推理时间为0.714256477355957秒,转换后为0.4593505859375秒。需要安装onnxruntime和onnx库。 注意:原本的pytorch-crf不能转换为onnx,在这里使用了替代方案。目前只测试了bert_crf模型,其他模型可根据需求自行调整。 问题汇总: ValueError: setting an array element with a sequence. The requested array has an inhomogeneous shape after 1 dimensions. 解决方法:pip install numpy==1.22.4 packaging.ver