Advertisement

Transformer_STR:我为STR设计的新Transformer场景文本识别方法及其PyTorch实现

  • 5星
  •     浏览量: 0
  •     大小:None
  •      文件类型:ZIP


简介:
本文介绍了一种新的基于Transformer的场景文本识别方法(Transformer_STR),并提供了该模型的PyTorch实现代码。 我提出了一种基于场景文本识别(STR)的新方法的PyTorch实现。 我对设计的四阶段STR框架进行了改编,并用Transformer替换了其中的Pred.部分。 配备了Transformer后,该方法在CUTE80数据集上优于现有的深层文本识别基准模型7.6%。 要使用预训练权重,请先克隆此仓库并下载权重文件,然后将其移至checkpoints目录。这些预训练权重是在Synthetic数据集上经过大约700K次迭代后得到的。 为了进行训练和评估,需要从相关资源处获取lmdb格式的数据集。 data_lmdb_release.zip包含以下内容:训练数据来自特定来源;验证数据由多个源提供的集合组成;评估数据则包括基准评估所需的所有必要文件。

全部评论 (0)

还没有任何评论哟~
客服
客服
  • Transformer_STRSTRTransformerPyTorch
    优质
    本文介绍了一种新的基于Transformer的场景文本识别方法(Transformer_STR),并提供了该模型的PyTorch实现代码。 我提出了一种基于场景文本识别(STR)的新方法的PyTorch实现。 我对设计的四阶段STR框架进行了改编,并用Transformer替换了其中的Pred.部分。 配备了Transformer后,该方法在CUTE80数据集上优于现有的深层文本识别基准模型7.6%。 要使用预训练权重,请先克隆此仓库并下载权重文件,然后将其移至checkpoints目录。这些预训练权重是在Synthetic数据集上经过大约700K次迭代后得到的。 为了进行训练和评估,需要从相关资源处获取lmdb格式的数据集。 data_lmdb_release.zip包含以下内容:训练数据来自特定来源;验证数据由多个源提供的集合组成;评估数据则包括基准评估所需的所有必要文件。
  • 2020年《》综述更
    优质
    本论文为2020年发布的关于《场景文本识别》领域的综述文章的最新更新版本,全面总结了近年来该领域的重要进展与研究成果。 自然场景中的文本识别(scene text recognition, STR)是计算机视觉和模式识别领域的研究热点。最近,华南理工的学者发布了一篇关于STR的综述论文,总结了STR的基本问题及最先进的技术,并介绍了新的见解和想法,展望未来趋势以全面展示STR的发展方向。
  • 基于词袋模型代码 Scene_Recognition_with_Bag_of_Words
    优质
    本项目采用词袋模型进行场景识别,通过提取图像特征并将其转化为词汇表中的词语,进而统计各词语出现频率以构建图像的向量表示,并利用支持向量机分类器完成最终场景分类。代码开源可供研究参考。 基于词袋模型的场景识别配套代码包括素材、代码以及实验结果。详细实验过程请参见本人博客《计算机视觉项目实战三-基于词袋模型的场景识别》。
  • 关于章综述
    优质
    本文综述了场景文本识别领域的研究进展,涵盖了关键技术、挑战及未来方向,为该领域学者提供全面参考。 这个PPT提供了关于场景文本识别(STR)领域的研究进展的综述。以下是PPT内容的总结: 字符矫正:论文《MORAN: A Multi-Object Rectified Attention Network for Scene Text Recognition》介绍了一种多对象矫正注意力网络,能够将旋转或扭曲的文本图像矫正成正常状态。 字符定位:论文《Scene Text Recognition from Two-Dimensional Perspective》提出了一种基于字符注意力模块和可变形卷积的网络,用于提高对字符扭曲和旋转的适应性。 数据增强:论文《Learn to Augment: Joint Data Augmentation and Network Optimization for Text Recognition》提出了一种可训练的数据增强方法,该方法能够朝着网络更难识别的方向进行增强。
  • Point-Transformer-Pytorch:基于PytorchPoint Transformer
    优质
    Point-Transformer-Pytorch是一款基于PyTorch框架开发的库,专注于实现点云数据处理中的Point Transformer层。此项目为研究人员和开发者提供了一个高效、灵活且易于使用的工具来探索与应用最新的深度学习技术于三维空间理解任务中。 在Pytorch中实现点变压器-火炬的自注意层可以显著提升点云分类和分割的效果。安装该库使用命令`pip install point-transformer-pytorch`。 导入所需的模块: ```python import torch from point_transformer_pytorch import PointTransformerLayer ``` 定义并初始化PointTransformerLayer,例如设置维度为128、位置MLP隐藏层维数为64以及注意力MLP的隐藏倍率为4。然后生成随机特征和位置数据,并创建一个掩码。 ```python attn = PointTransformerLayer(dim=128, pos_mlp_hidden_dim=64, attn_mlp_hidden_mult=4) feats = torch.randn(1, 16, 128) pos = torch.randn(1, 16, 3) mask = torch.ones(1, 16).bool() ```
  • CUTE80 OCRLMDB数据集
    优质
    CUTE80 OCR场景文本识别的LMDB数据集包含多种自然图像中的英文文本样本,旨在提升复杂背景下的文字识别精度与效率。 LMDB格式的CUTE80资源包含288张非常倾斜扭曲的高难度图像。关于如何使用这些资源,请参考相关博客文章中的详细介绍。
  • 利用PytorchBERT-IDCNN-BILSTM-CRF中
    优质
    本研究采用PyTorch框架,结合BERT、IDCNN和BiLSTM-CRF模型,提出了一种高效的中文实体识别方法,显著提升了命名实体识别的精度与效率。 基于Pytorch的BERT-IDCNN-BILSTM-CRF中文实体识别模型训练步骤如下: 1. 下载预训练好的pytorch_model.bin文件到data/bert目录。 2. 将训练集和测试集下载至data/目录中。 3. 检查配置constants.py文件中的设置是否正确。 4. 使用命令`python train.py`执行train.py脚本来进行模型的训练。 对于已有的BERT_IDCNN_LSTM_CRF模型,如果存在的话,请将其下载到data/model目录。然后按照上述步骤检查配置后,可以使用以下方法运行系统: - 单次运行:通过执行Wrapper.py脚本,并输入命令如`Wrapper.py 新华网1950年10月1日电(中央人民广播电台记者刘振英、新华社记者张宿堂)中国科学院成立了。`来进行。 - 多次运行:使用ChineseNer.sh脚本,其执行指令为`./ChineseNer.sh`。 系统依赖环境如下: - python >= 3.5 - torch = 0.4.0 - pytorch-pretrained-bert - tqdm - numpy
  • ICDAR2015 OCRLMDB格式数据集
    优质
    本数据集为ICDAR2015竞赛中场景文本识别任务提供的训练及测试图像,采用LMDB格式存储,适用于OCR技术研发与模型训练。 关于Imdb格式的ICDAR2015数据集的相关制作、使用代码可以在相关博客文章中找到。