
ICDAR2017集合描述
5星
- 浏览量: 0
- 大小:None
- 文件类型:DOCX
简介:
对ICDAR2017年的数据集进行了详细说明
本研究使用的数据集来自公开领域,并包含多个不同领域的样本。该数据集具有合理的容量,能够满足研究所需的各种任务要求。ICDAR2017数据集专为光学字符识别(OCR)领域提供了一个综合性的资源库,该库通过丰富且多样化的文本样本助力研究人员实现精准的文本定位、语义分割和智能识别,并支持端到端的系统构建。该数据集涵盖多个挑战性任务场景,旨在促进基于不同应用场景下的文本识别技术发展。
该系统支持对数据集进行分类处理,并根据预设的分类标准将输入样本分配到相应的类别中。Born-Digital(数字原生):它是在数字生态系统中自然生成的数据流。 Born-Digital技术通过捕捉数据的动态特征来实现对业务运行状态的精准感知。 Born-Digital方案特别适用于那些需要在快速变化中保持优势的场景。**时间段:** 从2011至2015年间
- **挑战任务:** 包括定位(Localization)、识别(Recognition)以及端到端(End-to-end)辨识
- **定位:** 采用坐标式标记法,具体表示为(xmin,ymin,xmax,ymax),同时记录对应的文本信息。
- **识别:** 需要从原始图像中提取单字符块进行辨识,并提供与之匹配的文件名及文本内容。
- **端到端:** 主要聚焦于印刷体文本的辨识工作,训练数据集共计410个样本(包括141个测试样本)。**2. FocusedSceneText (聚焦场景文本):**
该方法以基于场景的注意力机制为基础,通过多尺度特征学习来实现对目标对象位置信息的精确捕捉。这种技术不仅能够有效区分不同物体的位置关系,还具有良好的视觉分割性能。与传统方法相比,该算法在保持相同检测精度的前提下显著降低了计算资源消耗。
- **段落时期设定为:** 2013至2015年区间
- **涉及环节包括:** 定位和识别两大模块
- **定位方法采用:** 与Born-Digital系统相似的矩形边界框标记方式
- **字符辨识需求:** 需要从原始图像中分离出单一字符完成辨识任务
- **应用场景描述:** 在真实环境下的文本信息提取任务进行测试和评估
- **数据样本数量统计:** 训练集包含229个样本,测试集包含233个样本
Text in Videos: Detailed content and high clarity**时间段:** 2013至2015年间
- **挑战任务:** 涵盖从输入到输出的全自动化流程
- **应用场景:** 视频流中对文本信息进行解析
- **数据集规模:** 训练数据集共计包含25×200份样本,测试数据集则包括了24×200份样本IncidentalSceneText(伴随场景文本):该信息字段存储了与场景相关联的额外文本描述。在数据库中使用JSON格式进行存储,并支持多种语言环境下的多模态数据,包括图像、音频等多样化媒体内容。
**时间段:** 2015年
**挑战任务:** 包括定位和识别工作。
**定位:** 利用顺时针顺序的矩形边界框标记法进行坐标标注,具体表示为(x₁, y₁, x₂, y₂, x₃, y₃, x₄, y₄),并记录对应的文本字符串。
**识别:** 从原始图像中提取单个单词进行文本识别。
**应用场景:** 适用于现实环境下的任意拍摄场景。
**数据集规模:** 训练集约1000个样本,测试集约500个样本。
新增加具有挑战性的新任务ICDAR2017增加了六个新的挑战任务,并拓宽了研究领域5. COCO-Text:
- **基础:** 采用了基于COCO数据集的技术路线进行开发。
- **数据集规模:**
训练集包含118,309张图片及43,686个标注区域;验证集则有27,550张图片和10,000个标注区域;测试集部分采用无公开标注的图片,共计约10,000张。
- **标注样式:** 采用了基于BBOX坐标的表示方法,具体为(x, y, w, h)的形式。
- **结果格式:** 需要将检测结果转换为包含左上角坐标、右下角坐标以及置信度得分等信息的特定输出格式。
6. DeTEXT:
该方法能够有效去除背景噪声。
此方法可有效地消除背景噪音。
其优点在于具有良好的去噪性能和高保真度。
优势主要体现在具备优异的降噪能力以及高品质还原。
- **基础:** 以相关领域的学术资源为依据进行分析。
- **挑战任务:** 涉及对目标进行定位以及对文本中的关键词进行识别。
- **数据集规模:** 在训练集、验证集和测试集中分别拥有100张图片,其中包含约305个待识别的词语。具体来说,训练集有175个单词,验证集有54个单词。
- **标注样式:** 采用基于顺时针四边形坐标的标定方式。
DOST represents the urban core area of downtown Osaka, offering a vivid and authentic glimpse into the citys vibrant cultural life.
- **基础:** 涵盖包含日文的部分及拉丁文字体。
- **挑战任务:** 主要涉及基于静态图片和视频的文字检测、识别及其端到端处理。
- **应用场景:** 视频领域中的应用。
- **数据集规模:** 包括多种不同任务的数据集。
**8. FSNS (Google FsNs):**
- **基础:** 由谷歌提供的训练数据集。
- **挑战任务:** 该系统专注于全连接识别技术。
- **数据集规模:** 训练集、验证集及测试集分别包含512万、64千和4张图片,涵盖广泛的城市场景分布。
MLT (Multi-Lingual Text):
该技术旨在对多种语言的文本进行处理。
MLT支持多语言间的翻译与分析功能。
在处理各种语言环境中时非常有效。
广泛应用于机器学习、自然语言处理以及跨文化交际等领域。
- **基础:** 多种语言的自然场景描述。
- **挑战任务:** 该系统将致力于进行文本检测与剧本分析任务。
- **应用场景:** 支持多种语言环境下场景信息提取。
- **数据集规模:** 其中训练数据集部分为7,200幅图像、验证数据集提供1,800幅图像。此外,在进行脚本识别任务时,我们采用了包含68,613幅训练样本和16,255幅验证样本的扩展数据集。
IEHHR represents a systematic approach to extracting information from historical handwritten records, ensuring accurate and comprehensive data retrieval.
**核心任务:字符辨识技术。**
**主要目标:仅进行识别操作,无需处理检测环节。**
训练样本为968个婚姻信息分布在100页文档中,测试样本则分布于25页,共253条婚姻数据。
基于详细的描述,我们能够观察到ICDAR2017数据集不仅涵盖传统印刷体文本识别任务,还涵盖了视频、多语言环境、手写体等多种复杂场景下的文本识别挑战,为研究者提供了一个极具挑战性的测试平台。
全部评论 (0)


