Advertisement

ParlaMint:可比的国会语料库

  • 5星
  •     浏览量: 0
  •     大小:None
  •      文件类型:None


简介:
ParlaMint项目致力于收集和整理全球各国议会辩论的文本数据,并提供统一标注体系以促进跨国家的数据对比研究。 ParlaMint 是一个旨在为多个国家和地区创建具有语言注释的可比议会语料库的项目。这些语料库将按照通用模式进行编码。该项目的目标是提供开发中的 ParlaMint 语料库的模式和示例,以便执行编码验证,并且通过 GitHub 提供了一个报告问题的论坛。 每个国家和地区都有一个专门用于样本存储的目录,该目录最终应至少包含以下四个文件: - **ParlaMint-XX.xml**:代表“纯文本”样本的语料库根文件。 - **ParlaMint-XX_zzz.xml**:至少一个“纯文本”样本语料库组件文件。 - **ParlaMint-XX.ana.xml**:“带有语言注释”的样本段落本的语料库根文件,其中包含XIncludes引用的组件文件。 - **ParlaMint-XX_zzz.ana.xml**:至少一个具有语言注释的示例语料库组件文件。 请参考版本1中的相关目录(例如BG、HR、PL和SI)以查看具体的文件结构。

全部评论 (0)

还没有任何评论哟~
客服
客服
  • ParlaMint
    优质
    ParlaMint项目致力于收集和整理全球各国议会辩论的文本数据,并提供统一标注体系以促进跨国家的数据对比研究。 ParlaMint 是一个旨在为多个国家和地区创建具有语言注释的可比议会语料库的项目。这些语料库将按照通用模式进行编码。该项目的目标是提供开发中的 ParlaMint 语料库的模式和示例,以便执行编码验证,并且通过 GitHub 提供了一个报告问题的论坛。 每个国家和地区都有一个专门用于样本存储的目录,该目录最终应至少包含以下四个文件: - **ParlaMint-XX.xml**:代表“纯文本”样本的语料库根文件。 - **ParlaMint-XX_zzz.xml**:至少一个“纯文本”样本语料库组件文件。 - **ParlaMint-XX.ana.xml**:“带有语言注释”的样本段落本的语料库根文件,其中包含XIncludes引用的组件文件。 - **ParlaMint-XX_zzz.ana.xml**:至少一个具有语言注释的示例语料库组件文件。 请参考版本1中的相关目录(例如BG、HR、PL和SI)以查看具体的文件结构。
  • 本土FLOB
    优质
    FLOB(British English Corpus)是专门收录当代标准英国英语文本的高质量语料库,为语言研究和教学提供了宝贵的资源。 自由堡一罗博英国本族语语料库(FLOB)常常被用来与CLEC语料库进行对比分析研究。尽管它的例句数量不多,规模有待进一步扩大,但作为样本语料库已经足够使用了。
  • 当代(COCA)
    优质
    美国当代语料库(COCA)是涵盖口语、小说、新闻等领域的大型英语语言数据库,包含超过4.5亿单词的文本数据,为语言研究和教学提供强有力的支持。 COCA(美国当代语料库)是从美国人日常生活中接触到的所有文字信息中处理并提取出来的最高使用频率的单词表。
  • CLEC中学习者英
    优质
    CLEC中国学习者英语语料库是一个专门收集中国学生英语表达的数据集合,旨在研究和提升非母语背景下的英语教学与学习效果。 CLEC(中国学习者英语语料库)是一个专门针对中国英语学习者的大型语言资源,在英语教学与研究领域具有重要价值。该语料库包含了大量中国学生在不同情境下使用的英文文本,旨在帮助学者、教师及研究人员了解中国学生的语言特点、常见错误以及进步趋势。 首先,我们需要理解什么是语料库:它是收集和存储大量语言数据的电子数据库,这些数据可以是书面文本、口语对话或网络文本等。它们被用于语言学研究、机器学习、自然语言处理(NLP)及翻译等领域。在CLEC中,数据主要来自中国学生的作文、口语记录、电子邮件以及论坛讨论等多种来源,这使得研究更加全面且具有代表性。 该语料库的建立涉及以下几个关键知识点: 1. **语言特征分析**:通过对CLEC中的文本进行分析,可以揭示出中国学习者在词汇选择、语法结构及句式使用等方面的特有模式。例如常见的中式英语表达或对某些语法规则的误解和误用。 2. **错误分类与纠正**:语料库可以帮助识别最常见的错误类型,如动词时态、名词单复数以及介词搭配等,并为教材编写和教学策略提供依据。 3. **二语习得研究**:通过对比不同水平的学习者在CLEC中的表现,可以深入研究第二语言学习的过程及影响因素,例如母语干扰与学习策略等。 4. **教学资源开发**:教师可利用该语料库设计教学活动并评估学生进步。比如选取典型错误案例进行课堂讲解或使用真实情境的文本进行阅读和写作练习。 5. **自然语言处理应用**:在AI及NLP领域,CLEC可以用于训练模型以提高机器理解和生成中国学习者英语的能力,如智能批改系统、聊天机器人等。 6. **跨文化交际研究**:语料库包含了中国学生在不同社交场景下的英文交流情况,有助于理解文化差异如何影响语言使用,并对提升跨文化交际能力的教学提供指导意义。 7. **语料库构建技术**:CLEC的创建过程涉及数据采集、标注及清洗等多个步骤,这涉及到计算机科学、信息管理和统计学等多学科知识,是现代信息技术与语言学结合的典范。 总之,CLEC不仅是一个丰富的语言资源,也是跨学科研究的重要平台。它对提高英语教育质量、推动语言学理论发展和技术创新具有深远影响。
  • LOB
    优质
    LOB(London-Oslo/Bergen)语料库是英语语言研究的重要资源,汇集了20世纪70年代英国和挪威/ Bergen出版物的语言样本。 LOB语料库创建于20世纪70年代初,由英国兰卡斯特大学、挪威奥斯陆大学以及卑尔根大学的研究人员共同编纂而成。该语料库包含一百万词次的当代英国英语文本,并与美国英语进行对比研究,使用了TAGIT系统来统计建立换算几率矩阵以提高标注正确率。 LOB语料库中的文本来自1961年出版的作品,涵盖了十五种不同的文类。每篇文档约2000字(超过2000字的文档会在第一个句子边界处截断)。每个类别中包含的文档数量有所不同。关于这些文本的具体信息可以在LOB手册中找到。 该语料库是美国英语布朗语料库在英国英语方面的对应版本,两者都包含了同一年出版的文章,以便于对比分析两种语言变体之间的差异。
  • 现代英六万词
    优质
    《美国现代英语语料库六万词》是一部收录了当代美国英语中高频使用的约六万个词汇及其用法的工具书,为学习者和研究者提供详实的语言数据支持。 美国当代英语语料库(COCA)的频率为60000,适用于欧路、mdict等第三方词典。
  • CSTR VCTK内源下载
    优质
    简介:CSTR VCTK语料库是国内语音技术研究者和开发者常用的开源音讯资料库,提供多样化的英語語音数据,适用于文本到语音(TTS)系统的训练与测试。本页面提供该语料库的国内下载链接,方便研究人员获取资源。 CSTR VCTK语音克隆英语多说话人语料库工具包概述 这个CSTR VCTK语料库包含了109位以不同口音为母语的英语使用者的语音数据。每位演讲者要朗读大约400句句子,其中大部分是从报纸上挑选出来的,并且包括彩虹段落和一段旨在识别演讲者口音的启事段落。 这些报纸文本是在先驱时报集团(Herald & Times Group)许可下从格拉斯哥《先驱报》(The Herald)摘取的。每位演讲者阅读一组不同的报纸句子,每组句子都是通过贪婪算法选择的,该算法旨在最大限度地扩大上下文和语音覆盖范围。 彩虹段落和启事段落对所有演讲者都是一样的。关于这些文本的具体信息可以在国际英语方言档案(http://web.ku.edu/~idea/readings/rainbow.htm)中找到。启事段落与用于语音重音存档的段落相同,而有关语音口音档案的细节可以查阅相关文献。 所有的语音数据都是使用相同的录音设置记录的:一个全向头戴式麦克风(DPA 4035),采样频率为96kHz, 24位,在爱丁堡大学半暗室中。所有录音均转换为16位,基于STPK下采样至48 kHz,并手动端点。 该语料库的录制是为了构建基于hmm的文本-语音合成系统,特别是用于使用多个发言者训练的平均语音模型和说话人自适应技术来创建基于说话人自适应的语音合成系统。 此数据集是在开放数据共享署名许可(ODC-By) v1.0下授权使用的。 该语料库由Christophe Veaux(爱丁堡大学)、Junichi Yamagishi(爱丁堡大学)和克里斯汀•麦克唐纳共同创建,部分研究得到了EPSRC EP/I031022/1 (NST) 和EP/J002526/1 (CAF) 的资助。此外,还获得了来自RSE-NSFC的资助(61111130120)和JST CREST (uDialogue)的支持。
  • 接受性-数据集
    优质
    语言可接受性语料库-数据集包含大量经人工评判的语言结构实例,旨在研究人类语言使用的规范性和创造性,为自然语言处理和理论语言学提供宝贵资源。 《语言可接受性语料库》由纽约大学提供。该数据集包含以下文件:CoLA_original.zip、CoLA_test.tsv、CoLA_dev.tsv 和 CoLA_train.tsv。
  • COCA当代英20000词频表
    优质
    本资源提供美国COCA当代英语语料库中前20000高频词汇列表,涵盖口语、新闻等多领域用语,适合语言学习者掌握实用表达。 文件夹包括:COCA20000.pdf(PDF格式词频表);美国当代英语语料库20000词频表.xlsx(EXCEL格式,支持导入到单词软件)。
  • 布朗与LOB
    优质
    本简介探讨布朗语料库和LOB语料库,二者均为英语语言研究中的重要资源。尽管同为文本集合,但它们在构建目的、内容及应用范围上有所不同。 Brown语料库是世界上首个计算机可读的语料库,它收录了1961年美国英语出版物中的文本,共包含500篇文档,每篇文章约2000个单词,总共有大约100万单词。LOB语料库则是模仿Brown语料库的比例构建而成的一个英国英语语料库,其数据同样来源于1961年的英国英文出版物上的文本内容,也包括了500篇文档和总计约一百万个词的规模。值得注意的是,Brown语料库中的词汇带有词性标记信息;而LOB语料库则没有提供这样的标注信息。