
古文伯特:GUWENBERT
5星
- 浏览量: 0
- 大小:None
- 文件类型:None
简介:
GUWENBERT,又名古文伯特,是一个融合了古典文学与现代创意的独特品牌或项目名称。它旨在探索并重新诠释古老文字和文献中的智慧与美学,为当代世界注入传统文化的韵味与灵感。
GuwenBERT 是一个基于大量古文语料的 RoBERTa 模型,在自然语言处理领域中,预训练语言模型已成为非常重要的基础技术。结合古文研究与自然语言处理,我们发布了专门用于古代文献的预训练模型 GuwenBERT 。对于常见的古文任务如断句、标点和专有名词标注等,通常采用序列标注模型来完成。这类模型往往依赖于高质量的预训练词向量或 BERT 模型的支持,因此一个好的语言模型可以显著提升这些任务的表现效果。
通过实验发现,在 RoBERTa 基础上进行改进后,GuwenBERT 的性能提高了 6.3%,并且只需经过 300 步迭代即可达到中文 RoBERTa 的最终水平。这使得它特别适合用于那些语料数据较少的小规模项目中。使用 GuwenBERT 模型还可以减少数据清洗、数据增强和字符字典等繁琐的步骤,在评测过程中,我们仅通过一个 BERT + CRF 结构模型就达到了第二名的成绩。
GuwenBERT 是基于殆知阁古代文献语料库进行训练而成,该语料库包含 15,694 部古文书籍,字符总数为 1.70 亿。所有繁体字均已转换成简体形式以方便使用。
全部评论 (0)
还没有任何评论哟~


