Advertisement

已划分的互联网评论数据集

  • 5星
  •     浏览量: 0
  •     大小:None
  •      文件类型:None


简介:
本数据集包含大量经过分类和标注的互联网用户评论,旨在为研究者提供一个全面了解公众观点与态度的资源库。 适用于中文长文本分类的原始数据集已经进行了划分,并且经过了预处理步骤,包括删除重复文本以及长度小于50字的句子。最终构建了一个平衡语料库:训练集包含5800条记录,测试集有1000条记录,验证集也有1000条记录(正负评论各占一半)。

全部评论 (0)

还没有任何评论哟~
客服
客服
  • 优质
    本数据集包含大量经过分类和标注的互联网用户评论,旨在为研究者提供一个全面了解公众观点与态度的资源库。 适用于中文长文本分类的原始数据集已经进行了划分,并且经过了预处理步骤,包括删除重复文本以及长度小于50字的句子。最终构建了一个平衡语料库:训练集包含5800条记录,测试集有1000条记录,验证集也有1000条记录(正负评论各占一半)。
  • DataFountain 新闻情感
    优质
    DataFountain互联网新闻情感数据分析集提供丰富的互联网新闻数据,涵盖广泛的主题与情感维度,旨在促进文本挖掘、自然语言处理及情感分析领域的研究与应用。 随着社交平台的兴起,网络用户生成的内容越来越多,产生了大量的文本数据,如新闻、微博、博客等。面对这些庞大且包含丰富情绪表达的信息,我们可以探索其潜在价值并为人们提供服务。因此,在近年来计算机语言学领域中,情感分析成为一项重要的热点研究任务,并受到了广泛的关注。
  • 站视频短-
    优质
    该数据集包含某知名评分网站上关于影视作品的大量视频短评信息,涵盖用户对电影、电视剧等各类节目的评论与打分,为研究网络评价模式和用户偏好提供丰富资源。 某评分网站视频短评的数据集包括comment_30128916.csv 和 data_clean.xlsx。
  • 训练与测试岩石
    优质
    这是一个包含已区分训练和测试样本的岩石相关属性的数据集合,适用于机器学习模型的训练与评估。 数据集格式:jpg图片 标注类别数:6 使用标注工具:labelImg 标注规则:对每个类别画矩形框进行标注 特别声明:本数据集不对训练的模型或者权重文件精度作任何保证,仅提供准确且合理的标注。
  • TapTap游戏
    优质
    本研究利用TapTap平台的游戏评论数据,深入剖析玩家反馈与游戏特性之间的关联,旨在为开发者提供优化产品和增强用户体验的有效策略。 数据集介绍 手机游戏市场如今在中国非常庞大。监督客户的评论是预测游戏商业潜力的主要方式。 本数据集包含了手游网站 TapTap 上约 300 款游戏中用户标签评论的文本,共有4888个样本用于情感分析的应用。 该数据集中,用户的评价根据评分标准进行分类:评分为低于3星(满分为5星)的评论被标记为“不满意”,用数字0表示;而高于或等于3星的则被视为满意,并以1来标识。这两个类别的比例大致相等。 此数据集主要用于中文自然语言处理技术的应用研究,例如当一个新游戏发布时,在微博、游戏论坛和贴吧等地关于该游戏的讨论可以被收集并分析。创建特定模型用于自动化识别玩家讨论趋势的过程将有助于企业做出更明智的决策。 每个样本的数据包括: - review:用户评论文本 - sentiment:0代表不满意,1代表满意
  • CCPD2020并完成标注)
    优质
    CCPD2020数据集是一套经过细致划分和标注的车辆牌照识别数据集合,专为提升车牌检测与识别技术精度而设计。 CCPD2020数据集包含以下内容: 1. det_datasets:包括“train”、“val”、“test”的数据及其对应的det_label。 2. rec_datasets:对车牌图片进行了切分,并将标注信息写在了rec_label中。 此外,还提供了划分数据集所需的代码。使用方法是调整好路径环境后运行.py文件即可得到完整的划分和标注信息。拿到该数据集后,只需修改txt文件中的路径信息就可以直接使用其中的标注和图片。如果需要扩展数据集,则按照文档提供的格式进行补充添加即可。 数据集结构如下: ``` datasets: |----label |--------test |------------crop_imgs |--------train |------------crop_imgs |--------val |------------crop_imgs |--test |--train |--val |--unzip_ccpd2020.py ```
  • 训练与测试野生菌
    优质
    本数据集包含多样化的野生菌样本信息,已经过严格处理并划分为独立的训练和测试子集,便于机器学习模型的开发与验证。 数据集格式:jpg图片 标注类别数:9 使用标注工具:labelImg 标注规则:对每个类别画矩形框 重要说明:暂无特别事项需要声明 特别声明:本数据集不对训练的模型或者权重文件精度作任何保证,仅提供准确且合理的标注。
  • 中文情感
    优质
    本数据集包含大量针对各类中文文本资料(如电影、产品等)的用户评论及其对应情感标签,旨在支持自然语言处理中情感分析的研究与应用。 谭松波的中文评论情感分析结果为:1表示正向情感,0表示负向情感。
  • 关于情感
    优质
    此数据集包含丰富多样的用户评论文本及其相应情感标签,旨在为研究者提供资源以分析和理解公众情绪及偏好。 这个数据集采用xls格式,包含了评论的情感分析内容。尽管规模较小,但它非常适合用来验证模型和进行实验。