Advertisement

包含84168条新浪微博的数据集。

  •  5星
  •     浏览量: 0
  •     大小:None
  •      文件类型:None


简介:
包含84168条新浪微博数据,这些数据涵盖了2014年5月3日至2014年5月11日期间采集的约8万条微博信息,并围绕着12个不同的主题展开。该数据集共计包含63641个用户的详细记录,以SQL脚本形式呈现,方便直接导入到数据库中进行后续分析。此外,该数据集也与“话题聚类”这一研究领域密切相关。

全部评论 (0)

还没有任何评论哟~
客服
客服
  • 84168来自
    优质
    该数据集包含84168条新浪微博记录,旨在为研究社交媒体上的信息传播、用户行为及社会影响力分析提供真实可靠的数据支持。 这段文字描述了一组微博数据集,包含8万多条在2014年5月3日至2014年5月11日期间采集的信息,涵盖了12个主题的内容。这些数据涉及63,641名用户,并且存储在一个SQL脚本段落件中,可以直接导入数据库使用。
  • 84168
    优质
    该数据集包含84168条微博内容,旨在支持社交媒体分析、用户行为研究及自然语言处理等领域的学术与应用探索。 该数据集包含84168条新浪微博记录,在2014年5月3日至2014年5月11日期间采集的关于12个主题的微博信息,涉及63641名用户。文件格式为SQL脚本,可以直接导入数据库以进行话题聚类分析。
  • 消息合(197810).rar
    优质
    该文件为新浪微博消息的数据集,包含总计197,810条微博内容,可用于社交媒体分析、用户行为研究等领域。 新浪微博消息数据集(197810条).rar
  • 情感分析标注语料12万_
    优质
    本数据集包含来自新浪微博的12万条评论和评论片段,旨在提供一个全面的情感分析资源。每个样本都经过细致的手工标注,以反映用户在微博平台上的真实情绪表达。这一资源对于研究社交媒体情感分析具有重要价值。 本资源包含人工标记的微博语料,分为积极和消极两类文本,每类各60000条记录,适用于机器学习中的情感分析训练。
  • 情感分析标注12万记录
    优质
    本数据集包含12万条新浪微博的情感分析标注记录,旨在为研究者提供高质量、大规模的中文社交媒体情感分析训练资源。 本资源包含人工标记的微博语料数据集,包括60,000条消极内容(文件名为pos.txt)和60,000条积极内容(文件名为neg.txt),适用于机器学习情感分析训练。
  • 8万多
    优质
    这是一个庞大的微博数据集,包含了超过八万条用户原创的内容和评论,为社交媒体分析提供了宝贵的信息资源。 我们有8万多条微博数据,这些数据是在2014年5月3日至2014年5月11日期间收集的,涵盖了12个不同的主题。所有信息已整理为SQL脚本格式,方便直接导入数据库中使用。
  • 使用Python抓取爬虫
    优质
    本教程介绍如何利用Python编写代码来抓取新浪微博的数据,帮助用户掌握构建微博数据采集器的方法和技术。通过学习,读者能够创建一个实用的新浪微博爬虫工具。 本程序可以连续爬取一个或多个新浪微博用户的数据(例如胡歌、迪丽热巴、郭碧婷),并将结果保存到文件或数据库中。这些数据几乎涵盖了用户微博的所有信息,包括用户基本信息和微博内容两大类。由于详情较多,在此不再赘述,请参考获取的字段以了解具体内容。 如果仅需收集用户的个人信息,程序同样支持只爬取微博用户信息的功能设置实现这一需求。为了访问新浪微博的数据,您需要通过cookie来授权登录;具体如何获得所需的cookie会在后续说明中详细讲解。如果您不希望使用cookie,则可以选用免cookie版本,两者的主要功能基本一致。 此外,本程序还提供了多种数据保存方式:包括txt、csv(默认)、json(可选)等文件格式以及MySQL、MongoDB和SQLite数据库选项。同时支持下载微博中的图片及视频资源,具体如下: - 原创微博的原始图片 - 转发微博的原始图片 - 原创微博内的视频 - 转发微博内的视频 对于免cookie版本特有的功能: - 下载原创微博Live Photo中的视频。 - 下载转发微博Live Photo中的视频。
  • Python获取合.zip
    优质
    这是一个包含使用Python脚本从新浪微博收集的数据集的压缩文件。内含各类微博信息和用户数据,适用于社交网络分析与研究。 Python爬取的新浪微博数据集.zip
  • 语言消歧.zip
    优质
    该数据集为新浪微博文本设计,包含大量标注了用户、话题等实体类型及情感极性的微博示例,旨在推动中文社交媒体语言处理研究。 新浪微博的语义资料。
  • 情感分析标注12万记录
    优质
    本数据集包含12万条新浪微博的情感分析标注记录,旨在为研究者提供一个全面了解公众情绪变化及社交媒体影响的研究工具。 本资源包含人工标记的微博语料,分为积极和消极两类,每类各60000条记录。这些数据适用于机器学习中的情感分析训练。