Advertisement

手动采集天天基金网和东方财富网的数据,并运用LDA模型对基民评论、重仓股票及市场行情进行分析

  • 5星
  •     浏览量: 0
  •     大小:None
  •      文件类型:None


简介:
本项目通过手动从天天基金网和东方财富网收集数据,利用LDA主题模型深入分析投资者评论、基金重仓股以及市场动态,旨在揭示投资偏好与市场趋势之间的关联。 这是一个基金评论与股票市场的情感分析项目,目的是手动爬取天天基金网基民的评论以及东方财富网股市行情的信息,并从基民评论、重仓股票、市场行情三个方面进行情感词典和LDA模型分析,从而判断是否值得购买基金。带有“clean”标签的数据是经过清洗后的爬虫数据,没有带标签的是原始数据或某个分析后的结果。“基于情感词典与LDA模型的基金文本研究.ipynb”中包含了具体的工作代码,并使用了Python 的Jupyter Notebook进行开发。

全部评论 (0)

还没有任何评论哟~
客服
客服
  • LDA
    优质
    本项目通过手动从天天基金网和东方财富网收集数据,利用LDA主题模型深入分析投资者评论、基金重仓股以及市场动态,旨在揭示投资偏好与市场趋势之间的关联。 这是一个基金评论与股票市场的情感分析项目,目的是手动爬取天天基金网基民的评论以及东方财富网股市行情的信息,并从基民评论、重仓股票、市场行情三个方面进行情感词典和LDA模型分析,从而判断是否值得购买基金。带有“clean”标签的数据是经过清洗后的爬虫数据,没有带标签的是原始数据或某个分析后的结果。“基于情感词典与LDA模型的基金文本研究.ipynb”中包含了具体的工作代码,并使用了Python 的Jupyter Notebook进行开发。
  • 构建NLP训练
    优质
    本数据集汇集了东方财富网股吧中关于各股票的大量用户评论,旨在通过自然语言处理技术进行情感分析与舆情指数构建,为投资者提供决策参考。 这段文字描述了从东方财富网平安银行股吧爬取的评论数据集。该数据集包含71888条记录,每条评论包括发言者(author)、发言者的影响力(power)、发言者的吧龄(age),以及阅读量、评论量和帖子内容等信息。这些数据可用于构建词典、舆情指数或训练自然语言处理模型。
  • 优质
    东方财富股吧是投资者交流的重要平台,该评论数据涵盖了用户对股票、市场动态的看法和分析,为研究股市情绪提供了宝贵的资料。 这是从东方财富网平安银行股吧爬取的评论数据,包括发言人的姓名(author)、影响力(power)、在该板块的活跃时间(age),以及阅读量、评论量和帖子内容。这些信息可以用于构建词典或舆情指数,并且可用于训练NLP模型。
  • 优质
    东方财富股吧评论数据提供了广大投资者对于股票、财经新闻等话题的观点与分析,是研究市场情绪和投资决策的重要参考来源。 这段文字描述了从东方财富网平安银行股吧爬取的评论数据,包括发言人的名称(author)、影响力评分(power)、在该论坛上的活跃时间(age)以及阅读量和评论量等信息。这些数据可以用于构建词典或舆情指数,并且能够训练NLP模型。
  • 旗下吧抓取指定当日存入MySQL库后...
    优质
    本项目旨在开发一个系统,用于自动从东方财富网特定股票板块抓取实时用户评论,并将这些数据整理后存储至MySQL数据库中,便于后续分析和研究。 项目主要使用第三方库snownlp、tushare、pandas、numpy和matplotlib来实现从东方财富网旗下的股吧论坛爬取数据,并进行量化分析以评估情绪指数与股票价格涨幅的相关性。 功能概述: 1. 通过传入某只股票代码(例如“zssh000001”代表上证指数),函数`data(share_code)`将计算并返回该股票当天的情绪指数。 2. 情绪指数的生成基于对股吧论坛中用户评论的情感分析,随后数据被存储在云端数据库内以便进一步分析和可视化操作。 执行流程: - 输入目标股票代码 - 清除前一天的数据以确保准确性 - 爬取东方财富网当天关于该股票的所有股民评论,并进行必要的清洗与过滤处理后存入MySQL数据库中。 - 利用金融情感计算模型对这些文本数据进行分析,量化出积极和消极情绪因子(分别记为pos和neg)。 - 计算市场总体的情绪得分(score),公式设计旨在捕捉市场的整体倾向性以及评论数量的影响。 具体算法实现: 采用snownlp库来进行中文自然语言处理任务。根据给定的规则判定评论的情感方向,并通过特定方式计算出积极或消极情绪因子值,最终结合当日总评论数来得出一个综合反映市场情绪波动程度和方向的情绪指数。 项目特别关注于如何利用现有资源(如开源工具)快速而准确地量化金融市场中的非结构化数据——即用户生成的内容。这种分析为投资者提供了一种新颖的方式去理解市场动态,并可能帮助发现价格变动背后的驱动因素之一:公众情感变化对股票的影响。
  • Python 下载期货代码
    优质
    本段代码展示了如何使用Python语言从东方财富网下载期货市场的实时行情数据,适合对量化交易和金融数据分析感兴趣的开发者。 以下是关于使用Python从东方财富网下载内外盘期货数据的代码描述:该代码能够将5分钟K线数据(大约30天以内)及日线级别数据(自上市以来的所有数据)下载并保存为CSV文件,以便后续调用。
  • Python Scrapy框架下爬虫代码
    优质
    本简介提供了一个基于Python Scrapy框架开发的数据抓取程序示例,专门用于从东方财富网提取股票相关评论信息。此项目有助于研究者和开发者高效获取并分析在线用户对各类股票的看法与评价,从而为投资决策提供参考依据。 批量爬取股票评论文本数据,包含大量情感分析所需的数据,以便进行深入研究。
  • 使Python爬虫从获取存入MySQL
    优质
    本项目利用Python编写爬虫程序,自动从东方财富网收集股票信息,并将其存储至MySQL数据库中,便于后续的数据分析与处理。 Python爬虫抓取东方财富网股票数据并实现MySQL数据库存储的方法具有很高的参考价值。
  • Java笔试题-STOCK_PRICE_FINBERT:利Finbert中文以预测价上涨
    优质
    本项目旨在通过运用FinBert模型解析东方财富网上的股票评论数据,进行情感倾向性分析,并据此预判股价变动趋势。 东方财富的Java笔试题STOCK_PRICE_FINBERT以guba评论为初始语料,利用Finbert模型分析中文评论的情感极性,并预测股价上涨趋势。该项目主要由爬虫、Finbert模型以及假设检验三部分组成。 在项目中,我们使用了Xpath和Json技术,在东方财富网的股票吧论坛上抓取了20万条评论作为数据集。针对这些数据,我们的Finbert模型支持逐层解冻和梯度累积,并且每个训练周期都会对数据进行随机分割。这种处理方式不仅增加了模型训练过程中的随机性、降低了过拟合的风险,还能在一定程度上缓解小样本问题的影响。 此外,我们还封装了BERT模型以方便后续的扩展工作,并为Finbert赋予了Sklearn接口。假设检验被用来评估一定时期内评论极性和股票收益之间的相关程度。 项目中遇到的一个主要挑战是社会评论话题分散且包含大量脏数据,这严重影响了模型的表现和准确性。
  • Bert(含源码
    优质
    本项目采用BERT模型对京东商品评论进行情感分析,旨在提供一种基于深度学习的情感分类方法。项目包含详细源代码和数据集,便于研究与实践。 基于预训练模型Bert进行微调实现京东评论的情感分析,其中包括数据预处理步骤以及算法的具体实施细节。