
Big Data - Hadoop - Yelp Dataset: 文件夹内含5个问题及PDF解析,涉及Yelp数据与相关问题...
5星
- 浏览量: 0
- 大小:None
- 文件类型:None
简介:
本资源包包括五个基于Yelp数据集的问题及其PDF解析文档,旨在帮助学习者通过Hadoop框架分析大数据。适合研究和实践使用。
大数据--Hadoop--Yelp数据集文件夹包含五个问题及相关描述的PDF文档。该数据集包括有关“用户”、“业务”和“评论”的有用统计信息。这些数据被存储在Hadoop HDFS中。
针对以下概念设计了Map Reduce Java程序:
1. 计数和筛选数据:计算实体的数量。
2. 过滤复杂数据:使用公司地址作为过滤条件列出公司ID。
3. 计算每个企业ID的平均评分,并列出前10名企业。
4. 减少侧加入和工作链:为每家企业计算平均评分,然后根据这些评级列出排名前十的企业及其相关数据。
5. Map Side Join:将所有业务实体加载到分布式缓存中。使用Map侧连接列出了位于特定区域中的企业的用户ID和评论文本。
全部评论 (0)
还没有任何评论哟~


