
大数据技术基础与实践.docx
5星
- 浏览量: 0
- 大小:None
- 文件类型:DOCX
简介:
大数据技术是信息技术领域的重要组成部分,它主要涉及如何高效处理海量数据,并从中提取有价值的信息以支持决策。以下是一些关键知识点:
1. 数据产生方式经历了三个阶段:数据流阶段、运营式系统阶段以及用户原创内容阶段。
2. 第三次信息化浪潮的标志是物联网、云计算和大数据技术的普及。
3. 1TB等于2^20MB,即1,048,576MB。
4. Hadoop的核心组件包括HDFS(分布式文件存储)和HBase(关系型数据库)。
5. HDFS默认的一个块大小是8KB。
6. 数据节点负责数据的存储和读取操作。
7. 上传本地file.txt到HDFS路径下的Shell命令是hdfs dfs -put file.txt path。
8. 创建文件夹test以及其中dir目录的正确命令是 hadoop fs -mkdir -p testdir 或 hdfs fs -mkdir -p testdir(后者更常用)。
9. HBase是一种高可靠性和高性能的图数据库,基于NoSQL架构,支持对HBase表设置任意列作为索引。
10. 插入一条记录到student表中,格式为:put student,2015001,score:math,88(其中id是行键)。
11. NoSQL数据库的三大理论基石包括CAP定理和最终一致性,而不包括ACID特性。
12. 对于文本hello bigdata hello hadoop经过map函数处理后的输出结果为特定值。
13. 已配置PATH环境变量时启动Hadoop的命令是start-dfs.sh(或其他相关脚本)。
14. 下列说法错误的是:HDFS HA解决了单点故障问题。
数据生成方式经历了三个主要的演进阶段:首先是基于传统企业信息系统的企业级系统(如运营式系统阶段),其次是用户原创内容平台(如社交媒体内容)以及感知式系统阶段(如物联网设备产生的数据)。该数据流阶段并非上述三个范畴之一。**第三个信息革命**:其标志是物联网、云计算和大数据的广泛应用,这标志着信息技术从个人计算机和互联网时代推向了一个全新的发展阶段。3. **数据存储单位**:1TB被定义为二进制数量的形式,即1,099,511,627,776 MB(等于2的20次方)。Hadoop的核心组件:该系统包含两个主要功能模块,分别是$HDFS(Hadoop Distributed File System)$和MapReduce,它们各自承担分布式存储与分布式计算的任务。Hadoop分布式文件系统(HDFS)对分片大小的规定为64MByte。在HDFS中,数据节点(DataNodes)承担数据存储与读取的任务,而名称节点(NameNode)则协调文件系统元数据的信息。7. **将本地文件复制到HDFS上**:通过执行以下命令`hdfs dfs -put`,可以将本地文件存储于HDFS的指定路径。8. **建立HDFS目录结构**:通过`hadoop fs -mkdir -p`命令创建多层次目录结构。
由Google BigTable开源而来,HBase作为一个NoSQL数据库类,具有高效可靠的数据存储能力。相较于传统的关系型数据库,其按行号的一维索引机制仅支持基于行号的一维索引机制。10. **HBase数据插入**:在HBase表中进行记录插入时,采用`put`命令,并指定具体的表名、行键以及列族信息:其中涉及的列键值对。NoSQL的理论基础:其理论基础主要包括CAP定理、最终一致性以及BASE原则。该原则强调原子性、一致性和持久性,并要求所有事务具有隔离特性。与之相比,ACID原则是传统关系型数据库所遵循的标准,但并不适用于非关系型数据库NoSQL。
MapReduce工作流程:用于计算文本中单词频率的MapReduce程序中,map函数会将每行文本映射生成(key, value)格式的数据。其中,键是“词”,值为“1”;每个单词将被转换成一个新的条目。在PATH环境中运行Hadoop分布式文件系统(HDFS),其对应的启动命令为$start-dfs.sh$。通过HA机制实现系统高可用性;HDFS Federation可用于支持命名服务的水平扩展。备用名称节点可作为辅助备份存储器用于缓解名称节点的压力,但单独无法确保系统高可用性。RDD操作:Spark中的Resilient Distributed Datasets(RDD)操作分为转换(Transformation)和动作(Action)。其中,转换用于生成新的数据集而不触发计算过程;而动作则会执行计算并可能返回处理结果。这些知识点包括了大数据技术的核心概念、Hadoop生态系统中的主要组成部分及其功能特点、基于分布式文件系统(HDFS)的大数据存储与处理方法、NoSQL数据库中以HBase为例的典型实例及其应用特性,以及MapReduce算法的工作机制和应用场景分析。这些内容构成了大数据处理与分析的基础框架。
全部评论 (0)


