单选题 大数据存储是指用存储器,以( )的形式,存储采集到数据的过程。
A、 数据库/数据仓库
B、 集群
C、 文件系统
D、 信息系统
单选题 哪些不是引起Hive数据倾斜的原因?( )
A、 数据在节点存储上分布不均
B、 运算中Key值分布不均
C、 业务数据本身存在分布不均
D、 Hive中表数量的多少
单选题 以下哪种情况容易引发HDFS负载不均问题?( )
A、 HDFS中存储的文件大小不一,小文件太多
B、 HDFS中Block的大小设置不合理
C、 Data各数据节点磁盘规格和空间大小有差异
D、 NameNode与DataNode节点在同一物理服务器上
单选题 MapReduce中可能引起负载问题的原因有哪些?( )
A、 MapReduce需要处理的数据量过大
B、 数据本身的格式问题,例如:文档格式混乱
C、 DataNode节点与Map节点不在一起
D、 Map中Key值选取和设定问题,导致Key值过于集中
单选题 下面哪些不是引起Spark负载不均的原因?( )
A、 Spark读入的数据源是倾斜的
B、 Shuffle阶段Key值过于集中
C、 在数据过滤阶段需要处理的数据量差异
D、 Spark的运行方式差异
单选题 Hive数据倾斜的表现?( )
A、 Hive建表后数据无法导入
B、 Hive无法启动
C、 Hive sql语句运行异常直接退出
D、 Hive 运算任务为报错单长期卡在99%
单选题 企业使用大数据平台基于( )做分析报表。
A、 MongoDB
B、 BI
C、 Hive
D、 SQL
单选题 下列不属于数据存储技术的是( )。
A、 MySQL
B、 Storm
C、 HDFS
D、 HBase