单选题 在 Spark 框架中,用于处理结构化数据并允许使用 SQL 进行查询的核心组件是()。

A、 Spark Streaming
B、 GraphX
C、 SparkR
D、 Spark SQL
下载APP答题
由4l***gb提供 分享 举报 纠错

相关试题

单选题 创建SparkSession的正确方式是()

A、 spark = SparkSession.newSession()
B、 spark = SparkSession.builder.appName("app").getOrCreate()
C、 spark = SparkContext.getOrCreate()
D、 spark = SparkSession.create()

单选题 广播变量的主要作用是()

A、 在所有Executor节点间共享只读数据
B、 缓存频繁使用的DataFrame
C、 优化SQL查询执行计划
D、 监控任务执行进度

单选题 查看DataFrame结构信息的正确命令是()

A、 df.show()
B、 df.printSchema()
C、 df.describe()
D、 df.info()

单选题 以下哪个方法用于读取CSV文件?()

A、 spark.read.csv("file.csv")
B、 spark.load.csv("file.csv")
C、 spark.csv("file.csv")
D、 spark.read.text("file.csv", format="csv")

单选题 筛选出 DataFrame 中年龄大于 20 的记录的命令是()。

A、 df.filter(df.age > 20)
B、 df.where(df.age = 20)
C、 df.select(df.age > 20)
D、 df.filter("age >= 20")

单选题 对DataFrame按年龄降序排序的正确方法是()

A、 df.sort("age")
B、 df.orderBy("age")
C、 df.orderBy(df.age.desc())
D、 df.sort(asc("age"))

单选题 RDD的filter()操作属于()

A、 转换操作(Transformation)
B、 行动操作(Action)
C、 聚合操作
D、 缓存操作

单选题 统计DataFrame总行数并重命名为"总数"的正确方法是()

A、 df.count().alias("总数")
B、 df.agg(count("∗").alias("总数"))
C、 df.select(count("∗")).alias("总数")
D、 df.groupBy().count().alias("总数")