单选题 在 PySpark 的机器学习库(MLlib)中,K-Means 算法主要用于解决的问题是()。

A、 聚类分析
B、 分类与回归
C、 降维处理
D、 关联规则挖掘
下载APP答题
由4l***gb提供 分享 举报 纠错

相关试题

单选题 以下哪个方法用于读取CSV文件?()

A、 spark.read.csv("file.csv")
B、 spark.load.csv("file.csv")
C、 spark.csv("file.csv")
D、 spark.read.text("file.csv", format="csv")

单选题 创建SparkSession的正确方式是()

A、 spark = SparkSession.newSession()
B、 spark = SparkSession.builder.appName("app").getOrCreate()
C、 spark = SparkContext.getOrCreate()
D、 spark = SparkSession.create()

单选题 筛选出 DataFrame 中年龄大于 20 的记录的命令是()。

A、 df.filter(df.age > 20)
B、 df.where(df.age = 20)
C、 df.select(df.age > 20)
D、 df.filter("age >= 20")

单选题 广播变量的主要作用是()

A、 在所有Executor节点间共享只读数据
B、 缓存频繁使用的DataFrame
C、 优化SQL查询执行计划
D、 监控任务执行进度

单选题 RDD的filter()操作属于()

A、 转换操作(Transformation)
B、 行动操作(Action)
C、 聚合操作
D、 缓存操作

单选题 统计DataFrame总行数并重命名为"总数"的正确方法是()

A、 df.count().alias("总数")
B、 df.agg(count("∗").alias("总数"))
C、 df.select(count("∗")).alias("总数")
D、 df.groupBy().count().alias("总数")

单选题 对DataFrame按年龄降序排序的正确方法是()

A、 df.sort("age")
B、 df.orderBy("age")
C、 df.orderBy(df.age.desc())
D、 df.sort(asc("age"))

单选题 查看DataFrame结构信息的正确命令是()

A、 df.show()
B、 df.printSchema()
C、 df.describe()
D、 df.info()