62 在线考试 答题题目
1、(填空题) 13. (填空题)Spark SQL作为分布式SQL查询引擎,让用户可以通过 、DataFrames API和Datasets API3种方式实现对结构化数据的处理。
2、 15. (单选题)以下程序的输出结果是( )。 val alphabet = List("A","B","C") val nums = List(1,2)
print(alphabet.zip(nums))
3、 7. (单选题)关于RDD集合操作方法,以下选项中描述错误的是
4、(判断题) 19. (判断题)DataFrame可以从很多数据源中创建,例如结构化文件、外部数据库、Hive表等数据源。
5、(填空题) 11. (填空题)进入spark-shell操作界面的命令为
6、(判断题) 31. (判断题)在Scala中定义变长数组时,需要导入可变数组包。
7、 14. (单选题)以下选项中使用spark-submit指定在YARN框架上运行程序的是( )。
8、 8. (单选题)关于键值对RDD的连接操作,以下选项中描述正确的是
9、 5. (单选题)DataFrame的show()方法默认输出( )条数据。
10、 13. (单选题)使用“val rdd: RDD[String]= sc.makeRDD(List("Hello Scala","Hello Spark"))”创建了一个RDD,以下选项中,不能使该RDD实现单词计数的是( )。
11、(判断题) 14. (判断题)Spark诞生于洛桑联邦理工学院(EPEL)的编程方法实验室
12、(填空题) 9. (填空题)启动Spark集群的命令为
13、(填空题) 14. (填空题)在DataFrame的操作中,_____用于对记录进行分组。
14、 5. 关于SparkRDD,下列说法不正确的是( )
15、 2. 以下关于Scala的特性说法错误的是( )
16、(填空题) 19. (填空题)方法用于获取RDD的前N个元素,返回数据为数组
17、 1. 以下关于Scala解释器(REPL)交互的基本方式说法错误的是( )
18、 13. (单选题)以下关于Scala的类和单例对象之间的差别描述正确的是( )
19、 6. (单选题)下列选项中,哪个是Scala编译后文件的扩展名( )
20、(判断题) 29. (判断题)Scala语言是一种面向过程编程的语言。
21、(判断题) 17. (判断题)Spark SQL可以通过JDBC从关系数据库中读取数据的方式创建DataFrame,通过对DataFrame进行一系列的操作后,不可以将数据重新写入到关系数据库中。
22、(判断题) 36. (判断题)Scala有两种类型的变量,一种是使用关键字var声明的常量,值是不可变的;另一种是使用关键字val声明的变量,值是可变的。
23、 7. (单选题)下列选项中,( )不属于数据标准化或归一化方法。
24、 17. (单选题)映射的示例代码如下,运行后res的正确结果是( )。
val data = Map(1 ->"Chinese",2 ->"Math",3 ->"English")
val res = for((k,v)<- data; if(k>1))yield v
25、(填空题) 22. (填空题)方法用于对具有相同键的值进行分组,可以对同一组的数据进行计数、求和等操作。
26、(判断题) 15. (判断题)部署Spark高可用集群不需要用到Zookeeper服务
27、 8. Spark于2009年诞生于()。
28、(判断题) 15. (判断题)Spark SQL与Hive不兼容
29、(判断题) 21. (判断题)Spark SQL与Hive相互不兼容。
30、 3. Spark支持的运行模式不包括( )
31、 3. (单选题)以下关于Scala的变量定义、赋值的代码,运行后一定会报错的是( )
32、 9. (单选题)下列选项中,哪个不是Spark生态系统中的组件?
33、(填空题) 24. (填空题)使用____方法可以实现数据过滤
34、(填空题) 23. (填空题)方法和map()方法类似,但是该方法没有返回值,只用于对参数的结果进行输出。
35、 16. (单选题)提交Spark程序时,通常需要设置一些配置项,关于配置项,下列说法错误的是( )
36、(填空题) 13. (填空题)spark-shell下清屏的快捷方式为
37、 9. (单选题)对于RDD(a,1),(a,2),(a,3)),使用“reduceByKey(_+_)”进行合并,得到的结果 是( )
38、 1. (单选题)以下不属于Spark架构中的组件的是( )
39、 4. (单选题)以下是转换操作的方法是()
40、 3. (单选题)以下方法中,从外部存储系统中创建RDD使用的方法是( )
41、(判断题) 25. (判断题)RDD是一个可变、不可分区、里面的元素不可并行计算的集合
42、 6. (单选题)获取DataFrame中所有数据,并返回一个数组对象,使用的方法是( )。
43、 21. (单选题)Scala中,用于创建单例对象的关键字是()。
44、(填空题) 26. (填空题)在Scala中,获取元组中的值是通过 来获取的
45、 6. 下列选项中,可以支持Scala和Python编程的交互式解释器是()。
46、(填空题) 22. (填空题)方法可以通过一个函数重新计算列表中的所有元素,并且返回一个包含相同数目元素的新列表。
47、(填空题) 23. (填空题)spark-submit常用配置项中 --name Name主要用于
48、 3. (单选题)关于Spark SQL的说法,以下选项错误的是( )。
49、(填空题) 11. (填空题)协同过滤推荐算法有两种形式,分别是_____和_____
50、 2. (单选题)下列属于关联规则算法是( )。
51、(填空题) 12. (填空题)Spark SQL是Spark用来 的一个模块
52、 20. (单选题)下列方法中,用于计算数组长度的是()。
53、 8. (单选题)ALS是MLlib的一个实现推荐算法的包,需要输入的数据类型是( )。
54、 1. (单选题)机器学习可以分为( )。
55、 12. (单选题)Spark中的SparkContext是( )。
56、(填空题) 12. (填空题)在spark-shell下进入粘贴模式的命令为
57、 6. (单选题)关于Spark MLlib的mllib.stat.Statistics类中的方法,描述错误的是( )。
58、 10. (单选题)表达式for(i<-1 to 3;for(j<-1 to 3;if i!=j))print((10*i+j))+"",输出结果正确的是( )
59、(判断题) 16. (判断题)Spark Master HA主从切换过程不会影响集群已有的作业运行
60、(判断题) 35. (判断题)Scala中声明变量时,可以不给出变量的类型,因为在初始化的时候,Scala的类型推断机制能够根据变量初始化的值自动推算出来。
61、(判断题) 16. (判断题)在Spark SQL中,若想要使用SQL风格操作,则需要提前将DataFrame注册成一张临时表
62、(填空题) 25. (填空题)方法可对集合中的元素进行分组操作,返回的结果是一个映射。
微信扫一扫 在线答题 在线出卷 随机出题小程序 闯关答题软件 出题答题小程序