自己 在线考试 答题题目
1、(填空题) 23. (填空题)spark-submit常用配置项中 --name Name主要用于
2、 10. (单选题)对于RDD1((a,1),(b, 2),(c,3))和RDD2((b,4),(b,5),(a,6)),使用“RDD1.join (RDD2)”,得到的结果是( )。
3、(判断题) 15. (判断题)部署Spark高可用集群不需要用到Zookeeper服务
4、(填空题) 23. (填空题)方法和map()方法类似,但是该方法没有返回值,只用于对参数的结果进行输出。
5、 1. 以下关于Scala解释器(REPL)交互的基本方式说法错误的是( )
6、 14. (单选题)以下选项中使用spark-submit指定在YARN框架上运行程序的是( )。
7、(判断题) 35. (判断题)Scala中声明变量时,可以不给出变量的类型,因为在初始化的时候,Scala的类型推断机制能够根据变量初始化的值自动推算出来。
8、 14. (单选题)定义类Counter,并通过new关键字实例化出counter对象,代码如下,以下选项的操作正确的是( )。 class Counter(name:String){val a = 1var b ="counter" } val counter = new Counter("computer")
9、 8. (单选题)以下选项中不能对DataFrame列名进行重命名的方法是( )。
10、 5. (单选题)DataFrame的show()方法默认输出( )条数据。
11、 16. (单选题)以下选项符合Scala编程规范的是( )。
①"spark".equals("spark") ②"spark".contains(spark)
③val a:String="spark"④val a=List{1,2,3,4}
12、(判断题) 30. (判断题)在Scala中,使用关键字bar声明的变量,值是不可变的。
13、(填空题) 14. (填空题)在DataFrame的操作中,_____用于对记录进行分组。
14、(判断题) 33. (判断题)在Scala中,集合有三大类分别是List、Set以及Map。
15、(填空题) 26. (填空题)在Scala中,获取元组中的值是通过 来获取的
16、 2. Spark是Hadoop生态下( )组件的替代方案
17、 5. (单选题)下列选项中不属于MLlib中常用的数据类型的是( )。
18、 6. (单选题)关于Spark MLlib的mllib.stat.Statistics类中的方法,描述错误的是( )。
19、 13. (单选题)使用“val rdd: RDD[String]= sc.makeRDD(List("Hello Scala","Hello Spark"))”创建了一个RDD,以下选项中,不能使该RDD实现单词计数的是( )。
20、 1. (单选题)下列说法正确的是哪一项?( )
21、(判断题) 15. (判断题)Spark SQL与Hive不兼容
22、(判断题) 21. (判断题)Spark SQL与Hive相互不兼容。
23、 10. (单选题)在Spark中,调用RDD的()方法,可以将RDD转换为DataFrame对象。
24、(判断题) 18. (判断题)Hadoop的MapReduce进行计算时,每次产生的中间结果都是存储在内存中;而Spark在计算时产生的中间结果存储在本地磁盘中。
25、(判断题) 20. (判断题)Spark SQL提供了一个编程抽象结构叫做DataFrame的数据模型。
26、 4. (单选题)以下关于数组a的定义,最终数组a的数据与其他选项不一致的是
27、(填空题) 22. (填空题)方法可以通过一个函数重新计算列表中的所有元素,并且返回一个包含相同数目元素的新列表。
28、(判断题) 18. (判断题)Spark SQL不仅能够查询MySQL数据库中的数据,还可以向表中插入新的数据
29、 4. (单选题)下列选项中( )算法属于分类算法。
30、 10. (单选题)表达式for(i<-1 to 3;for(j<-1 to 3;if i!=j))print((10*i+j))+"",输出结果正确的是( )
31、 3. (单选题)关于Spark SQL的说法,以下选项错误的是( )。
32、 8. (单选题)下列关于List的定义,哪个是错误的( )
33、 1. (单选题)下面哪个端口不是Spark自带服务的端口
34、 11. (单选题)saveAsTextFile()方法用于将( )以文本文件的格式存储到文件系统中。
35、(填空题) 10. (填空题)停止Spark集群的命令为
36、 3. (单选题)下列选项中( )算法不属于有监督学习算法。
37、 4. (单选题)DataFrame可以将数据保存成持久化的表,使用的方法是( )。
38、 7. (单选题)下列选项中,( )不属于数据标准化或归一化方法。
39、 8. (单选题)ALS是MLlib的一个实现推荐算法的包,需要输入的数据类型是( )。
40、 1. (单选题)以下不属于Spark架构中的组件的是( )
41、(判断题) 13. (判断题)标注点是一种带有标签的本地向量,通常用于无监督学习算法中
42、(填空题) 9. (填空题)启动Spark集群的命令为
43、(判断题) 22. (判断题)Spark SQL为Spark框架在结构化数据分析方面提供重要技术支持。
44、 6. (单选题)获取DataFrame中所有数据,并返回一个数组对象,使用的方法是( )。
45、 1. (单选题)机器学习可以分为( )。
46、(填空题) 12. (填空题)在spark-shell下进入粘贴模式的命令为
47、(判断题) 14. (判断题)Spark诞生于洛桑联邦理工学院(EPEL)的编程方法实验室
48、(填空题) 10. (填空题)在Spark MLlib库中,经常用于将对象分到高度相似的类中的一种无监督学习算法的是
49、(填空题) 11. (填空题)是一个用于处理结构化数据的框架,可被视为一个分布式的SQL查询引擎,提供了一个抽象的可编程数据模型DataFrame
50、(填空题) 12. (填空题)推荐算法有两个主要的类别:一种是_____ ,另一种是____
51、 12. (单选题)映射的示例代码如下,运行后res的正确结果是val data=Map(1->"Chinese"),2->"Math",3->"English" val res=for(k,v)<-data;if(k>1)) yield v
52、 4.在Spark中,如果需要对实时数据进行流式计算,那么使用的子框架是( )
53、(填空题) 11. (填空题)进入spark-shell操作界面的命令为
54、 5. (单选题)以元组pair为例,以下关于元组说法错误的是( )
55、(填空题) 24. (填空题)RDD的操作主要分为____和____
56、(判断题) 34. (判断题)Scala中,使用关键字var或val声明变量时,后面紧跟的变量名称可以和Scala中的保留字重名,而且变量名不可以以字母或下划线开头,且变量名是不区分大小写的。
57、 7. Spark与Hadoop在基于内存的运算中,说法正确的是()。
58、 7. (单选题)关于RDD集合操作方法,以下选项中描述错误的是
59、 2. (单选题)下列属于关联规则算法是( )。
60、 7. (单选题)下列方法中,哪个方法可以正确计算数组arr的长度( )
61、 3. (单选题)以下方法中,从外部存储系统中创建RDD使用的方法是( )
62、 2. 以下关于Scala的特性说法错误的是( )
微信扫一扫 在线答题 在线出卷 随机出题小程序 闯关答题软件 出题答题小程序