网络爬虫 在线考试 答题题目
1、(判断题) Robots协议的全称是“网络爬虫排除标准”(Robots ExclusionProtocol)
2、(判断题) Scrapy吸引人的地方在于它是一个框架,任何人都可以根据需求方便的修改。( )
3、(判断题) Scrapy用途广泛,可以用于数据挖掘、监测和自动化测试等。()
4、(填空题) 为了爬取网站数据,提取结构性数据而编写的应用程序框架称为( )
5、(填空题) ( )它负责处理所有Responses,从中分析提取数据,获取Item字段需要的数据,并将需要跟进的URL提交给引擎,再次进入Scheduler调度器。
6、(填空题) ( )负责Spider、ItemPipeline、Downloader、Scheduler中间的通讯,信号、数据传递等。
7、(填空题) ( )负责下载Scrapy Engine(引擎)发送的所有Requests请求,并将其获取到的Responses交还给Scrapy Engine(引擎),由引擎交给Spider来处理。
8、 下列命令中,可以新建一个Scrapy项目的是()
9、(判断题) 通用爬虫用于将互联网上的网页下载到本地,形成一个互联网内容的镜像备份。
10、(判断题) Scheduler(调度器)负责Spider、ItemPipeline、Downloader、Scheduler中间的通讯,信号、数据传递等。( )
11、(判断题) robots文件必须要存放在网站的根目录下。
12、(判断题) 在某页面上右键单击页面,选择“查看网页源代码”。
13、 下列选项中,用于设置爬虫工作时使用的代理的是()。
14、 下列选项中,用于在robots.txt文件中描述搜索引擎名字的是()。
15、 下列不属于HTTP头部类型的是( )
16、 下列属于 HTTP状态码类型描述错误的是( )。
17、 下列选项中,可以用来在浏览器对象的页面上模拟鼠标操作的是()。
18、 识别验证码的方法不包含以下哪一种?( )
19、(判断题) Scrapy Engine(引擎):负责处理Spider中获取到的Item,并进行进行后期处理(详细分析、过滤、存储等)的地方。( )
20、(填空题) 按照链接的路径指向不同,可以分为( )、( )、( )
21、(填空题) 在浏览器中打开网站后,在网站首页的地址后面添加( ),如果网站设置了访问许可,按回车就可以看到网站的 robots 协议,即 robots.txt 文件内容。
22、(填空题) ( )为了给 Web 网站提供灵活的控制方式来决定页面是否能够被爬虫采集。
23、(填空题) 根据 Web 页面组成结构中的信息内容的生成方式不同,可以将 Web 页面分为( )、 ()、以及()三大类
24、(填空题) HTTP 状态码(HTTP Status Code)是用来表示网页服务器 HTTP 响应状态的 ( )代码。 状态码包含了五种类别,即消息、成功、重定向、请求错误和服务器错误。
25、(填空题) ( )代表“NOT FOUND”,认为网页已经失效;503 代表“Service Unavailable”,认为网页临时不可访问;( )代表“Forbidden”,认为网页目前禁止访问。
26、(填空题) HTTP 响应报文与请求报文由( )、( )、( )构成。
27、(填空题) 页面可以通过 ( )、( )方式来向服务器发送请求的动态参数。
28、(填空题) 页面采集层用于对 ( )的处理。
29、(填空题) 协议 : //域名部分:端口号/目录/文件名.文件后缀?参数 1=值#标志&参数 2=值#标志
? 表示( );参数的基本形式是,不同参数之间用 ( )连接起来。
# 标志表示( ),用于访问一个 Web 页面中的特定部分。
30、(填空题) 在Xpath表达式中用于表示选取属性节点的符号是( )。
31、(填空题) 如果要设置响应内容的编码方式,可以使用()属性进行设置。
32、(填空题) 可以匹配任何属性节点的符号是( )。
33、(填空题) 在正则表达式中, () 用于匹配行首的文本。
34、 请阅读下面一段HTML结构:
<div id="ul">
<a href=http://news.baidu.com>新闻</a>
<a href=http://news.hao123.com>>hao123</a>
<a href=http://map.baidu.com>>地图</a>
<a href=http://v.baidu.com>>视频</a>
</div>
上述示例中,所有的<a>标签属于()关系
35、 阅读下面的程序:
From lxml import etree
Root=etree.HTML(“<note><to>Jerry</to><to>George</to><to>Tom</to><to>John</to> </note>”)
Print(root.find(“to”).text)
运行上面的程序,程序输出的结果为()。
36、 下列函数中,用于对URL进行解码的是()。
37、 如果想选取所有拥有lang属性的title元素,则可以使用表达式()实现。
38、 下列路径表达式中,用于选取第一个app元素的是()。
39、 下列字符编码中,可以解决多种语言文本显示问题的是()。
40、 请阅读下列个一段程序代码:
Import urllib.request
Response=urllib.request.urlopen(‘http://python.org’)
Print(response.getcode())
若程序运行成功,那么输出的结果可能是()。
41、 下列路径表达中,表示从根节点bookstore向下选取book子节点的是()。
42、 下列符号中,能够分隔Xpath表达式中任意两个节点的是()。
43、 下列选项中,支持使用Xpath语法的库是()。
44、 下列选项中,用作发送HTTP请求的模块是()。
45、 下列方法中,使用Xpath表达式来定位元素的是()。
46、 下列选项中,可以匹配任何属性节点的是()。
47、 下面哪个不是Python Requests库提供的方法?
48、 以下哪个是不合法的HTTP URL?
49、(判断题) 返回状态码200证明登录成功,也表明表单数据被成功发送出去。( )
50、(填空题) ( )可提供更为精确的描述信息,其对象为所请求的资源或请求本身。
51、 以下获取代理IP的方法不包含哪一种?( )
52、 下列参数中,用于传入urlopen()函数中设置超时时长的是()。
53、 下列请求方法中,用于提交表单或上传文件的是()。
54、 请阅读下列一段实例程序:
Import requests
url=http://www.baidu.com/
response=requests.get(url)
response.encoding=”ISO-8859-1”
pirnt(response.text)
上述程序运行时,会使用哪种编码方式返回文本?()
55、(判断题) Cookie 存储了客户端的一些重要信息,例如身份标识、所在地区等,通常是一个文本文件。在向服务器发送 URL 请求时,可以将文件内容读出,附加在 HTTP 的请求头中,可以免去用户输入信息的麻烦。()
56、(判断题) HTTP/1.1 默认采用持久连接。()
57、 下列符号中,用于注释robots.txt文件的记录的是()。
58、 下列选项中,被称为全网爬虫的是()。
59、 下列数据中,能够被网络爬取的是()。
60、 下列选项中,被称为主题网络爬虫的是()。
61、 下列选项中,用于在robots.txt文件中描述搜索引擎名字的是()。
62、 下列端口号中,用来表示的HTTP程序的是()。
63、 下列状态码中,表示服务器拒绝访问的是()。
64、 在浏览器中打开网页,按( )键可以调出Chrome开发者工具。
65、 下列属于 HTTP必须实现的请求方法的是( )。
66、 以下获取代理IP的方法不包含哪一种?( )
微信扫一扫 在线答题 在线出卷 随机出题小程序 闯关答题软件 出题答题小程序