1
您的位置: 线上活动  >  在线答题  >  答题题库

网络爬虫

2022-12-14 11:33:23.226.0.13394

网络爬虫 在线考试 答题题目
1、(判断题) Robots协议的全称是“网络爬虫排除标准”(Robots ExclusionProtocol)
  • A、正确
  • B、错误


  • 2、(判断题) Scrapy吸引人的地方在于它是一个框架,任何人都可以根据需求方便的修改。( )
  • A、正确
  • B、错误


  • 3、(判断题) Scrapy用途广泛,可以用于数据挖掘、监测和自动化测试等。()
  • A、正确
  • B、错误


  • 4、(填空题) 为了爬取网站数据,提取结构性数据而编写的应用程序框架称为( )


  • 5、(填空题) ( )它负责处理所有Responses,从中分析提取数据,获取Item字段需要的数据,并将需要跟进的URL提交给引擎,再次进入Scheduler调度器。


  • 6、(填空题) ( )负责Spider、ItemPipeline、Downloader、Scheduler中间的通讯,信号、数据传递等。


  • 7、(填空题) ( )负责下载Scrapy Engine(引擎)发送的所有Requests请求,并将其获取到的Responses交还给Scrapy Engine(引擎),由引擎交给Spider来处理。


  • 8、 下列命令中,可以新建一个Scrapy项目的是()
  • A、scrapy genspider itcast
  • B、scrapy startproject mySpider
  • C、scrapy start mySpider
  • D、scrapy genspider itcast “itcast.cn”


  • 9、(判断题) 通用爬虫用于将互联网上的网页下载到本地,形成一个互联网内容的镜像备份。
  • A、正确
  • B、错误


  • 10、(判断题) Scheduler(调度器)负责Spider、ItemPipeline、Downloader、Scheduler中间的通讯,信号、数据传递等。( )
  • A、正确
  • B、错误


  • 11、(判断题) robots文件必须要存放在网站的根目录下。
  • A、正确
  • B、错误


  • 12、(判断题) 在某页面上右键单击页面,选择“查看网页源代码”。
  • A、正确
  • B、错误


  • 13、 下列选项中,用于设置爬虫工作时使用的代理的是()。
  • A、USER_AGENT
  • B、PROXIES
  • C、COOKIES_ENABLED
  • D、ITEM_PIPELINES


  • 14、 下列选项中,用于在robots.txt文件中描述搜索引擎名字的是()。
  • A、User-agent
  • B、Disallow
  • C、Allow
  • D、accept


  • 15、 下列不属于HTTP头部类型的是( )
  • A、通用头
  • B、回复头
  • C、请求头
  • D、响应头


  • 16、 下列属于 HTTP状态码类型描述错误的是( )。
  • A、4XX表示客户端可能发生错误
  • B、5XX表示服务器可能发生错误
  • C、1XX表示请求已被服务器接受,无须后续处理
  • D、3XX表示客户端的请求需采取进一步操作


  • 17、 下列选项中,可以用来在浏览器对象的页面上模拟鼠标操作的是()。
  • A、ActionChains
  • B、Select
  • C、PhantomJS
  • D、WebDriver


  • 18、 识别验证码的方法不包含以下哪一种?( )
  • A、人工识别
  • B、编写程序自动识别
  • C、使用打码接口识别
  • D、智能识别


  • 19、(判断题) Scrapy Engine(引擎):负责处理Spider中获取到的Item,并进行进行后期处理(详细分析、过滤、存储等)的地方。( )
  • A、正确
  • B、错误


  • 20、(填空题) 按照链接的路径指向不同,可以分为( )、( )、( )


  • 21、(填空题) 在浏览器中打开网站后,在网站首页的地址后面添加( ),如果网站设置了访问许可,按回车就可以看到网站的 robots 协议,即 robots.txt 文件内容。


  • 22、(填空题) ( )为了给 Web 网站提供灵活的控制方式来决定页面是否能够被爬虫采集。


  • 23、(填空题) 根据 Web 页面组成结构中的信息内容的生成方式不同,可以将 Web 页面分为( )、 ()、以及()三大类


  • 24、(填空题) HTTP 状态码(HTTP Status Code)是用来表示网页服务器 HTTP 响应状态的 ( )代码。 状态码包含了五种类别,即消息、成功、重定向、请求错误和服务器错误。


  • 25、(填空题) ( )代表“NOT FOUND”,认为网页已经失效;503 代表“Service Unavailable”,认为网页临时不可访问;( )代表“Forbidden”,认为网页目前禁止访问。


  • 26、(填空题) HTTP 响应报文与请求报文由( )、( )、( )构成。


  • 27、(填空题) 页面可以通过 ( )、( )方式来向服务器发送请求的动态参数。


  • 28、(填空题) 页面采集层用于对 ( )的处理。


  • 29、(填空题) 协议 : //域名部分:端口号/目录/文件名.文件后缀?参数 1=值#标志&参数 2=值#标志 ? 表示( );参数的基本形式是,不同参数之间用 ( )连接起来。 # 标志表示( ),用于访问一个 Web 页面中的特定部分。


  • 30、(填空题) 在Xpath表达式中用于表示选取属性节点的符号是( )。


  • 31、(填空题) 如果要设置响应内容的编码方式,可以使用()属性进行设置。


  • 32、(填空题) 可以匹配任何属性节点的符号是( )。


  • 33、(填空题) 在正则表达式中, () 用于匹配行首的文本。


  • 34、 请阅读下面一段HTML结构: <div id="ul"> <a href=http://news.baidu.com>新闻</a> <a href=http://news.hao123.com>>hao123</a> <a href=http://map.baidu.com>>地图</a> <a href=http://v.baidu.com>>视频</a> </div> 上述示例中,所有的<a>标签属于()关系
  • A、父子
  • B、兄弟
  • C、先辈
  • D、后代


  • 35、 阅读下面的程序: From lxml import etree Root=etree.HTML(“<note><to>Jerry</to><to>George</to><to>Tom</to><to>John</to> </note>”) Print(root.find(“to”).text) 运行上面的程序,程序输出的结果为()。
  • A、George
  • B、Jerry
  • C、Tom
  • D、John


  • 36、 下列函数中,用于对URL进行解码的是()。
  • A、encode
  • B、urlencode
  • C、unquote
  • D、decode


  • 37、 如果想选取所有拥有lang属性的title元素,则可以使用表达式()实现。
  • A、//title[lang]
  • B、/title@lang
  • C、//title@[lang]
  • D、//title[@lang]


  • 38、 下列路径表达式中,用于选取第一个app元素的是()。
  • A、/appstore/app(1)
  • B、/appstore/app(first)
  • C、/appstore/app[1]
  • D、/appstore/app[first]


  • 39、 下列字符编码中,可以解决多种语言文本显示问题的是()。
  • A、utf-8
  • B、ISO-8859-1
  • C、gb2312
  • D、gbk


  • 40、 请阅读下列个一段程序代码: Import urllib.request Response=urllib.request.urlopen(‘http://python.org’) Print(response.getcode()) 若程序运行成功,那么输出的结果可能是()。
  • A、500
  • B、400
  • C、300
  • D、200


  • 41、 下列路径表达中,表示从根节点bookstore向下选取book子节点的是()。
  • A、bookstore
  • B、/bookstore
  • C、//book
  • D、bookstore/book


  • 42、 下列符号中,能够分隔Xpath表达式中任意两个节点的是()。
  • A、#
  • B、/
  • C、%
  • D、*


  • 43、 下列选项中,支持使用Xpath语法的库是()。
  • A、lxml
  • B、re
  • C、json
  • D、beautifulsoup4


  • 44、 下列选项中,用作发送HTTP请求的模块是()。
  • A、urllib.request
  • B、urllib.error
  • C、urllib.parse
  • D、urllib.robotparser


  • 45、 下列方法中,使用Xpath表达式来定位元素的是()。
  • A、find_enlement_by_id
  • B、find_enlement_by_xpath
  • C、find_enlement_by_name
  • D、find_enlement_by_tag_name


  • 46、 下列选项中,可以匹配任何属性节点的是()。
  • A、*
  • B、node()
  • C、@*
  • D、node


  • 47、 下面哪个不是Python Requests库提供的方法?
  • A、head()
  • B、post()
  • C、push()
  • D、get()


  • 48、 以下哪个是不合法的HTTP URL?
  • A、https://223.252.199.7/course/BIT-1001871002#/
  • B、news.sina.com.cn:80
  • C、https://dwz.cn/hMvN8
  • D、https://210.14.148.99/


  • 49、(判断题) 返回状态码200证明登录成功,也表明表单数据被成功发送出去。( )
  • A、正确
  • B、错误


  • 50、(填空题) ( )可提供更为精确的描述信息,其对象为所请求的资源或请求本身。


  • 51、 以下获取代理IP的方法不包含哪一种?( )
  • A、VPN
  • B、IP代理池
  • C、ADSL宽带拨号
  • D、Proxies


  • 52、 下列参数中,用于传入urlopen()函数中设置超时时长的是()。
  • A、url
  • B、data
  • C、timeout
  • D、context


  • 53、 下列请求方法中,用于提交表单或上传文件的是()。
  • A、PUT
  • B、GET
  • C、HEAD
  • D、POST


  • 54、 请阅读下列一段实例程序: Import requests url=http://www.baidu.com/ response=requests.get(url) response.encoding=”ISO-8859-1” pirnt(response.text) 上述程序运行时,会使用哪种编码方式返回文本?()
  • A、utf-8
  • B、gbk
  • C、ISO-8859-1
  • D、gbk2312


  • 55、(判断题) Cookie 存储了客户端的一些重要信息,例如身份标识、所在地区等,通常是一个文本文件。在向服务器发送 URL 请求时,可以将文件内容读出,附加在 HTTP 的请求头中,可以免去用户输入信息的麻烦。()
  • A、正确
  • B、错误


  • 56、(判断题) HTTP/1.1 默认采用持久连接。()
  • A、正确
  • B、错误


  • 57、 下列符号中,用于注释robots.txt文件的记录的是()。
  • A、/
  • B、//
  • C、*
  • D、#


  • 58、 下列选项中,被称为全网爬虫的是()。
  • A、通用网络爬虫
  • B、增量式网络爬虫
  • C、深层爬虫
  • D、聚焦网络爬虫


  • 59、 下列数据中,能够被网络爬取的是()。
  • A、用户的注册信息
  • B、网站后台信息
  • C、互联网公开的且可访问到的信息
  • D、互联网非公开信息


  • 60、 下列选项中,被称为主题网络爬虫的是()。
  • A、增量式网络爬虫
  • B、通用网络爬虫
  • C、深层网络爬虫
  • D、聚焦网络爬虫


  • 61、 下列选项中,用于在robots.txt文件中描述搜索引擎名字的是()。
  • A、User-agent
  • B、Disallow
  • C、Allow
  • D、accept


  • 62、 下列端口号中,用来表示的HTTP程序的是()。
  • A、80
  • B、443
  • C、403
  • D、200


  • 63、 下列状态码中,表示服务器拒绝访问的是()。
  • A、402
  • B、403
  • C、404
  • D、405


  • 64、 在浏览器中打开网页,按( )键可以调出Chrome开发者工具。
  • A、F12
  • B、F5
  • C、F19
  • D、F11


  • 65、 下列属于 HTTP必须实现的请求方法的是( )。
  • A、GET与HEAD
  • B、POST与DELETE
  • C、TRACE和OPTIONS
  • D、OPTIONS和CONNECT


  • 66、 以下获取代理IP的方法不包含哪一种?( )
  • A、VPN
  • B、IP代理池
  • C、ADSL宽带拨号
  • D、proxies


  • 微信扫一扫 在线答题 在线出卷 随机出题小程序 闯关答题软件 出题答题小程序