SCAU数据科学与大数据技术导论期末整理(1-3章)

第1 部分:基础部分(第1-3 章)

第1 章数据科学概述

1、数据的概念:

单选题1.2

数据的表现形式包括()

A.视频 B.符号

C.图像 D.以上全部

答案:D

数据的表现形式有很多,包括符号、文字、数字、音频、图像、视频等

简述题1.1

简述数据与信息之间的关系

数据指的是事实或经过观察的结果,是对客观事物的逻辑归纳,是用于表示客观事物的未经加工的原始素材。数据的表现形式有很多,包括符号、文字、数字、音频、图像、视频等。信息是对客观世界中各种事物的运动状态和变化的反映,是数据有意义的表示。数据本身没有意义,数据只有对实体行为产生影响时才成为信息。

2、数据的分类:

单选题1.1

数据的结构类型包括()

A.结构化数据 B.半结构化数据

C.非结构化数据 D.以上全部

答案:D

3、数据模型:

填空题1.1

数据模型按照不同的应用层次可以分为三种类型:++概念模型、逻辑模型、物理模型++

4、数据科学的概念:

单选题1.4

数据科学的研究步骤不包括()

A.数据业务化 B.获取数据集

C.对数据进行预处理 D.数据感知化呈现

答案:A

简述题1.3

列出数据科学的研究步骤

填空题1.2

数据科学是关于**++数据++** 的科学,是探索和发现数据中价值的++理论++ 、方法和++技术++,是对从数据中提取知识的研究。

5、数据科学的研究内容:

填空题1.5

数据科学的研究内容有++领域数据科学++ 、++数据资源开发++、用科学研究数据和用数据研究科学。

简述题1.5

数据科学的研究内容主要有哪些

第2 章大数据概述

1、大数据的发展历程:

填空题2.1

大数据发展的四阶段分别为:萌芽阶段、++突破阶段、成熟阶段、应用阶段++

2、大数据的概念与特征:

单选题2.3

以下()不是大数据的特征

A.数据量大 B.价值密度高

C.数据种类繁多 D.处理速度快

答案:B

填空题2.3

大数据的5个特征是:++数据量大、数据种类繁多、处理速度快、价值密度低、真实性强++

3、大数据的核心技术:

简述题2.2

列出大数据的六个核心技术

4、大数据的价值:

填空题2.4

大数据的价值体现在++发现规律++ 和++预测未来++两个方面

第3 章大数据与云计算

1、云计算的特点:

填空题3.1

任意列出云计算的四个特点:

2、云计算分类:

填空题3.3

根据服务类型,云计算可以分为:

基础设施即服务------IaaS

平台即服务------PaaS

软件即服务------SaaS

数据即服务------DaaS

3、云计算的核心技术:

填空题3.4

云计算的核心技术有:++编程模型、分布式技术、虚拟化技术、云平台技术++

简述题3.4

简述云计算的核心技术

云计算的核心技术包括编程模型、分布式技术、虚拟化技术、云平台技术;

  • 编程模型:以 MapReduce 为代表,它是简化的分布式编程模型,由谷歌开发,支持 Python、Java、C++ 等语言。通过将问题分解为 Map(映射)和 Reduce(化简)两个阶段,先把输入数据集切分成独立数据块,由多台计算机并行运算处理,再汇总输出结果。
  • 分布式技术:包含分布式计算和分布式存储。分布式计算是将不同地理位置的计算机资源组成集群,把大任务分割成小任务单元分配给不同计算机处理后汇总结果,具有模块结构化、资源分散、任务并行、整体强健、实时性强等特点;分布式存储有中心化和去中心化两种体系架构,中心化架构以一个节点为中心,管理方便但中心节点负载重且易影响整体系统,去中心化架构各节点功能均等、负载均衡但管理难度大,二者在可扩展性、可维护性等性能上各有优劣。
  • 虚拟化技术:分为基础设施虚拟化、系统虚拟化和软件虚拟化。基础设施虚拟化涵盖硬件、网络、存储、文件虚拟化,分别实现硬件配置虚拟、网络资源整合、存储逻辑接口统一、分散文件逻辑接口整合;系统虚拟化可将物理计算机与操作系统分离,让一台物理计算机运行多个虚拟操作系统,为虚拟机提供虚拟的处理器、内存等硬件环境;软件虚拟化通过虚拟软件包放置应用程序和数据,具有减小应用冲突、减少导入时间、可运行同一应用多个版本等特点,典型应用产品有 Java 虚拟机、APP - V、VMware Thin App 等。
  • 云平台技术:以 Amazon 云平台(AWS)为代表,提供计算、存储、数据库、应用程序等服务,采用去中心化的分布式架构,存储采用 Dynamo 架构,以键值对、位的形式存储数据,适用于简单存取写入的场景,相比传统关系型数据库能提高存储效率。

填空题3.7

虚拟化技术包括:++基础设施虚拟化、系统虚拟化、软件虚拟化++

相关推荐
武子康9 小时前
大数据-237 离线数仓 - Hive 广告业务实战:ODS→DWD 事件解析、广告明细与转化分析落地
大数据·后端·apache hive
大大大大晴天11 小时前
Flink生产问题排障-Kryo serializer scala extensions are not available
大数据·flink
武子康2 天前
大数据-236 离线数仓 - 会员指标验证、DataX 导出与广告业务 ODS/DWD/ADS 全流程
大数据·后端·apache hive
武子康3 天前
大数据-235 离线数仓 - 实战:Flume+HDFS+Hive 搭建 ODS/DWD/DWS/ADS 会员分析链路
大数据·后端·apache hive
DianSan_ERP4 天前
电商API接口全链路监控:构建坚不可摧的线上运维防线
大数据·运维·网络·人工智能·git·servlet
够快云库4 天前
能源行业非结构化数据治理实战:从数据沼泽到智能资产
大数据·人工智能·机器学习·企业文件安全
AI周红伟4 天前
周红伟:智能体全栈构建实操:OpenClaw部署+Agent Skills+Seedance+RAG从入门到实战
大数据·人工智能·大模型·智能体
B站计算机毕业设计超人4 天前
计算机毕业设计Django+Vue.js高考推荐系统 高考可视化 大数据毕业设计(源码+LW文档+PPT+详细讲解)
大数据·vue.js·hadoop·django·毕业设计·课程设计·推荐算法
计算机程序猿学长4 天前
大数据毕业设计-基于django的音乐网站数据分析管理系统的设计与实现(源码+LW+部署文档+全bao+远程调试+代码讲解等)
大数据·django·课程设计
B站计算机毕业设计超人4 天前
计算机毕业设计Django+Vue.js音乐推荐系统 音乐可视化 大数据毕业设计 (源码+文档+PPT+讲解)
大数据·vue.js·hadoop·python·spark·django·课程设计