一、数据集成(掌握)
数据集成就是将驻留在不同数据源中的数据进行整合,向用户提供统一的数据视图,使得用户能以透明的方式访问数据。
1. 数据集成方法(3种)
| 方法 | 描述 |
|---|---|
| 模式集成(虚拟视图方法) | 最早采用的数据集成方法,将各数据源共享的视图集成为全局模式,供用户透明地访问各数据源的数据 |
| 复制集成 | 将数据源中的数据复制到相关的其他数据源上,并对整体一致性进行维护。可以是整个数据源的复制,也可以是仅对变化数据的传播与复制 |
| 混合集成 | 保留虚拟数据模式视图为用户所用,同时提供数据复制的方法,以提高中间件系统性能 |
2. 数据访问接口(4种)
| 接口 | 描述 |
|---|---|
| ODBC | 用于数据库访问的应用程序编程接口(API),由应用程序接口、驱动程序管理器、驱动程序和数据源4个组件组成 |
| JDBC | 用于执行SQL语句的Java应用程序接口,由Java语言编写的类和接口组成,是一种规范 |
| OLE DB | 基于组件对象模型的数据存储对象,能提供对所有类型数据的操作,甚至能在离线情况下存取数据 |
| ADO | 应用层的接口,使用简单,易于学习,已成为常用的实现数据访问的主要手段之一。是COM自动接口,几乎所有数据库工具、应用程序开发环境和脚本语言都可以访问 |
3. Web Services技术
Web Services是一个面向访问的分布式计算模型,是实现Web数据和信息集成的有效机制。基于XML、SOAP、WSDL和UDDI等协议。
| 要素 | 说明 |
|---|---|
| WSDL | 基于XML格式的关于Web服务的描述语言 |
| SOAP | 消息传递的协议,规定了Web Services之间怎样传递信息 |
| UDDI | 创建注册服务的规范,用于集中存放和查找WSDL描述文件,起着目录服务器的作用 |
XML格式示例(了解即可):
XML
<?xml version="1.0" encoding="UTF-8"?>
<student>
<person>
<id>001</id>
<age>10</age>
<name>张三</name>
</person>
<person>
<id>002</id>
<age>20</age>
<name>李四</name>
</person>
</student>
4. 数据网格技术
数据网格是一种用于大型数据集的分布式管理与分析的体系结构,目标是对分布、异构的海量数据进行一体化存储、管理、访问、传输与服务。
4种透明性:
| 透明性 | 描述 |
|---|---|
| 分布透明性 | 用户感觉不到数据分布在不同的地方 |
| 异构透明性 | 用户感觉不到数据的异构性(存储方式、数据格式、管理系统不同) |
| 数据位置透明性 | 用户不用知道数据源的具体位置 |
| 数据访问方式透明性 | 不同系统的数据访问方式不同,但访问结果相同 |
二、数据挖掘(掌握)
数据挖掘是指从大量数据中提取或"挖掘"知识。
1. 数据挖掘与传统数据分析的区别(4点)
| 区别 | 说明 |
|---|---|
| 数据量 | 数据挖掘所需数据量更大,数据量越大效果越好 |
| 分析方法 | 传统数据分析主要运用统计学方法;数据挖掘综合运用数据统计、人工智能、可视化等技术 |
| 分析侧重 | 传统数据分析是回顾型和验证型(分析已发生什么);数据挖掘是预测型和发现型(预测未来、解释原因) |
| 成熟度 | 传统数据分析方法相当成熟;数据挖掘部分方法仍处于发展阶段 |
2. 数据挖掘的主要任务(5种)
| 任务 | 说明 |
|---|---|
| 数据总结 | 对数据进行浓缩,给出总体综合描述 |
| 关联分析 | 找出数据库中隐藏的关联网,描述一组数据项的密切度或关系,生成的规则带有置信度 |
| 分类和预测 | 使用分类函数或分类模型(分类器),根据数据属性将数据分派到不同组中,分析属性模型,预测新数据所属组 |
| 聚类分析 | 按照某种相近程度度量方法,将数据分成一系列有意义的子集合,同一集合内数据性质相近,不同集合间相差较大 |
| 孤立点分析 | 从数据库中检测出偏差 |
3. 数据挖掘流程(5个阶段)
数据挖掘流程阶段图
| 阶段 | 说明 |
|---|---|
| 确定分析对象 | 定义清晰的挖掘对象,认清数据挖掘的目标 |
| 数据准备 | 包括数据选择(搜索与挖掘对象有关的内外部数据)和数据预处理(清理、集成、变换、归约) |
| 数据挖掘 | 运用各种方法对预处理后的数据进行挖掘,细分为模型构建(针对算法构建模型)和挖掘处理 |
| 结果评估 | 对结果进行解释和评估 |
| 结果应用 | 数据挖掘的结果经过决策人员许可后实际运用,以指导实践 |
三、数据服务(掌握)
| 服务 | 说明 |
|---|---|
| 数据目录服务 | 用来快捷地发现和定位所需数据资源的一种检索服务,是实现数据共享的重要基础功能 |
| 数据查询与浏览及下载服务 | 用户使用数据的方式有查询数据和下载数据两种 |
| 数据分发服务 | 数据的生产者通过各种方式将数据传送到用户的过程,核心内容包括数据发布、数据发现、数据评价等 |
四、数据可视化(掌握)
数据可视化根据展现数据的内容和角度不同,主要分为7类:
| 表现方式 | 说明 |
|---|---|
| 一维数据可视化 | 简单的线性数据,如文本或数字表格、程序源代码 |
| 二维数据可视化 | 由两种主要描述属性构成的数据,如宽度和高度、平面地图。最常见的是地理信息系统(GIS) |
| 三维数据可视化 | 描述立体信息,可表示实际三维物体,构成计算机模型供操作及试验 |
| 多维数据可视化 | 所描述事物的属性超过三维,为了实现可视化往往需要降维 |
| 时态数据可视化 | 二维数据的一种特例(一维是时间轴),以图形方式显示随时间变化的数据 |
| 层次数据可视化 | 树形数据,每个节点有一个父节点(根节点除外),如商业组织、计算机文件系统、家谱图 |
| 网络数据可视化 | 节点与任意数量的其他节点有关系,没有固有层次结构,节点间可有多条连接路径 |
五、数据脱敏(掌握)
数据使用常常需要经过脱敏化处理,即对数据进行去隐私化处理,实现对敏感信息的保护。
1. 敏感数据
敏感数据可分为个人敏感数据、商业敏感数据、国家秘密数据等。通常将数据密级划分为5个等级:
| 等级 | 说明 |
|---|---|
| L1 | 公开 |
| L2 | 保密 |
| L3 | 机密 |
| L4 | 绝密 |
| L5 | 私密 |
2. 数据脱敏方式
数据脱敏方式包括可恢复 与不可恢复两类:
-
可恢复类:脱敏后的数据可通过一定方式恢复成原来的敏感数据,主要指各类加解密算法规则
-
不可恢复类:脱敏后的数据被脱敏的部分使用任何方式都不能恢复,一般分为替换算法和生成算法两类
3. 数据脱敏原则(6个)
| 原则 | 说明 |
|---|---|
| 算法不可逆原则 | 除特定场合外,数据脱敏算法通常应当是不可逆的,防止使用非敏感数据推断、重建敏感原始数据 |
| 保持数据特征原则 | 脱敏后的数据应具有原数据的特征,因为仍将用于开发或测试场合 |
| 保留引用完整性原则 | 数据的引用完整性应予以保留,如果被脱敏的字段是数据表主键,相关的引用记录必须同步更改 |
| 规避融合风险原则 | 应当预判非敏感数据集多源融合可能造成的数据安全风险,对所有可能生成敏感数据的非敏感字段同样进行脱敏处理 |
| 脱敏过程自动化原则 | 脱敏过程必须在规则的引导下自动化进行,才能达到可用性要求 |
| 脱敏结果可重复原则 | 在某些场景下,对同一字段脱敏的每轮计算结果都相同或都不同,以满足数据使用方可测性、模型正确性、安全性等指标 |
📌 记忆口诀:不保保规自可(不可逆、保持特征、保留引用、规避融合、自动化、可重复)
六、数据分类(了解)
数据分类有分类对象 和分类依据两个要素。分类对象由若干个被分类的实体组成,分类依据取决于分类对象的属性或特征。
七、数据分级(掌握)
数据分级是指按照数据遭到破坏后对国家安全、社会秩序、公共利益以及公民、法人和其他组织的合法权益(受侵害客体)的危害程度,对数据进行定级,主要为数据全生命周期管理进行安全策略制定。
常用分级维度:按特性分级、基于价值(公开、内部、重要核心等)、基于敏感程度(公开、秘密、机密、绝密等)、基于司法影响范围(境内、跨区、跨境等)。
数据分级基本框架(3个级别)
数据分级框架表
| 本级别 | 影响对象:国家安全 | 公共利益 | 个人合法权益 | 组织合法权益 |
|---|---|---|---|---|
| 核心数据 | 一般危害、严重危害 | 严重危害 | --- | --- |
| 重要数据 | 轻微危害 | 一般危害、轻微危害 | --- | --- |
| 一般数据 | 无危害 | 无危害 | 无危害~严重危害 | 无危害~严重危害 |
数据处理者可在基本框架定级的基础上,结合行业数据分类分级规则或组织生产经营需求,考虑影响对象、影响程度两个要素进行分级。
本章真题小测(第三篇)
Q1:关于数据集成定义的描述较为准确的是()。
A. 通过应用软件接口,将不同系统的数据进行共享
B. 将不同表单中的结构化数据融合为一个表单
C. 通过网络或数据标准,实现数据的共享与交换
D. 将驻留在不同数据源中的数据进行整合
Q2:为了更加有效地管理敏感数据,通常会对敏感数据的敏感程度进行划分,以下属于常见程度划分的是()。
A. L1(公开)、L2(保密)、L3(机密)、L4(绝密)、L5(私密)
B. L1(个人)、L2(组织)、L3(商业)、L4(技术)、L5(国家)
C. L1(公共)、L2(保密)、L3(机密)、L3(加密)、L5(绝密)
D. L1(互联网)、L2(局域网)、L3(保密网)、L4(专网)、L5(绝密网)
Q3:数据挖掘的主要任务中,()是从数据库中检测出偏差。
A. 数据总结 B. 关联分析 C. 聚类分析 D. 孤立点分析
📩 答案:
Q1 答案:D 解析:
数据集成:把分布在不同数据源的数据进行整合、合并,解决数据异构、冲突问题。
- A:仅接口共享,只是集成的一种实现方式,不是完整定义。
- B:只说结构化表单,范围太局限,数据集成包含非结构化等多种数据。
- C:侧重共享交换,偏向数据交换,不是集成。
- D:将驻留在不同数据源中的数据进行整合,是数据集成的标准定义。
Q2 答案:A 解析:
敏感数据分级常见级别:L1 (公开)、L2 (保密)、L3 (机密)、L4 (绝密)、L5 (私密)。
- B 是按数据所属主体分类,不是敏感程度;
- C 出现重复 L3,级别定义错误;
- D 是按网络环境划分,不是数据敏感等级。
Q3 答案:D 解析:
- D 孤立点分析:专门检测数据中的异常、偏差、离群点。
- A 数据总结:对数据做概括、汇总描述。
- B 关联分析:挖掘数据之间的关联规则。
- C 聚类分析:把相似数据归为一类。
✅汇总答案
Q1:D;Q2:A;Q3:D