系统集成项目管理工程师-数据分析应用与数据安全

一、数据集成(掌握)

数据集成就是将驻留在不同数据源中的数据进行整合,向用户提供统一的数据视图,使得用户能以透明的方式访问数据。

1. 数据集成方法(3种)
方法 描述
模式集成(虚拟视图方法) 最早采用的数据集成方法,将各数据源共享的视图集成为全局模式,供用户透明地访问各数据源的数据
复制集成 将数据源中的数据复制到相关的其他数据源上,并对整体一致性进行维护。可以是整个数据源的复制,也可以是仅对变化数据的传播与复制
混合集成 保留虚拟数据模式视图为用户所用,同时提供数据复制的方法,以提高中间件系统性能
2. 数据访问接口(4种)
接口 描述
ODBC 用于数据库访问的应用程序编程接口(API),由应用程序接口、驱动程序管理器、驱动程序和数据源4个组件组成
JDBC 用于执行SQL语句的Java应用程序接口,由Java语言编写的类和接口组成,是一种规范
OLE DB 基于组件对象模型的数据存储对象,能提供对所有类型数据的操作,甚至能在离线情况下存取数据
ADO 应用层的接口,使用简单,易于学习,已成为常用的实现数据访问的主要手段之一。是COM自动接口,几乎所有数据库工具、应用程序开发环境和脚本语言都可以访问
3. Web Services技术

Web Services是一个面向访问的分布式计算模型,是实现Web数据和信息集成的有效机制。基于XML、SOAP、WSDL和UDDI等协议。

要素 说明
WSDL 基于XML格式的关于Web服务的描述语言
SOAP 消息传递的协议,规定了Web Services之间怎样传递信息
UDDI 创建注册服务的规范,用于集中存放和查找WSDL描述文件,起着目录服务器的作用

XML格式示例(了解即可):

XML 复制代码
<?xml version="1.0" encoding="UTF-8"?>
<student>
  <person>
    <id>001</id>
    <age>10</age>
    <name>张三</name>
  </person>
  <person>
    <id>002</id>
    <age>20</age>
    <name>李四</name>
  </person>
</student>
4. 数据网格技术

数据网格是一种用于大型数据集的分布式管理与分析的体系结构,目标是对分布、异构的海量数据进行一体化存储、管理、访问、传输与服务。

4种透明性

透明性 描述
分布透明性 用户感觉不到数据分布在不同的地方
异构透明性 用户感觉不到数据的异构性(存储方式、数据格式、管理系统不同)
数据位置透明性 用户不用知道数据源的具体位置
数据访问方式透明性 不同系统的数据访问方式不同,但访问结果相同

二、数据挖掘(掌握)

数据挖掘是指从大量数据中提取或"挖掘"知识。

1. 数据挖掘与传统数据分析的区别(4点)
区别 说明
数据量 数据挖掘所需数据量更大,数据量越大效果越好
分析方法 传统数据分析主要运用统计学方法;数据挖掘综合运用数据统计、人工智能、可视化等技术
分析侧重 传统数据分析是回顾型和验证型(分析已发生什么);数据挖掘是预测型和发现型(预测未来、解释原因)
成熟度 传统数据分析方法相当成熟;数据挖掘部分方法仍处于发展阶段
2. 数据挖掘的主要任务(5种)
任务 说明
数据总结 对数据进行浓缩,给出总体综合描述
关联分析 找出数据库中隐藏的关联网,描述一组数据项的密切度或关系,生成的规则带有置信度
分类和预测 使用分类函数或分类模型(分类器),根据数据属性将数据分派到不同组中,分析属性模型,预测新数据所属组
聚类分析 按照某种相近程度度量方法,将数据分成一系列有意义的子集合,同一集合内数据性质相近,不同集合间相差较大
孤立点分析 从数据库中检测出偏差
3. 数据挖掘流程(5个阶段)

数据挖掘流程阶段图

阶段 说明
确定分析对象 定义清晰的挖掘对象,认清数据挖掘的目标
数据准备 包括数据选择(搜索与挖掘对象有关的内外部数据)和数据预处理(清理、集成、变换、归约)
数据挖掘 运用各种方法对预处理后的数据进行挖掘,细分为模型构建(针对算法构建模型)和挖掘处理
结果评估 对结果进行解释和评估
结果应用 数据挖掘的结果经过决策人员许可后实际运用,以指导实践

三、数据服务(掌握)

服务 说明
数据目录服务 用来快捷地发现和定位所需数据资源的一种检索服务,是实现数据共享的重要基础功能
数据查询与浏览及下载服务 用户使用数据的方式有查询数据和下载数据两种
数据分发服务 数据的生产者通过各种方式将数据传送到用户的过程,核心内容包括数据发布、数据发现、数据评价等

四、数据可视化(掌握)

数据可视化根据展现数据的内容和角度不同,主要分为7类:

表现方式 说明
一维数据可视化 简单的线性数据,如文本或数字表格、程序源代码
二维数据可视化 由两种主要描述属性构成的数据,如宽度和高度、平面地图。最常见的是地理信息系统(GIS)
三维数据可视化 描述立体信息,可表示实际三维物体,构成计算机模型供操作及试验
多维数据可视化 所描述事物的属性超过三维,为了实现可视化往往需要降维
时态数据可视化 二维数据的一种特例(一维是时间轴),以图形方式显示随时间变化的数据
层次数据可视化 树形数据,每个节点有一个父节点(根节点除外),如商业组织、计算机文件系统、家谱图
网络数据可视化 节点与任意数量的其他节点有关系,没有固有层次结构,节点间可有多条连接路径

五、数据脱敏(掌握)

数据使用常常需要经过脱敏化处理,即对数据进行去隐私化处理,实现对敏感信息的保护。

1. 敏感数据

敏感数据可分为个人敏感数据、商业敏感数据、国家秘密数据等。通常将数据密级划分为5个等级:

等级 说明
L1 公开
L2 保密
L3 机密
L4 绝密
L5 私密
2. 数据脱敏方式

数据脱敏方式包括可恢复不可恢复两类:

  • 可恢复类:脱敏后的数据可通过一定方式恢复成原来的敏感数据,主要指各类加解密算法规则

  • 不可恢复类:脱敏后的数据被脱敏的部分使用任何方式都不能恢复,一般分为替换算法和生成算法两类

3. 数据脱敏原则(6个)
原则 说明
算法不可逆原则 除特定场合外,数据脱敏算法通常应当是不可逆的,防止使用非敏感数据推断、重建敏感原始数据
保持数据特征原则 脱敏后的数据应具有原数据的特征,因为仍将用于开发或测试场合
保留引用完整性原则 数据的引用完整性应予以保留,如果被脱敏的字段是数据表主键,相关的引用记录必须同步更改
规避融合风险原则 应当预判非敏感数据集多源融合可能造成的数据安全风险,对所有可能生成敏感数据的非敏感字段同样进行脱敏处理
脱敏过程自动化原则 脱敏过程必须在规则的引导下自动化进行,才能达到可用性要求
脱敏结果可重复原则 在某些场景下,对同一字段脱敏的每轮计算结果都相同或都不同,以满足数据使用方可测性、模型正确性、安全性等指标

📌 记忆口诀:不保保规自可(不可逆、保持特征、保留引用、规避融合、自动化、可重复)


六、数据分类(了解)

数据分类有分类对象分类依据两个要素。分类对象由若干个被分类的实体组成,分类依据取决于分类对象的属性或特征。


七、数据分级(掌握)

数据分级是指按照数据遭到破坏后对国家安全、社会秩序、公共利益以及公民、法人和其他组织的合法权益(受侵害客体)的危害程度,对数据进行定级,主要为数据全生命周期管理进行安全策略制定。

常用分级维度:按特性分级、基于价值(公开、内部、重要核心等)、基于敏感程度(公开、秘密、机密、绝密等)、基于司法影响范围(境内、跨区、跨境等)。

数据分级基本框架(3个级别)

数据分级框架表

本级别 影响对象:国家安全 公共利益 个人合法权益 组织合法权益
核心数据 一般危害、严重危害 严重危害 --- ---
重要数据 轻微危害 一般危害、轻微危害 --- ---
一般数据 无危害 无危害 无危害~严重危害 无危害~严重危害

数据处理者可在基本框架定级的基础上,结合行业数据分类分级规则或组织生产经营需求,考虑影响对象、影响程度两个要素进行分级。


本章真题小测(第三篇)

Q1:关于数据集成定义的描述较为准确的是()。

A. 通过应用软件接口,将不同系统的数据进行共享

B. 将不同表单中的结构化数据融合为一个表单

C. 通过网络或数据标准,实现数据的共享与交换

D. 将驻留在不同数据源中的数据进行整合

Q2:为了更加有效地管理敏感数据,通常会对敏感数据的敏感程度进行划分,以下属于常见程度划分的是()。

A. L1(公开)、L2(保密)、L3(机密)、L4(绝密)、L5(私密)

B. L1(个人)、L2(组织)、L3(商业)、L4(技术)、L5(国家)

C. L1(公共)、L2(保密)、L3(机密)、L3(加密)、L5(绝密)

D. L1(互联网)、L2(局域网)、L3(保密网)、L4(专网)、L5(绝密网)

Q3:数据挖掘的主要任务中,()是从数据库中检测出偏差。

A. 数据总结 B. 关联分析 C. 聚类分析 D. 孤立点分析

📩 答案:

Q1 答案:D 解析:

数据集成:把分布在不同数据源的数据进行整合、合并,解决数据异构、冲突问题。

  • A:仅接口共享,只是集成的一种实现方式,不是完整定义。
  • B:只说结构化表单,范围太局限,数据集成包含非结构化等多种数据。
  • C:侧重共享交换,偏向数据交换,不是集成。
  • D:将驻留在不同数据源中的数据进行整合,是数据集成的标准定义。

Q2 答案:A 解析:

敏感数据分级常见级别:L1 (公开)、L2 (保密)、L3 (机密)、L4 (绝密)、L5 (私密)

  • B 是按数据所属主体分类,不是敏感程度;
  • C 出现重复 L3,级别定义错误;
  • D 是按网络环境划分,不是数据敏感等级。

Q3 答案:D 解析:

  • D 孤立点分析:专门检测数据中的异常、偏差、离群点。
  • A 数据总结:对数据做概括、汇总描述。
  • B 关联分析:挖掘数据之间的关联规则。
  • C 聚类分析:把相似数据归为一类。

✅汇总答案

Q1:D;Q2:A;Q3:D

相关推荐
一米阳光86615 小时前
软考(中级)软件设计师核心笔记(9)算法——时间复杂度与空间复杂度、查找算法、排序算法
笔记·算法·职场发展·软考·软件设计师·中级职称
不剪发的Tony老师1 天前
Dash:一款免费开源、本地优先的数据探索与可视化工具
数据分析·数据可视化·dash
davawang1 天前
数据虚拟化技术解析:从概念到实践
数据分析·数据平台·管理工具
数模竞赛Paid answer1 天前
2026年华东杯数学建模C题收益率预测问题解题全过程文档及程序
算法·数学建模·数据分析·华东杯
一米阳光86611 天前
软考(中级)软件设计师核心笔记(8)数据结构——树与二叉树
数据结构·笔记·职场发展·软考·软件设计师·中级职称
能年玲奈喝榴莲牛奶1 天前
系统规划与管理师-第一章-考点记忆
大数据·数据库·软考·系统规划与管理师·系规
basketball6161 天前
软考中级网络工程师 第6章 网络安全 备考总结
大数据·网络·web安全·网络工程师·软考
躺柒1 天前
读数据可视化02数据科学的发展
信息可视化·数据分析·数据可视化·数据科学·大数据分析·图形展示
cc5725026531 天前
大专学生可以考哪些实用证书
数据分析