系统集成项目管理工程师-数据分析应用与数据安全

一、数据集成(掌握)

数据集成就是将驻留在不同数据源中的数据进行整合,向用户提供统一的数据视图,使得用户能以透明的方式访问数据。

1. 数据集成方法(3种)
方法 描述
模式集成(虚拟视图方法) 最早采用的数据集成方法,将各数据源共享的视图集成为全局模式,供用户透明地访问各数据源的数据
复制集成​ 将数据源中的数据复制到相关的其他数据源上,并对整体一致性进行维护。可以是整个数据源的复制,也可以是仅对变化数据的传播与复制
混合集成​ 保留虚拟数据模式视图为用户所用,同时提供数据复制的方法,以提高中间件系统性能
2. 数据访问接口(4种)
接口 描述
ODBC​ 用于数据库访问的应用程序编程接口(API),由应用程序接口、驱动程序管理器、驱动程序和数据源4个组件组成
JDBC​ 用于执行SQL语句的Java应用程序接口,由Java语言编写的类和接口组成,是一种规范
OLE DB​ 基于组件对象模型的数据存储对象,能提供对所有类型数据的操作,甚至能在离线情况下存取数据
ADO​ 应用层的接口,使用简单,易于学习,已成为常用的实现数据访问的主要手段之一。是COM自动接口,几乎所有数据库工具、应用程序开发环境和脚本语言都可以访问
3. Web Services技术

Web Services是一个面向访问的分布式计算模型,是实现Web数据和信息集成的有效机制。基于XML、SOAP、WSDL和UDDI等协议。

要素 说明
WSDL​ 基于XML格式的关于Web服务的描述语言
SOAP​ 消息传递的协议,规定了Web Services之间怎样传递信息
UDDI​ 创建注册服务的规范,用于集中存放和查找WSDL描述文件,起着目录服务器的作用

XML格式示例(了解即可):

XML 复制代码
<?xml version="1.0" encoding="UTF-8"?>
<student>
  <person>
    <id>001</id>
    <age>10</age>
    <name>张三</name>
  </person>
  <person>
    <id>002</id>
    <age>20</age>
    <name>李四</name>
  </person>
</student>
4. 数据网格技术

数据网格是一种用于大型数据集的分布式管理与分析的体系结构,目标是对分布、异构的海量数据进行一体化存储、管理、访问、传输与服务。

4种透明性:

透明性 描述
分布透明性​ 用户感觉不到数据分布在不同的地方
异构透明性​ 用户感觉不到数据的异构性(存储方式、数据格式、管理系统不同)
数据位置透明性​ 用户不用知道数据源的具体位置
数据访问方式透明性​ 不同系统的数据访问方式不同,但访问结果相同

二、数据挖掘(掌握)

数据挖掘是指从大量数据中提取或"挖掘"知识。

1. 数据挖掘与传统数据分析的区别(4点)
区别 说明
数据量​ 数据挖掘所需数据量更大,数据量越大效果越好
分析方法​ 传统数据分析主要运用统计学方法;数据挖掘综合运用数据统计、人工智能、可视化等技术
分析侧重​ 传统数据分析是回顾型和验证型(分析已发生什么);数据挖掘是预测型和发现型(预测未来、解释原因)
成熟度​ 传统数据分析方法相当成熟;数据挖掘部分方法仍处于发展阶段
2. 数据挖掘的主要任务(5种)
任务 说明
数据总结​ 对数据进行浓缩,给出总体综合描述
关联分析​ 找出数据库中隐藏的关联网,描述一组数据项的密切度或关系,生成的规则带有置信度
分类和预测​ 使用分类函数或分类模型(分类器),根据数据属性将数据分派到不同组中,分析属性模型,预测新数据所属组
聚类分析​ 按照某种相近程度度量方法,将数据分成一系列有意义的子集合,同一集合内数据性质相近,不同集合间相差较大
孤立点分析​ 从数据库中检测出偏差
3. 数据挖掘流程(5个阶段)

数据挖掘流程阶段图

阶段 说明
确定分析对象​ 定义清晰的挖掘对象,认清数据挖掘的目标
数据准备​ 包括数据选择(搜索与挖掘对象有关的内外部数据)和数据预处理(清理、集成、变换、归约)
数据挖掘​ 运用各种方法对预处理后的数据进行挖掘,细分为模型构建(针对算法构建模型)和挖掘处理
结果评估​ 对结果进行解释和评估
结果应用​ 数据挖掘的结果经过决策人员许可后实际运用,以指导实践

三、数据服务(掌握)

服务 说明
数据目录服务​ 用来快捷地发现和定位所需数据资源的一种检索服务,是实现数据共享的重要基础功能
数据查询与浏览及下载服务​ 用户使用数据的方式有查询数据和下载数据两种
数据分发服务​ 数据的生产者通过各种方式将数据传送到用户的过程,核心内容包括数据发布、数据发现、数据评价等

四、数据可视化(掌握)

数据可视化根据展现数据的内容和角度不同,主要分为7类:

表现方式 说明
一维数据可视化​ 简单的线性数据,如文本或数字表格、程序源代码
二维数据可视化​ 由两种主要描述属性构成的数据,如宽度和高度、平面地图。最常见的是地理信息系统(GIS)
三维数据可视化​ 描述立体信息,可表示实际三维物体,构成计算机模型供操作及试验
多维数据可视化​ 所描述事物的属性超过三维,为了实现可视化往往需要降维
时态数据可视化​ 二维数据的一种特例(一维是时间轴),以图形方式显示随时间变化的数据
层次数据可视化​ 树形数据,每个节点有一个父节点(根节点除外),如商业组织、计算机文件系统、家谱图
网络数据可视化​ 节点与任意数量的其他节点有关系,没有固有层次结构,节点间可有多条连接路径

五、数据脱敏(掌握)

数据使用常常需要经过脱敏化处理,即对数据进行去隐私化处理,实现对敏感信息的保护。

1. 敏感数据

敏感数据可分为个人敏感数据、商业敏感数据、国家秘密数据等。通常将数据密级划分为5个等级:

等级 说明
L1 公开
L2 保密
L3 机密
L4 绝密
L5 私密
2. 数据脱敏方式

数据脱敏方式包括可恢复 与不可恢复两类:

  • 可恢复类:脱敏后的数据可通过一定方式恢复成原来的敏感数据,主要指各类加解密算法规则

  • 不可恢复类:脱敏后的数据被脱敏的部分使用任何方式都不能恢复,一般分为替换算法和生成算法两类

3. 数据脱敏原则(6个)
原则 说明
算法不可逆原则​ 除特定场合外,数据脱敏算法通常应当是不可逆的,防止使用非敏感数据推断、重建敏感原始数据
保持数据特征原则​ 脱敏后的数据应具有原数据的特征,因为仍将用于开发或测试场合
保留引用完整性原则​ 数据的引用完整性应予以保留,如果被脱敏的字段是数据表主键,相关的引用记录必须同步更改
规避融合风险原则​ 应当预判非敏感数据集多源融合可能造成的数据安全风险,对所有可能生成敏感数据的非敏感字段同样进行脱敏处理
脱敏过程自动化原则​ 脱敏过程必须在规则的引导下自动化进行,才能达到可用性要求
脱敏结果可重复原则​ 在某些场景下,对同一字段脱敏的每轮计算结果都相同或都不同,以满足数据使用方可测性、模型正确性、安全性等指标

📌 记忆口诀:不保保规自可(不可逆、保持特征、保留引用、规避融合、自动化、可重复)


六、数据分类(了解)

数据分类有分类对象 和分类依据两个要素。分类对象由若干个被分类的实体组成,分类依据取决于分类对象的属性或特征。


七、数据分级(掌握)

数据分级是指按照数据遭到破坏后对国家安全、社会秩序、公共利益以及公民、法人和其他组织的合法权益(受侵害客体)的危害程度,对数据进行定级,主要为数据全生命周期管理进行安全策略制定。

常用分级维度:按特性分级、基于价值(公开、内部、重要核心等)、基于敏感程度(公开、秘密、机密、绝密等)、基于司法影响范围(境内、跨区、跨境等)。

数据分级基本框架(3个级别)

数据分级框架表

本级别 影响对象:国家安全 公共利益 个人合法权益 组织合法权益
核心数据​ 一般危害、严重危害 严重危害 --- ---
重要数据​ 轻微危害 一般危害、轻微危害 --- ---
一般数据​ 无危害 无危害 无危害~严重危害 无危害~严重危害

数据处理者可在基本框架定级的基础上,结合行业数据分类分级规则或组织生产经营需求,考虑影响对象、影响程度两个要素进行分级。


本章真题小测(第三篇)

Q1:关于数据集成定义的描述较为准确的是()。

A. 通过应用软件接口,将不同系统的数据进行共享

B. 将不同表单中的结构化数据融合为一个表单

C. 通过网络或数据标准,实现数据的共享与交换

D. 将驻留在不同数据源中的数据进行整合

Q2:为了更加有效地管理敏感数据,通常会对敏感数据的敏感程度进行划分,以下属于常见程度划分的是()。

A. L1(公开)、L2(保密)、L3(机密)、L4(绝密)、L5(私密)

B. L1(个人)、L2(组织)、L3(商业)、L4(技术)、L5(国家)

C. L1(公共)、L2(保密)、L3(机密)、L3(加密)、L5(绝密)

D. L1(互联网)、L2(局域网)、L3(保密网)、L4(专网)、L5(绝密网)

Q3:数据挖掘的主要任务中,()是从数据库中检测出偏差。

A. 数据总结 B. 关联分析 C. 聚类分析 D. 孤立点分析

📩 答案:

Q1 答案:D 解析:

数据集成:把分布在不同数据源的数据进行整合、合并,解决数据异构、冲突问题。

  • A:仅接口共享,只是集成的一种实现方式,不是完整定义。
  • B:只说结构化表单,范围太局限,数据集成包含非结构化等多种数据。
  • C:侧重共享交换,偏向数据交换,不是集成。
  • D:将驻留在不同数据源中的数据进行整合,是数据集成的标准定义。

Q2 答案:A 解析:

敏感数据分级常见级别:L1 (公开)、L2 (保密)、L3 (机密)、L4 (绝密)、L5 (私密)。

  • B 是按数据所属主体分类,不是敏感程度;
  • C 出现重复 L3,级别定义错误;
  • D 是按网络环境划分,不是数据敏感等级。

Q3 答案:D 解析:

  • D 孤立点分析:专门检测数据中的异常、偏差、离群点。
  • A 数据总结:对数据做概括、汇总描述。
  • B 关联分析:挖掘数据之间的关联规则。
  • C 聚类分析:把相似数据归为一类。

✅汇总答案

Q1:D;Q2:A;Q3:D

相关推荐
Asa121384 天前
R语言实现多组学因子分析(MOFA)
数据分析
漂着的圆木4 天前
Agent 功能参与度:Copilot 怎么算
sql·数据分析·agent·githubcopilot·度量
paopaokaka_luck4 天前
智慧社区综合服务小程序(人脸识别、AI问答、Echarts图形化分析)
前端·javascript·spring boot·spring·数据分析·echarts
Aloudata4 天前
语义层和SQL Copilot:一个降低写SQL门槛,一个统一业务逻辑
大数据·人工智能·数据分析·data agent·语义层
IT研究室4 天前
最新大数据毕业设计选题推荐-基于大数据的信用等级数据分析与可视化-大数据-Spark-Hadoop-Bigdata
大数据·信息可视化·数据分析·spark·课程设计
paopaokaka_luck4 天前
考研政治刷题小程序(AI推荐题目、ECharts数据分析、章节练习与专项训练、模拟考试、错题本与收藏夹、学习打卡与目标管理、题库和组卷维护)
前端·javascript·spring boot·spring·数据分析·echarts
2601_960620374 天前
2026校招市场策略岗项目准备指南:调研/竞品/活动/竞赛4类项目
数据分析
SelectDB4 天前
同等资源下 Apache Doris 4.2 vs StarRocks 4.1.1:1TB SSB 与 TPC-H 性能实测
大数据·数据库·数据分析
SelectDB5 天前
Doris vs ClickHouse:企业 OLAP 走向下一阶段,两种技术路线如何选择
大数据·数据库·数据分析
AI职业加油站5 天前
数据要素价值释放年:大数据治理工程师,站上职业新风口
人工智能·学习·职场和发展·数据分析·职场发展