读数据架构知识体系指南14数据编织

1. 数据编织

1.1. 数据编织是现代数据仓库构架(MDW)的进化

  • 1.1.1. 构建在MDW上的更高级层,其提高了数据的可访问性、安全性、可发现性和可用性

1.2. 数据编织贯穿整个公司,累积了所有数据,将其提供给所有需要的人

1.3. 无论数据的大小、速度或类型如何,这种架构都能使用数据

1.4. 数据结构解决方案可以使用组织内的所有数据

1.5. 数据编织是一种设计理念,是数据和连接流程的集成层(结构)​

  • 1.5.1. 利用对现有的、可发现的和可推断的元数据资产进行持续分析,以支持设计、部署和利用所有环境中集成的和可重用的数据,包括混合和多云数据以及多元平台

1.6. 数据编织是为云构建新方案的最广泛应用方案,尤其针对海量数据(超过10T)

1.7. 包含了所有MDW组件,增加某些特性

2. 关键组件

2.1. 数据访问策略

  • 2.1.1. 数据访问策略是数据治理的关键

  • 2.1.2. 由一系列指导方针、规则和程序组成,用于控制组织内谁有权访问哪些信息、如何使用这些信息以及何时允许或拒绝访问

  • 2.1.3. 有助于确保敏感数据的安全性、隐私性和完整性,并遵守相关法律法规

  • 2.1.4. 政策通常涵盖数据分类、用户认证和授权、数据加密、数据保留、数据备份和恢复以及数据处置等主题

  • 2.1.5. 组织内的所有数据请求必须遵循其既定数据访问策略,并且必须通过API、驱动程序或数据虚拟化等相应机制进行处理,以确保符合法规

  • 2.1.6. 为促进这种受控访问,该机构可能会实施与安全身份验证系统接口的API

2.2. 元数据目录

  • 2.2.1. 包含元数据目录:存储数据资产信息(包括其结构、关系和特征)的存储库

  • 2.2.2. 提供了一种集中、有序的方式来管理和发现数据,使用户更容易找到和理解所需的数据

  • 2.2.3. 目录的一个重要部分是数据血缘(data linage),即任何给定数据的历史记录:包括数据来源、转换方式和存储位置

    • 2.2.3.1. 数据血缘用于遵守数据隐私法等法规

    • 2.2.3.2. 可借此追溯数据的来源及转换过程,这是了解数据创建方式及其可靠性的重要部分

2.3. 主数据管理

  • 2.3.1. MDM

  • 2.3.2. 是收集、整合和维护来自公司内部各来源的一致准确数据的过程,以创建单一权威的主数据来源

  • 2.3.3. 数据通常是非跨部门的,描述公司的关键实体

  • 2.3.4. 可帮助公司做出明智决策,避免重复记录、不一致和信息错误等与数据相关的问题

2.4. 数据虚拟化

  • 2.4.1. 是一种软件架构,它允许应用程序和最终用户访问来自多个数据源的数据,*就像这些数据存储在单一位置一样

  • 2.4.2. 虚拟化数据存储在一个逻辑层中,作为终端用户和数据源之间的中介

  • 2.4.3. 虚拟层是一个单一的访问点,它抽象了底层数据源的复杂性,使最终用户可以轻松地实时访问和组合来自多个数据源的数据,而无须复制或物理集成数据

  • 2.4.4. 使用数据虚拟化,这代表无须连接所有数据源

  • 2.4.5. 在多数情况,数据虚拟化只用于少量场景中,大多数数据仍被集中管理

2.5. 实时处理

  • 2.5.1. 是一旦数据可用,就立即处理数据并生成结果,不会有任何明显的延迟

2.6. 应用程序接口

  • 2.6.1. 与依赖连接字符串不同,应用程序接口(API)以标准化的方式从各种来源提供数据,而无须共享数据所在位置的具体细节

  • 2.6.2. 数据位置发生变化,你只需更新API内部代码,调用该API的任何应用程序都不会受到影响

    • 2.6.2.1. 更容易利用新技术
  • 2.6.3. 采用多种类型的安全措施

    • 2.6.3.1. 其具有安全过滤的灵活性,对相应的用户可访问对应的数据进行更细致控制

2.7. 服务

  • 2.7.1. 可以以"块"的形式构建,这样更易重用

2.8. 产品

  • 2.8.1. 整个数据编织可捆绑成一个产品并销售

  • 2.8.2. 如果专为某一行业(如医疗保健行业)制造,这种产品将特别具有吸引力

3. 迁移到数据编织的理由

3.1. 数据编织在设计时就考虑到了可扩展性

3.2. 其固有的灵活性使其能够随时适应各种数据类型和来源,从而适应当前的数据需求,并在一定程度上面向未来

3.3. 数据编织可以将不同的数据源无缝地编织在一起,提供单一、统一的数据视图,使处理多方面数据流变得更加容易和高效

3.4. 在瞬息万变的商业环境中,实时处理数据并立即获得洞察力的能力至关重要

  • 3.4.1. 数据编织通过支持实时数据处理来满足这一需求,使企业能够即时访问最新数据

  • 3.4.2. 保持实时更新不仅仅是优势还是必需品

  • 3.4.3. 支持实时数据处理从而使商业保持敏捷、明智并随时准备做出调整

3.5. 随着对数据泄露担忧增长以及对数据法规遵守的重视日益增强,数据安全和管理变得日益重要

  • 3.5.1. 数据编织通过高级访问策略解决这些问题,提供了更安全数据环境

  • 3.5.2. 通过限制授权用户访问方式增加了数据管理,保护敏感信息免受潜在威胁

4. 潜在缺陷

4.1. 从MDW过渡到数据编织可能会耗费大量资源,初期会遇到成本、培训和集成方面的问题

4.2. 并非所有企业都需要数据编织的高级功能

  • 4.2.1. 对于数据源有限、处理需求简单的小型企业来说,MDW可能就足够了

4.3. 数据结构固有的复杂性也会增加故障排除的难度

  • 4.3.1. 在迁移前,应确保组织内部拥有或可通过合作伙伴获得所需的专业知识

4.4. 虽然数据编织为现代数据管理提供了先进的解决方案,但每个企业都必须评估各自需求、潜在投资回报和长期战略目标,而后才能进行迁移

  • 4.4.1. 每个组织在采用这种前沿解决方案之前,都应仔细评估自身需求和能力
相关推荐
计算机毕业编程指导师1 小时前
大数据毕设怎么做?基于Hadoop的多源社交媒体心理健康情感分析与可视化系统从零到一指导 源码 毕业设计 选题推荐 毕设选题 数据分析 机器学习 深度学习
大数据·hadoop·计算机·数据分析·毕业设计·课程设计·媒体
计算机毕业设计杰瑞2 小时前
【最新原创大数据】基于大数据的酒店数据分析与可视化,附源码_高质量项目_可视化_数据分析_毕设选题推荐_SPark_Hadoop_毕设指导
大数据·信息可视化·数据挖掘·课程设计
PaperData2 小时前
2001-2025年上市公司数智化水平数据
数据分析
YangYang9YangYan2 小时前
2027 秋招|应用统计学专业投递快消市场部,岗位 JD 拆解与统计能力落地
人工智能·数据分析
计算机毕业编程指导师3 小时前
Python大数据毕设:基于Hadoop的病毒式社交媒体趋势和参与度分析系统怎么做 源码 毕业设计 选题推荐 毕设选题 数据分析 机器学习
大数据·hadoop·python·计算机·毕业设计·课程设计·社交媒体
计算机毕业编程指导师3 小时前
【计算机毕设选题推荐】基于Spark与Hadoop的AI就业收入区域差异分析系统 源码 毕业设计 选题推荐 毕设选题 数据分析 机器学习 深度学习
大数据·python·数据分析·spark·毕业设计·课程设计·ai就业收入
小猴子爱上树3 小时前
跨马翻译:批量图片翻译与视频字幕、智能抠图一站式在线图片翻译工具
大数据·人工智能·python·音视频
W***25923 小时前
2026 企业 AI 办公工具选型指南:能力评估与平台全景分析
大数据·人工智能
EasyBr指纹浏览器3 小时前
抖音账号诊断:公开作品样本能说明什么?
数据分析·开源·内容运营·抖音