19. 大数据- 湖仓一体&BI - 阿里云实践


阿里云DataWorks,MaxCompute,hologres,OSS,函数计算FC,Quick BI


阿里云经典的"数据湖仓一体 + Serverless 计算 + BI 可视化"技术栈。


1. OSS (对象存储服务)

  • 简介 :海量、安全、低成本的云存储基础设施。在上述技术栈中,它通常作为数据湖的底座,存放原始日志、CSV/Parquet 文件、模型文件等。
  • 基本使用
    1. 创建 Bucket(选择与 MaxCompute/Hologres 相同的地域以减少流量费)。
    2. 上传数据:通过控制台、ossutil 命令行或 SDK 上传文件。
    3. 配置生命周期:设置冷热数据分层或自动过期删除以降低成本。
    4. 授权:为 DataWorks/MaxCompute 配置 RAM 角色,允许其读取 OSS 数据。

2. MaxCompute (原 ODPS)

  • 简介:企业级 SaaS 模式云数仓,专为 TB/PB 级离线批处理设计。按量付费或包年包月,无需运维集群,是数据加工的核心引擎。
  • 基本使用
    1. 开通服务并创建项目空间(建议分开发/生产环境)。
    2. 建表与导入:使用 DDL 建表,通过 Tunnel 命令或 DataWorks 数据集成将 OSS/RDS 数据同步入仓。
    3. SQL 开发:在 DataWorks 数据开发界面编写 ODPS SQL 进行 ETL 清洗。
    4. 任务调度:配置依赖关系和周期调度,实现自动化数据流水线。

3. Hologres

  • 简介 :兼容 PostgreSQL 协议的实时数仓。最大特点是与 MaxCompute 底层存储互通,支持高并发点查和亚秒级 OLAP 分析,常用于数据服务 API 和实时大屏。
  • 基本使用
    1. 购买实例并绑定 MaxCompute 项目。
    2. 创建外部表:直接映射 MaxCompute 表,无需搬运数据即可加速查询。
    3. 创建内部表:对高频查询字段建立索引、分区,写入数据以获得极致性能。
    4. 连接应用:使用标准 PG 驱动(JDBC/psycopg2)连接,对接 Quick BI 或业务系统。

4. DataWorks (大数据开发治理平台)

  • 简介 :一站式大数据 IDE 和治理平台。它是上述所有数据产品的统一操作入口,提供数据集成、开发、调度、质量监控、血缘追踪和安全管控能力。
  • 基本使用
    1. 工作空间管理:绑定 MaxCompute/Hologres/OSS 等计算存储资源。
    2. 数据集成:配置离线/实时同步任务(如 MySQL→MaxCompute,OSS→Hologres)。
    3. 数据开发:新建节点(ODPS SQL / Shell / PyODPS),编写代码并提交发布。
    4. 运维中心:查看任务运行日志、处理报错、补数据重跑。
    5. 数据地图:搜索表资产、查看血缘关系和数据质量规则。

5. 函数计算 FC

  • 简介 :事件驱动的 Serverless 计算服务。在数据场景中,常用于轻量级数据处理(如 OSS 文件触发解析)、数据服务 API 后端、或定时触发小型 ETL 任务,免运维、按调用次数计费。
  • 基本使用
    1. 创建服务与函数:选择 Python/Node.js 等运行时,编写处理逻辑。
    2. 配置触发器:绑定 OSS 事件、HTTP 请求、定时器等触发源。
    3. 访问其他云服务:通过内网 Endpoint 访问 OSS/MaxCompute/Hologres,避免公网流量费。
    4. 调试与部署:使用 Serverless Devs 工具链本地调试、一键部署。

6. Quick BI

  • 简介:智能 BI 报表与可视化工具。支持拖拽式建模、丰富图表类型和移动端适配,是数据价值的最终展示层。
  • 基本使用
    1. 添加数据源:连接 Hologres(推荐)、MaxCompute 或 MySQL。
    2. 创建数据集:定义维度、度量,配置计算字段和行级权限。
    3. 制作仪表板:拖拽图表组件,配置筛选联动、钻取和下钻。
    4. 发布与分享:生成公开链接、嵌入第三方系统或通过钉钉推送订阅。

💡 典型协作链路示例

OSS (原始数据落地) → DataWorks (调度同步) → MaxCompute (离线清洗聚合) → Hologres (结果加速/外部表直查) → Quick BI (可视化看板)

FC (OSS 上传触发预处理 / 对外提供数据 API)

⚠️ 新手避坑建议

  1. 地域一致性:所有产品务必选择同一地域,跨地域不仅产生高额流量费,还会导致内网不通。
  2. 权限最小化:使用 RAM 子账号+角色授权,避免主账号 AK/SK 硬编码在代码中。
  3. 成本意识 :MaxCompute 按扫描量计费,SQL 中避免 SELECT *;Hologres 按 CU 计费,测试完及时降配或释放;OSS 开启生命周期策略。
  4. 善用 DataWorks:不要直接在 MaxCompute 客户端手动执行生产 SQL,所有变更走 DataWorks 发布流程,确保可追溯、可回滚。
  5. 文档优先:阿里云官方文档非常详尽,遇到问题先搜文档中的"最佳实践"和"常见问题",比搜索引擎更高效。

相关推荐
ACP广源盛139246256731 小时前
Qwen3.8‑2.4T 开源落地@ACP#国产 MoE 大模型私有化部署中 MST 多屏转换芯片 GSV2231 硬件价值与应用场景
大数据·数据库·人工智能·嵌入式硬件
万岳科技系统开发1 小时前
外卖跑腿小程序如何提升本地生活服务平台运营效率?
大数据·小程序·生活
cc复CC2 小时前
从零开始手写 Spark 02|数据流与延迟迭代
大数据·分布式
数据智研2 小时前
【数据分享】全国农产品成本收益资料汇编(1953-2025)
大数据·人工智能·信息可视化·数据分析
yinshuzhineng2 小时前
问题:如何实现数字化转型,增强竞争优势?
大数据·人工智能·制造
Zaimmm3 小时前
临床文献智能检索哪家强?2026年主流AI循证平台深度测评与推荐
大数据·人工智能·microsoft
QYR_Jodie3 小时前
2026-2032全球玻璃纤维网市场分析:2032年将达到5.55亿美元
大数据·人工智能
八角Z3 小时前
AI Agent作为经济参与者的兴起:机器经济与传统金融体系的并存与交织
大数据·人工智能·服务发现
资深电气设计3 小时前
数据中心800V直流断路器选型分析:ABB电气产品矩阵的技术适配性与评估要点
大数据·线性代数·矩阵