19. 大数据- 湖仓一体&BI - 阿里云实践


阿里云DataWorks,MaxCompute,hologres,OSS,函数计算FC,Quick BI


阿里云经典的"数据湖仓一体 + Serverless 计算 + BI 可视化"技术栈。


1. OSS (对象存储服务)

  • 简介 :海量、安全、低成本的云存储基础设施。在上述技术栈中,它通常作为数据湖的底座,存放原始日志、CSV/Parquet 文件、模型文件等。
  • 基本使用 :
    1. 创建 Bucket(选择与 MaxCompute/Hologres 相同的地域以减少流量费)。
    2. 上传数据:通过控制台、ossutil 命令行或 SDK 上传文件。
    3. 配置生命周期:设置冷热数据分层或自动过期删除以降低成本。
    4. 授权:为 DataWorks/MaxCompute 配置 RAM 角色,允许其读取 OSS 数据。

2. MaxCompute (原 ODPS)

  • 简介:企业级 SaaS 模式云数仓,专为 TB/PB 级离线批处理设计。按量付费或包年包月,无需运维集群,是数据加工的核心引擎。
  • 基本使用 :
    1. 开通服务并创建项目空间(建议分开发/生产环境)。
    2. 建表与导入:使用 DDL 建表,通过 Tunnel 命令或 DataWorks 数据集成将 OSS/RDS 数据同步入仓。
    3. SQL 开发:在 DataWorks 数据开发界面编写 ODPS SQL 进行 ETL 清洗。
    4. 任务调度:配置依赖关系和周期调度,实现自动化数据流水线。

3. Hologres

  • 简介 :兼容 PostgreSQL 协议的实时数仓。最大特点是与 MaxCompute 底层存储互通,支持高并发点查和亚秒级 OLAP 分析,常用于数据服务 API 和实时大屏。
  • 基本使用 :
    1. 购买实例并绑定 MaxCompute 项目。
    2. 创建外部表:直接映射 MaxCompute 表,无需搬运数据即可加速查询。
    3. 创建内部表:对高频查询字段建立索引、分区,写入数据以获得极致性能。
    4. 连接应用:使用标准 PG 驱动(JDBC/psycopg2)连接,对接 Quick BI 或业务系统。

4. DataWorks (大数据开发治理平台)

  • 简介 :一站式大数据 IDE 和治理平台。它是上述所有数据产品的统一操作入口,提供数据集成、开发、调度、质量监控、血缘追踪和安全管控能力。
  • 基本使用 :
    1. 工作空间管理:绑定 MaxCompute/Hologres/OSS 等计算存储资源。
    2. 数据集成:配置离线/实时同步任务(如 MySQL→MaxCompute,OSS→Hologres)。
    3. 数据开发:新建节点(ODPS SQL / Shell / PyODPS),编写代码并提交发布。
    4. 运维中心:查看任务运行日志、处理报错、补数据重跑。
    5. 数据地图:搜索表资产、查看血缘关系和数据质量规则。

5. 函数计算 FC

  • 简介 :事件驱动的 Serverless 计算服务。在数据场景中,常用于轻量级数据处理(如 OSS 文件触发解析)、数据服务 API 后端、或定时触发小型 ETL 任务,免运维、按调用次数计费。
  • 基本使用 :
    1. 创建服务与函数:选择 Python/Node.js 等运行时,编写处理逻辑。
    2. 配置触发器:绑定 OSS 事件、HTTP 请求、定时器等触发源。
    3. 访问其他云服务:通过内网 Endpoint 访问 OSS/MaxCompute/Hologres,避免公网流量费。
    4. 调试与部署:使用 Serverless Devs 工具链本地调试、一键部署。

6. Quick BI

  • 简介:智能 BI 报表与可视化工具。支持拖拽式建模、丰富图表类型和移动端适配,是数据价值的最终展示层。
  • 基本使用 :
    1. 添加数据源:连接 Hologres(推荐)、MaxCompute 或 MySQL。
    2. 创建数据集:定义维度、度量,配置计算字段和行级权限。
    3. 制作仪表板:拖拽图表组件,配置筛选联动、钻取和下钻。
    4. 发布与分享:生成公开链接、嵌入第三方系统或通过钉钉推送订阅。

💡 典型协作链路示例

OSS (原始数据落地) → DataWorks (调度同步) → MaxCompute (离线清洗聚合) → Hologres (结果加速/外部表直查) → Quick BI (可视化看板)

↕

FC (OSS 上传触发预处理 / 对外提供数据 API)

⚠️ 新手避坑建议

  1. 地域一致性:所有产品务必选择同一地域,跨地域不仅产生高额流量费,还会导致内网不通。
  2. 权限最小化:使用 RAM 子账号+角色授权,避免主账号 AK/SK 硬编码在代码中。
  3. 成本意识 :MaxCompute 按扫描量计费,SQL 中避免 SELECT *;Hologres 按 CU 计费,测试完及时降配或释放;OSS 开启生命周期策略。
  4. 善用 DataWorks:不要直接在 MaxCompute 客户端手动执行生产 SQL,所有变更走 DataWorks 发布流程,确保可追溯、可回滚。
  5. 文档优先:阿里云官方文档非常详尽,遇到问题先搜文档中的"最佳实践"和"常见问题",比搜索引擎更高效。

相关推荐
问商十三载1 小时前
GEO优化有用吗?基于检索与信源机制的有效性分析
大数据·人工智能·机器学习
ha_lydms8 小时前
MaxCompute中加密与解密函数
大数据·数据库·数据仓库·hadoop·dataworks·maxcompute·odps
文慧的科技江湖9 小时前
《从算力能源各玩各的到全套跑通:算电协同 + Token 全栈方案落地实战》
大数据·重卡充电桩系统·慧知重卡充电桩平台·慧知重卡充电桩系统
m0_4665252910 小时前
数字认证参加第十四届用户体验大会,分享标准建设思路
大数据·人工智能·科技
康实训10 小时前
2026数字化AI智慧实训建设方案
大数据·人工智能·实训室·实训室建设
玫瑰互动GEO11 小时前
开发者学GEO优化:从算法基础到CoT推理链
大数据·人工智能·ai·geo·ai搜索·geo优化
liuhl091011 小时前
【无标题】
大数据·elasticsearch·搜索引擎
大嘴皮猴儿11 小时前
2026年9月行业洞察:适合亚马逊跨境卖家的免费自动图片翻译平台
大数据·人工智能·跨境电商ai跨境翻译网站哪个好·ai图片翻译网站推荐·ai图片翻译工具哪个好
天国梦12 小时前
2026年北京机器狗选型指南:从痛点、技术到实战的完整评测
大数据·人工智能
段一凡-华北理工大学12 小时前
大模型与智能体在工业的应用~系列文章07:多智能体协作:会分工的“AI 团队“
大数据·人工智能·设备巡检·智能体协作·工业智能体·高炉大模型