19. 大数据- 湖仓一体&BI - 阿里云实践


阿里云DataWorks,MaxCompute,hologres,OSS,函数计算FC,Quick BI


阿里云经典的"数据湖仓一体 + Serverless 计算 + BI 可视化"技术栈。


1. OSS (对象存储服务)

  • 简介 :海量、安全、低成本的云存储基础设施。在上述技术栈中,它通常作为数据湖的底座,存放原始日志、CSV/Parquet 文件、模型文件等。
  • 基本使用
    1. 创建 Bucket(选择与 MaxCompute/Hologres 相同的地域以减少流量费)。
    2. 上传数据:通过控制台、ossutil 命令行或 SDK 上传文件。
    3. 配置生命周期:设置冷热数据分层或自动过期删除以降低成本。
    4. 授权:为 DataWorks/MaxCompute 配置 RAM 角色,允许其读取 OSS 数据。

2. MaxCompute (原 ODPS)

  • 简介:企业级 SaaS 模式云数仓,专为 TB/PB 级离线批处理设计。按量付费或包年包月,无需运维集群,是数据加工的核心引擎。
  • 基本使用
    1. 开通服务并创建项目空间(建议分开发/生产环境)。
    2. 建表与导入:使用 DDL 建表,通过 Tunnel 命令或 DataWorks 数据集成将 OSS/RDS 数据同步入仓。
    3. SQL 开发:在 DataWorks 数据开发界面编写 ODPS SQL 进行 ETL 清洗。
    4. 任务调度:配置依赖关系和周期调度,实现自动化数据流水线。

3. Hologres

  • 简介 :兼容 PostgreSQL 协议的实时数仓。最大特点是与 MaxCompute 底层存储互通,支持高并发点查和亚秒级 OLAP 分析,常用于数据服务 API 和实时大屏。
  • 基本使用
    1. 购买实例并绑定 MaxCompute 项目。
    2. 创建外部表:直接映射 MaxCompute 表,无需搬运数据即可加速查询。
    3. 创建内部表:对高频查询字段建立索引、分区,写入数据以获得极致性能。
    4. 连接应用:使用标准 PG 驱动(JDBC/psycopg2)连接,对接 Quick BI 或业务系统。

4. DataWorks (大数据开发治理平台)

  • 简介 :一站式大数据 IDE 和治理平台。它是上述所有数据产品的统一操作入口,提供数据集成、开发、调度、质量监控、血缘追踪和安全管控能力。
  • 基本使用
    1. 工作空间管理:绑定 MaxCompute/Hologres/OSS 等计算存储资源。
    2. 数据集成:配置离线/实时同步任务(如 MySQL→MaxCompute,OSS→Hologres)。
    3. 数据开发:新建节点(ODPS SQL / Shell / PyODPS),编写代码并提交发布。
    4. 运维中心:查看任务运行日志、处理报错、补数据重跑。
    5. 数据地图:搜索表资产、查看血缘关系和数据质量规则。

5. 函数计算 FC

  • 简介 :事件驱动的 Serverless 计算服务。在数据场景中,常用于轻量级数据处理(如 OSS 文件触发解析)、数据服务 API 后端、或定时触发小型 ETL 任务,免运维、按调用次数计费。
  • 基本使用
    1. 创建服务与函数:选择 Python/Node.js 等运行时,编写处理逻辑。
    2. 配置触发器:绑定 OSS 事件、HTTP 请求、定时器等触发源。
    3. 访问其他云服务:通过内网 Endpoint 访问 OSS/MaxCompute/Hologres,避免公网流量费。
    4. 调试与部署:使用 Serverless Devs 工具链本地调试、一键部署。

6. Quick BI

  • 简介:智能 BI 报表与可视化工具。支持拖拽式建模、丰富图表类型和移动端适配,是数据价值的最终展示层。
  • 基本使用
    1. 添加数据源:连接 Hologres(推荐)、MaxCompute 或 MySQL。
    2. 创建数据集:定义维度、度量,配置计算字段和行级权限。
    3. 制作仪表板:拖拽图表组件,配置筛选联动、钻取和下钻。
    4. 发布与分享:生成公开链接、嵌入第三方系统或通过钉钉推送订阅。

💡 典型协作链路示例

OSS (原始数据落地) → DataWorks (调度同步) → MaxCompute (离线清洗聚合) → Hologres (结果加速/外部表直查) → Quick BI (可视化看板)

FC (OSS 上传触发预处理 / 对外提供数据 API)

⚠️ 新手避坑建议

  1. 地域一致性:所有产品务必选择同一地域,跨地域不仅产生高额流量费,还会导致内网不通。
  2. 权限最小化:使用 RAM 子账号+角色授权,避免主账号 AK/SK 硬编码在代码中。
  3. 成本意识 :MaxCompute 按扫描量计费,SQL 中避免 SELECT *;Hologres 按 CU 计费,测试完及时降配或释放;OSS 开启生命周期策略。
  4. 善用 DataWorks:不要直接在 MaxCompute 客户端手动执行生产 SQL,所有变更走 DataWorks 发布流程,确保可追溯、可回滚。
  5. 文档优先:阿里云官方文档非常详尽,遇到问题先搜文档中的"最佳实践"和"常见问题",比搜索引擎更高效。

相关推荐
APItesterCris1 小时前
告别人工盯品!借助 Open‑Claw 快速搭建电商商品全自动监控与数据分析系统(完整实操代码)
java·大数据·前端·数据库
BYSJMG1 小时前
计算机毕设选题推荐:基于大数据的公共交通运营数据分析与可视化,Spark+K-Means聚类城市运营模式
大数据·hadoop·信息可视化·数据分析·spark·kmeans·课程设计
顧棟1 小时前
【ES实战】 低版本Elasticsearch(不具备CCR)集群迁移
大数据·elasticsearch·搜索引擎
AIwenIPgeolocation2 小时前
告别“数据孤岛”:可信数据空间如何打通产业链、城市群?
大数据·人工智能
云上工程笔记2 小时前
四柱记账法和复式记账法有什么区别?复式记账为什么更适合查错和对账
大数据·前端·人工智能
微三云生态系统架构师-彭丹2 小时前
区域拆分独立分红池系统设计:解决大盘分红迟滞的四维拆分引擎
大数据·人工智能
吴佳浩 Alben2 小时前
构建企业级 DevOps 排错 Agent:从日志告警到自动化修复 PR
大数据·人工智能·语言模型·架构·自动化·ai编程·devops
Elastic 中国社区官方博客2 小时前
隐藏在可观测性数据中的安全攻击
大数据·网络·安全·elasticsearch·搜索引擎·全文检索
FII工业富联科技服务3 小时前
三维世界模型驱动机器人操作:概念解析、技术挑战与Omniverse全栈架构深度拆解
大数据·架构·机器人
见闻小天地3 小时前
空调机房冷冻泵与冷却泵是什么?选型要点与赛莱默方案解析
大数据·网络