阿里云DataWorks,MaxCompute,hologres,OSS,函数计算FC,Quick BI
阿里云经典的"数据湖仓一体 + Serverless 计算 + BI 可视化"技术栈。
1. OSS (对象存储服务)
- 简介 :海量、安全、低成本的云存储基础设施。在上述技术栈中,它通常作为数据湖的底座,存放原始日志、CSV/Parquet 文件、模型文件等。
- 基本使用 :
- 创建 Bucket(选择与 MaxCompute/Hologres 相同的地域以减少流量费)。
- 上传数据:通过控制台、ossutil 命令行或 SDK 上传文件。
- 配置生命周期:设置冷热数据分层或自动过期删除以降低成本。
- 授权:为 DataWorks/MaxCompute 配置 RAM 角色,允许其读取 OSS 数据。
2. MaxCompute (原 ODPS)
- 简介:企业级 SaaS 模式云数仓,专为 TB/PB 级离线批处理设计。按量付费或包年包月,无需运维集群,是数据加工的核心引擎。
- 基本使用 :
- 开通服务并创建项目空间(建议分开发/生产环境)。
- 建表与导入:使用 DDL 建表,通过 Tunnel 命令或 DataWorks 数据集成将 OSS/RDS 数据同步入仓。
- SQL 开发:在 DataWorks 数据开发界面编写 ODPS SQL 进行 ETL 清洗。
- 任务调度:配置依赖关系和周期调度,实现自动化数据流水线。
3. Hologres
- 简介 :兼容 PostgreSQL 协议的实时数仓。最大特点是与 MaxCompute 底层存储互通,支持高并发点查和亚秒级 OLAP 分析,常用于数据服务 API 和实时大屏。
- 基本使用 :
- 购买实例并绑定 MaxCompute 项目。
- 创建外部表:直接映射 MaxCompute 表,无需搬运数据即可加速查询。
- 创建内部表:对高频查询字段建立索引、分区,写入数据以获得极致性能。
- 连接应用:使用标准 PG 驱动(JDBC/psycopg2)连接,对接 Quick BI 或业务系统。
4. DataWorks (大数据开发治理平台)
- 简介 :一站式大数据 IDE 和治理平台。它是上述所有数据产品的统一操作入口,提供数据集成、开发、调度、质量监控、血缘追踪和安全管控能力。
- 基本使用 :
- 工作空间管理:绑定 MaxCompute/Hologres/OSS 等计算存储资源。
- 数据集成:配置离线/实时同步任务(如 MySQL→MaxCompute,OSS→Hologres)。
- 数据开发:新建节点(ODPS SQL / Shell / PyODPS),编写代码并提交发布。
- 运维中心:查看任务运行日志、处理报错、补数据重跑。
- 数据地图:搜索表资产、查看血缘关系和数据质量规则。
5. 函数计算 FC
- 简介 :事件驱动的 Serverless 计算服务。在数据场景中,常用于轻量级数据处理(如 OSS 文件触发解析)、数据服务 API 后端、或定时触发小型 ETL 任务,免运维、按调用次数计费。
- 基本使用 :
- 创建服务与函数:选择 Python/Node.js 等运行时,编写处理逻辑。
- 配置触发器:绑定 OSS 事件、HTTP 请求、定时器等触发源。
- 访问其他云服务:通过内网 Endpoint 访问 OSS/MaxCompute/Hologres,避免公网流量费。
- 调试与部署:使用 Serverless Devs 工具链本地调试、一键部署。
6. Quick BI
- 简介:智能 BI 报表与可视化工具。支持拖拽式建模、丰富图表类型和移动端适配,是数据价值的最终展示层。
- 基本使用 :
- 添加数据源:连接 Hologres(推荐)、MaxCompute 或 MySQL。
- 创建数据集:定义维度、度量,配置计算字段和行级权限。
- 制作仪表板:拖拽图表组件,配置筛选联动、钻取和下钻。
- 发布与分享:生成公开链接、嵌入第三方系统或通过钉钉推送订阅。
💡 典型协作链路示例
OSS (原始数据落地) → DataWorks (调度同步) → MaxCompute (离线清洗聚合) → Hologres (结果加速/外部表直查) → Quick BI (可视化看板)
↕
FC (OSS 上传触发预处理 / 对外提供数据 API)
⚠️ 新手避坑建议
- 地域一致性:所有产品务必选择同一地域,跨地域不仅产生高额流量费,还会导致内网不通。
- 权限最小化:使用 RAM 子账号+角色授权,避免主账号 AK/SK 硬编码在代码中。
- 成本意识 :MaxCompute 按扫描量计费,SQL 中避免
SELECT *;Hologres 按 CU 计费,测试完及时降配或释放;OSS 开启生命周期策略。 - 善用 DataWorks:不要直接在 MaxCompute 客户端手动执行生产 SQL,所有变更走 DataWorks 发布流程,确保可追溯、可回滚。
- 文档优先:阿里云官方文档非常详尽,遇到问题先搜文档中的"最佳实践"和"常见问题",比搜索引擎更高效。