AI云原生笔记

1


这是阿里云云原生 AI 套件能力架构图。它为用户提供四个部分能力来匹配云原生 AI 工程不同阶段和业务属性。

层级划分:从下到上依次是 IaaS、K8s、AI 基础设施、AI 开发引擎、AI 工程管理以及 PaaS 层。

IaaS:最底层的基础公有云设施。

K8s 层:提供 ACK Pro、ACK Serverless、ACK Edge、ACK 版这些云原生容器服务。

AI 基础设施:包含资源管理、存储、网络以及镜像服务,提供包括本地盘、NAS、OSS 等存储选项,以及 EIP、负载均衡等网络能力,还有镜像仓库来管理 AI 相关镜像。

AI 开发引擎:

训练引擎:涵盖 Kubeflow、PyTorch、TensorFlow 等主流深度学习框架,支持单机、分布式训练,提供弹性扩缩容以及训练加速优化能力。

推理引擎:支持 TensorRT、ONNX Runtime 等,提供模型转换、优化,支持多框架模型统一部署,包含在线推理、批量推理等多种推理方式。

数据处理引擎:支持 Spark、Flink 等,可以进行数据接入、预处理、特征工程以及数据版本管理。

AI 工程管理:

项目管理:提供工作空间、成员管理以及权限分配。

资产管理:管理数据集、模型、镜像等资产,支持版本化管理以及溯源。

流程编排:支持通过 DAG 工作流编排训练、推理、数据处理任务,支持定时调度以及事件触发。

运维监控:提供训练任务监控、推理服务监控,支持日志采集、指标监控以及告警。

PaaS 层:面向不同用户角色和业务场景提供能力:

面向 AI 用户:提供 Arena CLI、Arena SDK,方便用户提交、管理训练任务。

面向算法开发者:提供在线开发环境、模型调试工具以及模型评估能力。

面向 AI 应用开发者:提供应用模板、部署流水线以及灰度发布能力。

面向 AI 平台管理者:提供多租户管理、资源配额以及计量计费能力。





2











3

相关推荐
冬奇Lab7 小时前
每日一个开源项目(第140篇):AgentScope 2.0 - 阿里开源的生产级 Agent 框架
人工智能·开源·agent
冬奇Lab8 小时前
Skill 系列(04):Skill 指标体系——L1/L2/L3 三层监控,让质量下降有据可查
人工智能·开源·llm
IT_陈寒9 小时前
Vite的静态资源打包让我熬夜到三点,这坑千万别跳
前端·人工智能·后端
玩转AI不是事9 小时前
用IndexedDB做AI对话离线缓存实战
人工智能
阿里云云原生10 小时前
深度解构:当 Append-only 的 SLS 遇上 Update/Delete,是如何实现设计权衡的?
云原生
Asize10 小时前
多模态生图:从 Vite 工程化到前端调用 Qwen Image
javascript·人工智能·后端
MobotStone10 小时前
AI项目越多,为什么越容易失控
人工智能·aigc
十有八七10 小时前
AI时代的置身X内
前端·人工智能
Lkstar10 小时前
A2A协议深度解析|Agent2Agent通信标准,智能体互联网的"HTTP"
人工智能·llm
百度Geek说10 小时前
当代码越来越便宜,什么在变贵?
人工智能