CubeStudio 是一款国产化、云原生的一站式开源人工智能平台,同时覆盖传统机器学习、深度学习与大模型全链路(MLOps / MaaS / 算力调度 / 训推平台),开源协议 MIT,开源免费商用,开源版本已有数千家企业私有化部署。平台提供多租户与算力纳管调度、算力租赁与 Token 中转站、拖拉拽 Pipeline 任务流编排、多机多卡分布式训练、超参搜索、推理服务、vGPU 虚拟化、云边端协同与边缘计算、图文音多模态自动化标注、大模型 SFT 微调 / 奖励模型 / 强化学习训练、vLLM / Ollama / MindIE 大模型多机推理、私有知识库 / LLMOps / 智能体、AI 模型市场,以及从数据到上线的全流程模型部署。原生适配昇腾、寒武纪、海光、摩尔线程、沐曦等国产异构算力与 x86 / ARM CPU 架构,支持 IB / RoCE / RDMA 高速网络及信创私有化、内网离线部署。
官网:https://www.cubestudio.vip | GitHub:https://github.com/data-infra/cube-studio | Gitee:https://gitee.com/data-infra/cube-studio
关键词:CubeStudio、cube-studio、商业版、开源版、版本对照、功能清单、版本选型、采购评估、MLOps、私有化部署、源码交付、license、商业授权、大模型平台、国产算力、信创
本文对照 CubeStudio 商业版与开源版的功能差异,供版本选型与采购评估参考。功能以产品维度组织,技术实现细节以各专题文档与源码为准。
一、一句话区别
- 开源版:采用 MIT 开源协议,开源免费商用,功能完整、可私有化部署,已有数千家企业落地;
- 商业版 :在开源版基础上增强一批面向生产与信创的能力(多集群、计量计费、国产算力调度、大模型推理服务、数据标注、AIHub 模型市场等),仅对商业版特有功能收费,支持源码交付、按需采购部分功能,无 license 部署数量与时长限制。
二、产品特性
- 国内 GitHub 开源 MLOps Star 第一,数千家企业私有化部署,功能稳定完善;
- 功能完善:SSO 登录、Notebook 在线开发、拖拉拽 Pipeline 编排、多机多卡分布式训练、超参搜索、推理服务与 vGPU、多集群调度、私有化 / 边缘 / Serverless 部署、自动化标注、大模型一键微调、私有知识库、AI 应用商店;支持模型一键开发 / 推理 / 微调;支持国产 CPU / GPU / NPU 芯片与 RDMA;
- 扩展性好,适合机器学习 / 深度学习 / 大模型各领域落地,特定算法适配无需改造平台;
- 支持源码交付,授权后可改造、加工成自有产品,无 license 部署数量与时长限制,可对外出售;
- 支持免费新增功能升级,保持平台先进性;
- 仅对商业版特有功能收费,性价比高,支持只采购部分功能以控制成本;
- 采购前可免费更换 Logo 为客户做演示。
三、功能清单(商业版 vs 开源版对照)
说明:标注 【商业版】 的为商业版特有能力;未标注的为开源版与商业版均提供。
基础能力
项目组管理
- AI 平台通过项目划分;支持配置项目组用户权限;任务 / 服务的挂载、资源组、集群、服务代理;项目组内角色控制。
网络
- 支持非 80 端口、公网 / 域名;
- 【商业版】支持反向代理与内网穿透访问;
- 【商业版】支持 HTTPS。
用户 / 角色 / 权限管理
- 管理平台用户基本信息、组织架构,支持账号密码与 RBAC 权限体系;
- 【商业版】记录增删改、清理等操作历史;
- 【商业版】支持菜单权限控制。
SSO 单点登录
- 账号密码注册自动登录;
- 【商业版】对接企业账号体系(AUTH_OID / AUTH_LDAP / AUTH_REMOTE_USER 等);
- 【商业版】支持消息推送、登录验证、强密码、远程用户、登录频率限制、密码密文传输。
GPU 调度能力
- 多规格资源支持不同场景,CPU / GPU,支持 T4 / V100 / A100 等多卡型;
- 【商业版】支持 GPU 禁用 / 共享 / 独占 / vGPU 模式、RDMA 协议、虚拟化显存设定、指定卡序号。
国产异构算力
- 【商业版】前后端镜像、底层组件、任务模板、超参搜索均支持 ARM 架构,AIHub 应用约 70% 支持 ARM;
- 【商业版】支持调度海光 DCU、华为昇腾 NPU、寒武纪 MLU、摩尔线程、沐曦、昆仑芯、壁仞等国产 GPU / NPU。
多资源组 / 多集群
- 支持划分多资源组,支持 Docker 运行时;
- 【商业版】支持多 K8s 集群、IPVS 网络模式、Containerd 容器运行时。
计量计费(整体为【商业版】特性)
- 平台 / 租户 / 项目组 / 个人多级资源额度分配与查看,覆盖开发、训练、推理,在 Notebook、镜像构建、Pipeline、超参搜索、内部服务、推理服务中生效;
- 统一的开发 / 训练 / 推理资源监控,按租户 / 项目 / 任务分析资源分配与使用;
- 支持自定义计费模式与日结账单(每日账单费用与明细);
- 支持发票管理(Invoice)。
算力租赁(整体为【商业版】特性)
- 以"租赁实例"形式对外售卖算力:支持单卡 / 整机两种租赁类型,按量 / 按天两种计费方式,支持自动续费;
- 租赁实例为独立 Pod,通过泛域名访问,支持在线 IDE / 开发 / 模型市场应用 / 推理等多种镜像类目;
- 存储租赁:用户 workspace 存储按 GB·小时计费,含免费额度(默认 20G),基于 PVC / StorageClass 支持在线扩容,独立于算力实例生命周期;
- 与计量计费体系打通,费用计入账单。
边缘集群
- 【商业版】支持边缘集群模式,支持边缘节点开发、训练、推理。
Serverless 集群
- 【商业版】支持腾讯云 / 阿里云 Serverless 集群模式(Notebook / Pipeline / 推理服务模块)。
数据库存储
- 支持外部 MySQL 作为元数据库;
- 【商业版】支持外部 PostgreSQL、达梦(DamengDB)作为元数据库。
机器资源管理
- 【商业版】Web 界面控制机器调度类型、所属资源组、是否启用 RDMA / vGPU、可用任务场景等。
存储盘管理
- 【商业版】Web 界面添加存储盘并绑定项目组,Notebook / Pipeline / 推理服务直接在 Pod 中挂载外部分布式存储;
- 【商业版】支持 NFS、CFS、OSS、NAS、COS、GlusterFS、CephFS、S3 / MinIO。
国际化
- 【商业版】MLOps 支持多语言配置,目前支持中英文。
数据管理
数据地图
- 元数据库表管理、指标、维表。
数据计算
- SQLLab 交互查询,支持 MySQL;
- 【商业版】支持 PostgreSQL、ClickHouse、Hive、Presto 等计算引擎。
ETL 编排
- 数据 ETL 任务流编排与任务管理,对接企业数据中台的计算 / 调度引擎;
- 【商业版】内置数据分析调度引擎,提供 47 个数据分析算子。
数据集管理
- 随时上传图片 / 音频 / 文本等样本集;
- 【商业版】支持 SDK 对接与数据集一键探索。
血缘链路
- 【商业版】支持通用血缘链路查询(数据 / 任务血缘 API)。
数据标注(整体为【商业版】特性)
- 图 / 文 / 音 / 多模态标注,分布式存储打通 MLOps 平台,项目组权限控制,中文汉化;
- 对接一站式平台自动化标注(需 AIHub):目标识别、边界 / 遮罩识别、多目标视频跟踪、图片分类 / 描述、OCR、关键点检测;
- 大模型自动化标注:文本分类、翻译、命名实体识别、阅读理解、问答、摘要提取。
开发环境
镜像功能
- 镜像仓库 / 管理 / 在线构建,提供模板、服务、Notebook、GPU 基础环境等全部镜像的构建方法与成品;
- 【商业版】支持同一仓库多密钥配置。
Notebook
- 基于 JupyterLab / VSCode 的在线交互开发;多种可选 IDE 与示例,支持大数据 / 机器学习 / 深度学习版本;支持 SSH Remote 远程开发;支持启动自动初始化、自动清理与续期;
- 【商业版】大数据版本内置 HDFS / Hive / Spark 客户端;SSH 隧道代理、单端口开放;
- 【商业版】支持 Matlab / Rstudio 在线 IDE;GPU / CPU / 内存监控与 Git 交互;自定义 Notebook 镜像;
- 【商业版】多内核(R / Julia / Python 2.7~3.10 及 CubeStudio 专有环境);TensorBoard 可视化;环境镜像保存;Jupyter 密码保护;GPU 整卡 / 虚卡 / 共享占用。
模型训练
拖拉拽任务流编排调试
- 拖拽式开发 Pipeline,支持单任务调试,训练支持多资源规格与卡型选择、超时重试;Pipeline 支持定时调度、补录、并发限制、超时、实例依赖;任务管理、Workflow 实例管理、资源监控;
- 【商业版】任务独占 / 共享占用 GPU;分布式任务模板支持调试用户镜像;支持 RDMA 资源占用与透传、GPU 厂商 / 卡型占用与型号透传、拉取密钥透传;
- 【商业版】支持任务输入输出、任务流全局变量、文本 / 图片 / ECharts 结果可视化、Workflow 暂停恢复、任务流优先级、运行中任务端口监听、任务推荐、定时调度最大保留实例数。
主流功能算子
- 基础算子:自定义镜像;【商业版】逻辑节点、Python;
- 数据同步:数据集导入、datax、模型导入;【商业版】数据集 / 模型导入支持 HuggingFace / 魔搭、datax-import、LabelStudio 标注数据导入;
- 数据处理:spark / volcanojob / ray 分布式数据处理;【商业版】Hadoop 支持 HDFS / Hive / Spark 命令;
- 【商业版】特征处理:数据合并、去重、数据变换、非数值处理(Hash / One-Hot 等)、异常值检测、离散化、标准化 / 归一化、降维(PCA / 卡方)、特征重要性、采样等全套算子;
- 【商业版】文本 / 图像数据处理:清理过滤、隐私替换、去噪、缩放、裁剪、均衡化、空间变换等;
- 传统机器学习:ray-sklearn 分布式、XGB 单机;【商业版】AR/ARIMA、随机森林(含回归)、LR、LightGBM、KNN、KMeans、GBDT、决策树、PCA、LDA、CatBoost、XGB 及超参搜索;
- 深度学习:TF / PyTorch;【商业版】MXNet / Horovod / PaddleJob / MindSpore 分布式训练;
- 【商业版】分布式加速:MPI / Colossal-AI / DeepSpeed / Horovod / Megatron;
- 模型处理:【商业版】模型评估、格式转换;
- 模型服务化:模型注册、模型部署;【商业版】模型离线推理、注册到 AIHub;
- 媒体分布式处理:分布式媒体下载、视频提取图片、视频提取音频。
可视化模型定义
- 【商业版】可视化定义网络模型:选择网络模型引擎,按 DAG 上下游关系编排模型结构与全局配置。
算子自定义
- 通过 Web 界面将自定义算法代码镜像注册为可复用的 Pipeline 算子;
- 【商业版】自定义模板额外支持 int / float / list / bool / json 型,子类型支持 workdir / image,支持参数提示。
自动学习
- 面向非 AI 背景用户,选择场景并上传数据即可自动训练与部署;
- 【商业版】支持 AutoML 任务流导入导出。
自定义镜像
- 面向高级 AI 开发者,提供自定义训练作业(执行环境 + 代码)。
自动调参
- 基于单机 /【商业版】分布式的自动超参搜索。
TensorBoard 作业
- 【商业版】实时 / 离线观察模型训练过程中的参数与指标变化。
模型管理 / 推理服务
服务任务流
- 【商业版】服务侧任务流编排与实例管理(区别于训练任务流,面向服务化场景的 Pipeline 编排)。
内部服务
- 快捷部署 MySQL-Web、PostgreSQL Web、Mongo Web、Redis Web、Neo4j、Rstudio 等开源工具;
- 【商业版】支持 Ollama、Xinference 大模型推理。
模型管理
- 模型多版本管理,支持发布为推理服务;
- 【商业版】支持模型指标可视化。
推理服务
- 支持 TF / PyTorch / TensorRT / ONNX 常规模型多版本 0 代码发布;【商业版】额外支持 ML 类模型;
- 支持 GPU 卡型选择、远程模型路径、流量分流 / 复制、Sidecar、泛域名、配置文件挂载,支持调试 / 测试 / 生产环境与域名 / IP 代理;支持负载指标监控、CPU / 内存弹性伸缩、多版本滚动升级与回滚;
- 【商业版】vGPU、独占 / 共享占用、GPU 弹性伸缩、服务优先级;
- 【商业版】单 Pod 滚动发布、禁用 K8s Service 负载均衡器、大模型分布式推理;提供常规模型推理镜像并支持自定义;
- 【商业版】支持定时伸缩容、服务 JWT 认证、推理服务在线测试。
监控
整体资源
- 集群 / 机器 / Pod 的算力使用情况(资源组、机器 IP、卡型、CPU / 内存 / GPU 申请与使用率);
- 【商业版】整体资源页面支持管理员批量删除。
数据大屏
- 【商业版】可视化数据大屏:按「分组 → 行 → 列」布局编排多个看板 Widget,集中展示平台运营数据。
监控体系
- 主机与 Pod 的内存 / CPU / GPU / 网络 IO / 磁盘 IO 负载,推理服务 QPS / 吞吐;
- 【商业版】支持 IB 流量监控、vGPU 负载、NPU 监控;
- 【商业版】首页消息提醒,支持企业微信、钉钉、飞书群聊消息推送。
模型应用市场(AIHub)
以下均为 【商业版】 特性:
- 模型应用管理:提供 CubeStudio SDK 与模型开发 / 使用规范,Web 端模型体验(同步 / 异步推理),多个 Python CUDA 版本基础镜像;
- 预训练模型:视觉、听觉、NLP、多模态等 400+ 预训练模型,一键部署服务并提供 API;
- 模型市场:AIHub 应用对接平台卡片式展示;
- 一键开发 / 微调 / 部署:一键转 Notebook 开发、一键转 Pipeline 微调、一键部署手机端 / PC 端 Web 与 API;
- 模型自动化标注:对接 LabelStudio 自动化标注;
- SDK 全家桶:数据集 SDK、Notebook SDK、Pipeline 训练 SDK、推理服务 SDK。
大模型
以下均为 【商业版】 特性:
- 分布式多机多卡训练:MPI / Colossal-AI / DeepSpeed / Horovod / Megatron / MindFormers / MXNet / PaddleJob / MindSpore 分布式训练与加速;
- 大模型推理(AIHub 形式):openjourney / gpt3 / yuan / SD 系列 / Stable Cascade / Stable Diffusion XL / ChatGLM / ChatGLM2/3 / LLaMA / Qwen / Baichuan2 / Gemma / Yi / AquilaChat2 等部署;
- 大模型推理(服务):支持 vLLM 推理与推理加速 + 流式 OpenAI 接口、分布式多机多卡 vLLM 推理;支持 MindIE 昇腾大模型推理(910B / 310P);支持 NPU 适配的 vLLM;DeepSeek / Qwen2 / ChatGLM4 等推理示例;支持 LLM 对话测试与 Open-WebUI Sidecar;
- 大模型微调:DeepSeek / ChatGLM4 / Qwen2 / Baichuan2 LoRA 微调、MindFormers 微调,支持 llama-factory 大模型微调及 NPU 适配的 llama-factory;
- 大模型工程模板:蒸馏(llm-distillation)、量化(llm-quantization)、剪枝(llm-prune)、模型评估(llm-evaluation)、推理压测(llm-benchmark)、安全评测(llm-safety-eval)、OpenCompass 评测、MindFormers(昇腾)等任务模板;
- LLM 服务网关(Token 中转):大模型推理服务统一入口转发,支持 JWT 认证与流式响应;
- 智能对话:多场景对话,提示词构建、推理接口配置、LLM 问答,支持问询中模型切换 / 清理 / 历史上下文;
- 私有知识库:知识库配置与召回(列表 / AIGC 模式),支持微信公众号 / 服务号、企业微信群机器人、钉钉群机器人对接。
四、选型与采购建议
- 只做验证 / 学习 / 中小规模落地:开源版即可满足,功能完整、可私有化、无授权费用;
- 生产环境 / 信创 / 多集群 / 大模型服务:建议商业版,补齐国产算力调度、计量计费、多集群、数据标注、AIHub 与大模型推理服务等生产能力;
- 要做二次开发 / 产品化对外出售:商业版支持源码交付与商业化二次分发,无 license 部署数量与时长限制;
- 控制成本:商业版支持只采购部分功能,可按需组合。
商业版功能持续更新,本清单为产品维度的功能对照,用于版本选型与采购评估;具体功能的技术细节与配置项以对应文档与源码为准,最终以官方提供的最新清单为准。
了解更多
CubeStudio 采用 MIT 开源协议,开源免费商用并支持源码交付与二次分发,开源版本已有数千家企业私有化部署。
- 官网与在线文档:https://www.cubestudio.vip
- 开源仓库(GitHub):https://github.com/data-infra/cube-studio
- 开源仓库(Gitee):https://gitee.com/data-infra/cube-studio