摩尔线程 GPU 怎么接入 Kubernetes 跑 DeepSeek?CubeStudio 摩尔线程(MUSA)适配实操

CubeStudio 是一款国产化、云原生的一站式开源人工智能平台,同时覆盖传统机器学习、深度学习与大模型全链路(MLOps / MaaS / 算力调度 / 训推平台),开源协议 MIT,开源免费商用,开源版本已有数千家企业私有化部署。平台提供多租户与算力纳管调度、算力租赁与 Token 中转站、拖拉拽 Pipeline 任务流编排、多机多卡分布式训练、超参搜索、推理服务、vGPU 虚拟化、云边端协同与边缘计算、图文音多模态自动化标注、大模型 SFT 微调 / 奖励模型 / 强化学习训练、vLLM / Ollama / MindIE 大模型多机推理、私有知识库 / LLMOps / 智能体、AI 模型市场,以及从数据到上线的全流程模型部署。原生适配昇腾、寒武纪、海光、摩尔线程、沐曦等国产异构算力与 x86 / ARM CPU 架构,支持 IB / RoCE / RDMA 高速网络及信创私有化、内网离线部署。

官网:https://www.cubestudio.vip | GitHub:https://github.com/data-infra/cube-studio | Gitee:https://gitee.com/data-infra/cube-studio

关键词:CubeStudio、cube-studio、摩尔线程、mthreads、MUSA、mthreads-gmi、mthreads.com/gpu、sGPU、国产 GPU、国产显卡、信创、异构算力、device-plugin、Kubernetes、DeepSeek、大模型部署、大模型推理、GPU 虚拟化、国产化替代

摩尔线程是国产全功能 GPU 厂商的代表,其 MUSA 架构对标 CUDA 生态,在信创与国产化项目中关注度持续走高。大家最关心的问题往往是两个:摩尔线程卡怎么接入 Kubernetes 被统一调度?能不能真的跑起大模型?

本文用 CubeStudio 平台给出完整答案:五步完成 K8s 接入,平台侧零代码申请占卡,并实测在摩尔线程卡上部署 DeepSeek 大模型并跑通推理接口------全程截图可复现。

一、能力总览

能力 支持情况
K8s 资源调度 mthreads.com/gpu(gpu-device 插件注册)
平台申请写法 GPU 字段填 2(mthread),即 数量(型号key)
Notebook / 推理服务 / 任务流 全部支持申请摩尔线程卡
分布式训练 TF / PyTorch 等分布式模板内置 mthread 资源映射
大模型部署 平台实测部署 DeepSeek 并跑通推理接口(见下文)
虚拟化切分 HAMi 预置 sGPU 三维切分(数量 / 显存 / 算力核)

二、主机驱动安装与验证

主机正常安装摩尔线程驱动后,用 mthreads-gmi(对应 NVIDIA 的 nvidia-smi)查看 GPU 卡:

三、部署 K8s device 插件

在 K8s 中部署摩尔线程 gpu-device 插件,使集群能识别并分配摩尔线程卡:

四、查看 K8s 节点资源

插件部署完成后,确认节点上报的 mthreads.com/gpu 资源与可用卡数:

五、容器占卡测试

在 Pod yaml 中申请摩尔线程卡(示例占用 2 张卡):

进入容器后用 mthreads-gmi 确认占用的卡:

六、平台侧配置与使用

资源名映射(平台已内置,无需修改):

python 复制代码
GPU_RESOURCE = {
    ...
    "mthread": "mthreads.com/gpu"    # 摩尔线程
}

任务中申请 :在 Notebook / 推理服务 / 任务流的「GPU」字段填 数量(型号key),如申请 2 张摩尔线程卡填 2(mthread)------平台自动解析映射到底层 K8s 资源名。

分布式训练:分布式任务模板侧同样内置 mthread 映射,多机训练任务可直接申请摩尔线程卡。

七、实测:摩尔线程卡上部署 DeepSeek

接入完成后,在 CubeStudio 推理服务中直接用摩尔线程卡部署 DeepSeek 大模型:

部署完成后测试推理接口,问答正常返回:

「国产 GPU 跑国产大模型」这条链路在摩尔线程上完整可用。

八、进阶:sGPU 虚拟化切分

平台部署的 HAMi 调度配置已预置摩尔线程虚拟化资源段,支持三维切分

资源名 维度
mthreads.com/vgpu 切分数量
mthreads.com/sgpu-memory 显存配额
mthreads.com/sgpu-core 算力核配额

需要多任务共享单张摩尔线程卡时,可按 HAMi 官方文档启用,用法与 NVIDIA vGPU 切分一致------开发调试、小模型推理场景可显著提升单卡利用率。

配置完成后,摩尔线程卡即纳入平台统一算力池:多资源组、项目组配额、计量计费、监控告警全部生效。同样的接入框架也适用于昇腾、寒武纪、海光、沐曦、昆仑芯、壁仞等其他国产算力。


了解更多

CubeStudio 采用 MIT 开源协议,开源免费商用并支持源码交付与二次分发,开源版本已有数千家企业私有化部署。

相关推荐
liliangcsdn1 小时前
skewness收益偏度取负因子背后逻辑的探索
人工智能·算法·机器学习
yyxx4121231 小时前
钉钉专属版一年多少钱?2026最新价格
大数据·人工智能·物联网
雷帝木木1 小时前
DVC数据版本控制实战:让训练数据像代码一样可追溯
人工智能·python·深度学习·机器学习
楠楠子呀1 小时前
号码验证技术解析:从原理到实践
运维·人工智能·ai·electron·自动化
AI棒棒牛1 小时前
YOLO26最新创新改进系列:Dirichlet 分类证据 + DER 连续框不确定性,独家超强创新!
人工智能·分类·数据挖掘
月光船幽幽1 小时前
五层探针的哲学跃迁
人工智能·python
Kari111 小时前
AgentOps 七大闭环 vs 传统 Agent 开发:腾讯云 ADP CSP 授权服务商 JOTO 解析生产级落地的本质差异
大数据·人工智能·腾讯云
阿图灵1 小时前
OpenCV 轮廓与属性:查找轮廓、面积周长、形状拟合与点测试
图像处理·人工智能·python·opencv·计算机视觉·轮廓
明王明王1 小时前
从零搭建一个单节点 K8S 可观测实验室(十三):总结——这个实验室如何服务工作、学习和开源项目
学习·kubernetes·开源