摩尔线程 GPU 怎么接入 Kubernetes 跑 DeepSeek?CubeStudio 摩尔线程(MUSA)适配实操

15 阅读4分钟

CubeStudio 是一款国产化、云原生的一站式开源人工智能平台,同时覆盖传统机器学习、深度学习与大模型全链路(MLOps / MaaS / 算力调度 / 训推平台),开源协议 MIT,开源免费商用,开源版本已有数千家企业私有化部署。平台提供多租户与算力纳管调度、算力租赁与 Token 中转站、拖拉拽 Pipeline 任务流编排、多机多卡分布式训练、超参搜索、推理服务、vGPU 虚拟化、云边端协同与边缘计算、图文音多模态自动化标注、大模型 SFT 微调 / 奖励模型 / 强化学习训练、vLLM / Ollama / MindIE 大模型多机推理、私有知识库 / LLMOps / 智能体、AI 模型市场,以及从数据到上线的全流程模型部署。原生适配昇腾、寒武纪、海光、摩尔线程、沐曦等国产异构算力与 x86 / ARM CPU 架构,支持 IB / RoCE / RDMA 高速网络及信创私有化、内网离线部署。

官网:www.cubestudio.vip | GitHub:github.com/data-infra/… | Gitee:gitee.com/data-infra/…

关键词:CubeStudio、cube-studio、摩尔线程、mthreads、MUSA、mthreads-gmi、mthreads.com/gpu、sGPU、国产 GPU、国产显卡、信创、异构算力、device-plugin、Kubernetes、DeepSeek、大模型部署、大模型推理、GPU 虚拟化、国产化替代

摩尔线程是国产全功能 GPU 厂商的代表,其 MUSA 架构对标 CUDA 生态,在信创与国产化项目中关注度持续走高。大家最关心的问题往往是两个:摩尔线程卡怎么接入 Kubernetes 被统一调度?能不能真的跑起大模型?

本文用 CubeStudio 平台给出完整答案:五步完成 K8s 接入,平台侧零代码申请占卡,并实测在摩尔线程卡上部署 DeepSeek 大模型并跑通推理接口——全程截图可复现。

一、能力总览

能力支持情况
K8s 资源调度mthreads.com/gpu(gpu-device 插件注册)
平台申请写法GPU 字段填 2(mthread),即 数量(型号key)
Notebook / 推理服务 / 任务流全部支持申请摩尔线程卡
分布式训练TF / PyTorch 等分布式模板内置 mthread 资源映射
大模型部署平台实测部署 DeepSeek 并跑通推理接口(见下文)
虚拟化切分HAMi 预置 sGPU 三维切分(数量 / 显存 / 算力核)

二、主机驱动安装与验证

主机正常安装摩尔线程驱动后,用 mthreads-gmi(对应 NVIDIA 的 nvidia-smi)查看 GPU 卡:

mthreads-gmi 查看 GPU

三、部署 K8s device 插件

在 K8s 中部署摩尔线程 gpu-device 插件,使集群能识别并分配摩尔线程卡:

部署 gpu-device 插件

四、查看 K8s 节点资源

插件部署完成后,确认节点上报的 mthreads.com/gpu 资源与可用卡数:

节点资源

五、容器占卡测试

在 Pod yaml 中申请摩尔线程卡(示例占用 2 张卡):

容器 yaml 占用 2 张卡

进入容器后用 mthreads-gmi 确认占用的卡:

容器内 mthreads-gmi

六、平台侧配置与使用

资源名映射(平台已内置,无需修改):

GPU_RESOURCE = {
    ...
    "mthread": "mthreads.com/gpu"    # 摩尔线程
}

任务中申请:在 Notebook / 推理服务 / 任务流的「GPU」字段填 数量(型号key),如申请 2 张摩尔线程卡填 2(mthread)——平台自动解析映射到底层 K8s 资源名。

分布式训练:分布式任务模板侧同样内置 mthread 映射,多机训练任务可直接申请摩尔线程卡。

七、实测:摩尔线程卡上部署 DeepSeek

接入完成后,在 CubeStudio 推理服务中直接用摩尔线程卡部署 DeepSeek 大模型:

平台部署 DeepSeek

部署完成后测试推理接口,问答正常返回:

DeepSeek 接口测试

「国产 GPU 跑国产大模型」这条链路在摩尔线程上完整可用。

八、进阶:sGPU 虚拟化切分

平台部署的 HAMi 调度配置已预置摩尔线程虚拟化资源段,支持三维切分

资源名维度
mthreads.com/vgpu切分数量
mthreads.com/sgpu-memory显存配额
mthreads.com/sgpu-core算力核配额

需要多任务共享单张摩尔线程卡时,可按 HAMi 官方文档启用,用法与 NVIDIA vGPU 切分一致——开发调试、小模型推理场景可显著提升单卡利用率。

配置完成后,摩尔线程卡即纳入平台统一算力池:多资源组、项目组配额、计量计费、监控告警全部生效。同样的接入框架也适用于昇腾、寒武纪、海光、沐曦、昆仑芯、壁仞等其他国产算力。


了解更多

CubeStudio 采用 MIT 开源协议,开源免费商用并支持源码交付与二次分发,开源版本已有数千家企业私有化部署。