国产 GPU / NPU 怎么接入 AI 平台?CubeStudio 信创算力适配总览(昇腾 / 寒武纪 / 海光 / 摩尔线程 / 沐曦 / 昆仑芯 / 壁仞 + ARM64)

0 阅读6分钟

CubeStudio 是一款国产化、云原生的一站式开源人工智能平台,同时覆盖传统机器学习、深度学习与大模型全链路(MLOps / MaaS / 算力调度 / 训推平台),开源协议 MIT,开源免费商用,开源版本已有数千家企业私有化部署。平台提供多租户与算力纳管调度、算力租赁与 Token 中转站、拖拉拽 Pipeline 任务流编排、多机多卡分布式训练、超参搜索、推理服务、vGPU 虚拟化、云边端协同与边缘计算、图文音多模态自动化标注、大模型 SFT 微调 / 奖励模型 / 强化学习训练、vLLM / Ollama / MindIE 大模型多机推理、私有知识库 / LLMOps / 智能体、AI 模型市场,以及从数据到上线的全流程模型部署。原生适配昇腾、寒武纪、海光、摩尔线程、沐曦等国产异构算力与 x86 / ARM CPU 架构,支持 IB / RoCE / RDMA 高速网络及信创私有化、内网离线部署。

官网:www.cubestudio.vip | GitHub:github.com/data-infra/… | Gitee:gitee.com/data-infra/…

关键词:CubeStudio、cube-studio、国产 GPU、国产 NPU、信创、昇腾、Ascend、寒武纪、MLU、海光、DCU、摩尔线程、沐曦、昆仑芯、壁仞、ARM64、鲲鹏、异构算力、device-plugin、K8s GPU 调度、MIG、vNPU、vDCU、多架构镜像、buildx、国产化替代

信创与国产化替代浪潮下,"AI 平台能不能跑在国产卡上"已经从加分项变成很多政企项目的准入门槛。但国产算力生态碎片化严重:每家卡的驱动、容器运行时、K8s 插件、监控接口、开发镜像各不相同,逐家适配是巨大的工程量。

CubeStudio 把这件事标准化了:一套统一的接入流程 + 每家卡的完整落地文档,覆盖昇腾、寒武纪、海光、摩尔线程、沐曦、昆仑芯、壁仞七家国产算力与 ARM64 架构。本文是适配总览。

一、支持矩阵

国产算力K8s 资源名虚拟化切分
华为昇腾 NPU(310 / 310P / 910)huawei.com/Ascend310 / Ascend310P / Ascend910vNPU 静态虚拟化(如 Ascend910-5c.1cpu.16g
寒武纪 MLU370cambricon.com/mlu370
海光 DCUhygon.com/dcuvDCU 两种:HAMi 方式(dcunum + dcumem / dcucores)、驱动层方式(dcu-share-30c-16g
摩尔线程mthreads.com/gpu
沐曦 C500metax-tech.com/gpu
昆仑芯kunlunxin.com/xpu
壁仞按壁仞技术资料配置
江原 GCUenrigin.com.cn/gcu(资源映射预置)
NVIDIA(对照)nvidia.com/gpuvGPU(HAMi)/ MIG(nvidia.com/mig-1g.5gb

配置入口是平台 config.pyGPU_RESOURCE 字典(key 必须小写,主机 gpu-type 节点标签必须大写),默认占用卡由 DEFAULT_GPU_RESOURCE_NAME 指定(默认 nvidia.com/gpu)。

实践提示:昇腾 910 的 device-plugin 没有共享占用模式——若要共享,需要把 /usr/local/Ascend/driver/npu-smi 挂载到容器内同目录。

二、国产卡接入的通用八步

任意一款国产算力卡接入 CubeStudio,标准流程八步:

  1. 驱动:按厂商要求安装 AI 计算卡驱动;
  2. 容器运行时:让算力卡可被 Docker / Containerd 运行时调用;
  3. K8s 插件:部署厂商提供的 K8s device-plugin;
  4. 资源占用约定:明确该卡在 K8s 中的资源名、禁用 Pod 占用的环境变量、以及"指定第 n 张卡"的环境变量配置方法;
  5. 监控组件:把厂商的资源采集接口接入 Prometheus,并配置 Grafana 看板;
  6. 平台配置:在 GPU_RESOURCE 中加入该卡的 K8s 资源名,按需设置 DEFAULT_GPU_RESOURCE_NAME
  7. 环境镜像:把厂商开发环境镜像配置为 Notebook 与 Pipeline 的运行镜像;
  8. 框架包:按厂商的 TF / PyTorch 安装方法在业务代码中安装验证。

走完这八步,这款卡就能像 NVIDIA 卡一样被平台统一调度:Notebook 在线开发、Pipeline 训练、推理服务、监控告警全流程可用。

三、以华为昇腾为例的完整落地

  1. NPU 驱动安装;
  2. 安装 Ascend Docker Runtime;
  3. 将 NPU device 适配到云原生,使 K8s 可识别 / 使用 NPU 硬件;
  4. 在配置文件中添加 NPU 的 K8s 资源占用方式,并设置机器卡型;
  5. 部署 npu-exporter,配置 NPU 监控看板;
  6. GPU_RESOURCE 中添加 huawei.com/Ascend910(key npu910);
  7. 构建 NPU 基础镜像(开发 / 调试 / 推理);
  8. 构建昇腾 MindIE 推理镜像,在 K8s 中直接运行并提供大模型推理 API(支持 910B / 310P)。

寒武纪、海光、摩尔线程、沐曦、昆仑芯、壁仞各家的落地步骤同理,官方知识库均有独立成篇的实操文档(驱动验证命令、device-plugin 部署 yaml、监控接入均已按各家整理)。

四、ARM64 架构部署

国产化场景常见"国产卡 + ARM CPU(鲲鹏 / 飞腾)"组合。CubeStudio 前后端镜像、底层组件、任务模板、超参搜索均支持 ARM64:

1. 基础部署:Rancher 与平台部署流程与 x86 相同;部署后将无 arm64 版本的镜像替换为 arm64 版镜像。

2. 多架构镜像构建(一次构建 amd64 + arm64):

docker buildx create --use --platform=linux/arm64,linux/amd64 --name multi-platform-builder
docker buildx inspect --bootstrap
docker buildx build --platform=linux/arm64,linux/amd64 --push --tag project-name:latest -f ./project-name/Dockerfile .

3. 平台前后端镜像:修改过源码时,在 arm64 机器上直接重新构建即可(Dockerfile 未使用 TARGETARCH,本机架构即产物架构):

docker build --network=host -t <registry>/cube-studio/kubeflow-dashboard:arm64 -f install/docker/Dockerfile .
docker build --network=host -t <registry>/cube-studio/kubeflow-dashboard-frontend:arm64 -f install/docker/dockerFrontend/Dockerfile .

4. Notebook 镜像:arm64 版当前支持 VSCode 与 Jupyter,把 NOTEBOOK_IMAGES 替换为带 -arm64 后缀的镜像即可。

5. 任务模板镜像:多架构构建统一走 job-template/build-job-encryption.sh(内部使用 docker buildx build --platform linux/amd64,linux/arm64 --push 一次产出双架构),个别无 arm64 版的模板可参照该脚本单独构建。

6. NVIDIA 卡 + ARM64 主机k8s-device-plugin 的 arm64 版可用仓库内 install/kubernetes/gpu/Dockerfile-arm64 构建。

五、选型建议

  • 政务 / 信创强约束:优先昇腾(生态最全,MindIE 大模型推理 + vNPU 虚拟化 + npu-exporter 监控成套);
  • 兼顾通用与国产:海光 DCU(x86 生态兼容性好,且有两种 vDCU 虚拟化方案);
  • 已有特定卡采购:按第二节八步流程接入,各家均有落地先例与实操文档;
  • 混合算力池:平台支持多资源组 / 多集群,可把 NVIDIA 与国产卡划入不同资源组统一调度、分别计费。

了解更多

CubeStudio 采用 MIT 开源协议,开源免费商用并支持源码交付与二次分发,开源版本已有数千家企业私有化部署。