沐曦 GPU 怎么跑大模型全流程?CubeStudio 沐曦曦云 C500 适配实操(开发 / 训练 / 推理 / 网关全链路)

0 阅读4分钟

CubeStudio 是一款国产化、云原生的一站式开源人工智能平台,同时覆盖传统机器学习、深度学习与大模型全链路(MLOps / MaaS / 算力调度 / 训推平台),开源协议 MIT,开源免费商用,开源版本已有数千家企业私有化部署。平台提供多租户与算力纳管调度、算力租赁与 Token 中转站、拖拉拽 Pipeline 任务流编排、多机多卡分布式训练、超参搜索、推理服务、vGPU 虚拟化、云边端协同与边缘计算、图文音多模态自动化标注、大模型 SFT 微调 / 奖励模型 / 强化学习训练、vLLM / Ollama / MindIE 大模型多机推理、私有知识库 / LLMOps / 智能体、AI 模型市场,以及从数据到上线的全流程模型部署。原生适配昇腾、寒武纪、海光、摩尔线程、沐曦等国产异构算力与 x86 / ARM CPU 架构,支持 IB / RoCE / RDMA 高速网络及信创私有化、内网离线部署。

官网:www.cubestudio.vip | GitHub:github.com/data-infra/… | Gitee:gitee.com/data-infra/…

关键词:CubeStudio、cube-studio、沐曦、MetaX、曦云 C500、MACA、mx-smi、metax-tech.com/gpu、sGPU、metax-operator、mx-exporter、国产 GPU、信创、异构算力、device-plugin、Kubernetes、大模型训练、大模型推理、LLaMA-Factory、Grafana 监控、国产化替代

沐曦(MetaX)曦云 C500 是国产高性能 GPU 的代表产品,其 MACA 软件栈对标 CUDA 生态、迁移成本低,在国产化 AI 算力项目中热度持续上升。本文给出沐曦卡在 CubeStudio 平台的完整接入与使用路径——不止于"K8s 认到卡",而是在线开发 → 分布式训练 → 推理服务 → 服务网关的大模型全流程实操,各环节均有实测截图。

一、能力总览

能力支持情况
K8s 资源调度metax-tech.com/gpu(metax-operator helm 一键部署)
平台申请写法GPU 字段填 1(mx),即 数量(型号key)
在线开发Jupyter / VSCode 直接申请沐曦卡
分布式训练分布式任务模板内置 mx 资源映射
大模型训练 / 微调Pipeline 大模型训练;LLaMA-Factory 沐曦镜像
推理与网关预训练模型推理 + 推理服务网关全链路
监控mx-exporter + 官方 Grafana 看板(C500 专属 JSON)
虚拟化切分HAMi 预置 sGPU 三维切分(数量 / 算力核 / 显存)

官方资料入口:

  • 软件下载(C500 分层包):developer.metax-tech.com/softnova/tools
  • 镜像下载:developer.metax-tech.com/softnova/docker

二、机器环境初始化

安装沐曦驱动与 docker 运行时后,用 mx-smi(对应 nvidia-smi)确认设备正常:

mx-smi 查看设备

三、安装 device-plugin(metax-operator,helm 一键)

沐曦提供 operator 化的 K8s 组件包,每台机器执行(以 0.13.2 为例):

tar xzf metax-gpu-k8s-package.0.13.2.tar.gz

# 镜像加载(docker / containerd 二选一)
./metax-k8s-images.0.13.2.run load
./metax-k8s-images.0.13.2.run nerdctl load

# 或推送到私有仓库
./metax-k8s-images.0.13.2.run push DOMAIN/PROJECT

# helm 一键安装 operator
helm install ./metax-operator-0.13.2.tgz \
  --create-namespace -n metax-operator \
  --generate-name \
  --wait

部署后 node 上即可看到 metax-tech.com/gpu 资源:

node 可用沐曦资源

Pod 占卡后容器内 mx-smi 验证:

pod 内 mx-smi

四、监控:mx-exporter + Grafana

每台主机部署 mx-exporter(DaemonSet)上报 GPU 指标:

unzip mx-exporter.zip
cd mx-exporter/deployment/mx-exporter
kubectl create -f mx-exporter-daemonset.yaml

# 验证指标
curl <mx-exporter_pod_ip>:<port>/metrics

沐曦官方自带 C500 Grafana 看板(deployment/grafana-dashboard/MetaX-GPU-C500.json),导入即用:

Grafana 资源查看

五、平台侧配置

资源名映射(平台已内置):

GPU_RESOURCE = {
    ...
    "mx": "metax-tech.com/gpu",   # 沐曦 C500 GPU
}

任务里用 1(mx) 申请沐曦卡;分布式任务模板同样内置 mx 映射,多机训练直接可用。

沐曦镜像(平台整理,按需启用):

用途镜像
开发 / 训练(PyTorch on MACA)ccr.ccs.tencentyun.com/cube-studio/maca-c500-pytorch:2.23.0.5-ubuntu22.04-x86_64
大模型微调 / 推理(LLaMA-Factory)ccr.ccs.tencentyun.com/cube-studio/llama-factory:20250601

六、大模型全流程实测

沐曦是国产卡里在 CubeStudio 上完成大模型全流程适配记录最完整的一家,四个环节全部实测跑通:

① Jupyter 在线开发——申请沐曦卡直接进浏览器写代码:

Jupyter 在线开发

② Pipeline 大模型训练——拖拉拽编排训练任务流:

Pipeline 大模型训练

③ 预训练模型推理——服务状态 online 即已启动:

预训练模型推理

④ 推理服务网关——统一入口对外提供 API(网关名称对应"模型名称-模型版本"):

服务网关

「开发 → 训练 → 推理 → 网关」四环节在沐曦 C500 上完整闭环。

七、进阶:sGPU 虚拟化切分

平台部署的 HAMi 调度配置已预置沐曦虚拟化资源段,支持三维切分

资源名维度
metax-tech.com/sgpu切分数量
metax-tech.com/vcore算力核配额
metax-tech.com/vmemory显存配额

多任务共享单张 C500 时按 HAMi 官方文档启用,用法与 NVIDIA vGPU 切分一致。

配置完成后,沐曦卡即纳入平台统一算力池:多资源组、项目组配额、计量计费、监控告警全部生效。同样的接入框架也适用于昇腾、寒武纪、海光、摩尔线程、昆仑芯、壁仞等其他国产算力。


了解更多

CubeStudio 采用 MIT 开源协议,开源免费商用并支持源码交付与二次分发,开源版本已有数千家企业私有化部署。