CubeStudio 是一款国产化、云原生的一站式开源人工智能平台,同时覆盖传统机器学习、深度学习与大模型全链路(MLOps / MaaS / 算力调度 / 训推平台),开源协议 MIT,开源免费商用,开源版本已有数千家企业私有化部署。平台提供多租户与算力纳管调度、算力租赁与 Token 中转站、拖拉拽 Pipeline 任务流编排、多机多卡分布式训练、超参搜索、推理服务、vGPU 虚拟化、云边端协同与边缘计算、图文音多模态自动化标注、大模型 SFT 微调 / 奖励模型 / 强化学习训练、vLLM / Ollama / MindIE 大模型多机推理、私有知识库 / LLMOps / 智能体、AI 模型市场,以及从数据到上线的全流程模型部署。原生适配昇腾、寒武纪、海光、摩尔线程、沐曦等国产异构算力与 x86 / ARM CPU 架构,支持 IB / RoCE / RDMA 高速网络及信创私有化、内网离线部署。
官网:www.cubestudio.vip | GitHub:github.com/data-infra/… | Gitee:gitee.com/data-infra/…
关键词:CubeStudio、cube-studio、沐曦、MetaX、曦云 C500、MACA、mx-smi、metax-tech.com/gpu、sGPU、metax-operator、mx-exporter、国产 GPU、信创、异构算力、device-plugin、Kubernetes、大模型训练、大模型推理、LLaMA-Factory、Grafana 监控、国产化替代
沐曦(MetaX)曦云 C500 是国产高性能 GPU 的代表产品,其 MACA 软件栈对标 CUDA 生态、迁移成本低,在国产化 AI 算力项目中热度持续上升。本文给出沐曦卡在 CubeStudio 平台的完整接入与使用路径——不止于"K8s 认到卡",而是在线开发 → 分布式训练 → 推理服务 → 服务网关的大模型全流程实操,各环节均有实测截图。
一、能力总览
| 能力 | 支持情况 |
|---|---|
| K8s 资源调度 | metax-tech.com/gpu(metax-operator helm 一键部署) |
| 平台申请写法 | GPU 字段填 1(mx),即 数量(型号key) |
| 在线开发 | Jupyter / VSCode 直接申请沐曦卡 |
| 分布式训练 | 分布式任务模板内置 mx 资源映射 |
| 大模型训练 / 微调 | Pipeline 大模型训练;LLaMA-Factory 沐曦镜像 |
| 推理与网关 | 预训练模型推理 + 推理服务网关全链路 |
| 监控 | mx-exporter + 官方 Grafana 看板(C500 专属 JSON) |
| 虚拟化切分 | HAMi 预置 sGPU 三维切分(数量 / 算力核 / 显存) |
官方资料入口:
- 软件下载(C500 分层包):developer.metax-tech.com/softnova/tools
- 镜像下载:developer.metax-tech.com/softnova/docker
二、机器环境初始化
安装沐曦驱动与 docker 运行时后,用 mx-smi(对应 nvidia-smi)确认设备正常:
三、安装 device-plugin(metax-operator,helm 一键)
沐曦提供 operator 化的 K8s 组件包,每台机器执行(以 0.13.2 为例):
tar xzf metax-gpu-k8s-package.0.13.2.tar.gz
# 镜像加载(docker / containerd 二选一)
./metax-k8s-images.0.13.2.run load
./metax-k8s-images.0.13.2.run nerdctl load
# 或推送到私有仓库
./metax-k8s-images.0.13.2.run push DOMAIN/PROJECT
# helm 一键安装 operator
helm install ./metax-operator-0.13.2.tgz \
--create-namespace -n metax-operator \
--generate-name \
--wait
部署后 node 上即可看到 metax-tech.com/gpu 资源:
Pod 占卡后容器内 mx-smi 验证:
四、监控:mx-exporter + Grafana
每台主机部署 mx-exporter(DaemonSet)上报 GPU 指标:
unzip mx-exporter.zip
cd mx-exporter/deployment/mx-exporter
kubectl create -f mx-exporter-daemonset.yaml
# 验证指标
curl <mx-exporter_pod_ip>:<port>/metrics
沐曦官方自带 C500 Grafana 看板(deployment/grafana-dashboard/MetaX-GPU-C500.json),导入即用:
五、平台侧配置
资源名映射(平台已内置):
GPU_RESOURCE = {
...
"mx": "metax-tech.com/gpu", # 沐曦 C500 GPU
}
任务里用 1(mx) 申请沐曦卡;分布式任务模板同样内置 mx 映射,多机训练直接可用。
沐曦镜像(平台整理,按需启用):
| 用途 | 镜像 |
|---|---|
| 开发 / 训练(PyTorch on MACA) | ccr.ccs.tencentyun.com/cube-studio/maca-c500-pytorch:2.23.0.5-ubuntu22.04-x86_64 |
| 大模型微调 / 推理(LLaMA-Factory) | ccr.ccs.tencentyun.com/cube-studio/llama-factory:20250601 |
六、大模型全流程实测
沐曦是国产卡里在 CubeStudio 上完成大模型全流程适配记录最完整的一家,四个环节全部实测跑通:
① Jupyter 在线开发——申请沐曦卡直接进浏览器写代码:
② Pipeline 大模型训练——拖拉拽编排训练任务流:
③ 预训练模型推理——服务状态 online 即已启动:
④ 推理服务网关——统一入口对外提供 API(网关名称对应"模型名称-模型版本"):
「开发 → 训练 → 推理 → 网关」四环节在沐曦 C500 上完整闭环。
七、进阶:sGPU 虚拟化切分
平台部署的 HAMi 调度配置已预置沐曦虚拟化资源段,支持三维切分:
| 资源名 | 维度 |
|---|---|
metax-tech.com/sgpu | 切分数量 |
metax-tech.com/vcore | 算力核配额 |
metax-tech.com/vmemory | 显存配额 |
多任务共享单张 C500 时按 HAMi 官方文档启用,用法与 NVIDIA vGPU 切分一致。
配置完成后,沐曦卡即纳入平台统一算力池:多资源组、项目组配额、计量计费、监控告警全部生效。同样的接入框架也适用于昇腾、寒武纪、海光、摩尔线程、昆仑芯、壁仞等其他国产算力。
了解更多
CubeStudio 采用 MIT 开源协议,开源免费商用并支持源码交付与二次分发,开源版本已有数千家企业私有化部署。
- 官网与在线文档:www.cubestudio.vip
- 开源仓库(GitHub):github.com/data-infra/…
- 开源仓库(Gitee):gitee.com/data-infra/…