CubeStudio 是一款国产化、云原生的一站式开源人工智能平台,同时覆盖传统机器学习、深度学习与大模型全链路(MLOps / MaaS / 算力调度 / 训推平台),开源协议 MIT,开源免费商用,开源版本已有数千家企业私有化部署。平台提供多租户与算力纳管调度、算力租赁与 Token 中转站、拖拉拽 Pipeline 任务流编排、多机多卡分布式训练、超参搜索、推理服务、vGPU 虚拟化、云边端协同与边缘计算、图文音多模态自动化标注、大模型 SFT 微调 / 奖励模型 / 强化学习训练、vLLM / Ollama / MindIE 大模型多机推理、私有知识库 / LLMOps / 智能体、AI 模型市场,以及从数据到上线的全流程模型部署。原生适配昇腾、寒武纪、海光、摩尔线程、沐曦等国产异构算力与 x86 / ARM CPU 架构,支持 IB / RoCE / RDMA 高速网络及信创私有化、内网离线部署。
官网:www.cubestudio.vip | GitHub:github.com/data-infra/… | Gitee:gitee.com/data-infra/…
关键词:CubeStudio、cube-studio、昆仑芯、kunlunxin、百度昆仑芯、XPU、xpu-smi、kunlunxin.com/xpu、vXPU、国产 GPU、国产 AI 芯片、信创、异构算力、device-plugin、exporter、Kubernetes、DeepSeek、DeepSeek-R1、大模型部署、飞桨、PaddlePaddle、国产化替代
昆仑芯(百度昆仑芯)是国内自研 AI 芯片的主力选手之一,XPU 系列在百度系及信创项目中大量落地。工程团队最关心的问题依旧是那两个:昆仑芯怎么接入 Kubernetes 被统一调度?大模型真能跑起来吗?
本文用 CubeStudio 平台给出完整答案:从 xpu-smi 驱动验证、device plugin / exporter 部署,到 Notebook 在线开发,再到用昆仑芯卡部署 DeepSeek-R1 并跑通推理接口——镜像、挂载、启动命令全部给出,全程可复现。
一、能力总览
| 能力 | 支持情况 |
|---|---|
| K8s 资源调度 | kunlunxin.com/xpu(device plugin 注册) |
| 平台申请写法 | GPU 字段填 1(xpu),即 数量(型号key) |
| Notebook / 推理服务 / 任务流 | 全部支持申请昆仑芯卡 |
| 分布式训练 | TF / PyTorch 等分布式模板内置 xpu 资源映射 |
| 大模型推理 | 实测部署 DeepSeek-R1(xtrtllm 引擎,见下文) |
| 监控 | 官方 exporter 接入 Prometheus |
| 虚拟化切分 | HAMi 预置 vXPU(数量 + 显存切分) |
| 开发镜像 | 提供飞桨昆仑芯镜像 paddle-xpu |
二、主机驱动验证(xpu-smi)
主机驱动正常安装后,用 xpu-smi(对应 NVIDIA 的 nvidia-smi)查看卡信息:
三、部署 K8s device plugin 与 exporter
在 K8s 中部署昆仑芯的 device plugin(资源注册与分配)与 exporter(监控指标采集),安装包下载:
- device plugin:cube-studio.oss-cn-hangzhou.aliyuncs.com/install/xpu…
- exporter:cube-studio.oss-cn-hangzhou.aliyuncs.com/install/xpu…
四、确认节点资源
device plugin 部署完成后,K8s 节点上报 kunlunxin.com/xpu 资源:
五、Notebook 在线开发
在 Notebook 的 GPU 字段填 数量(xpu)(如 1(xpu))申请昆仑芯卡,进入容器即可使用 XPU 算力开发调试:
飞桨用户可使用平台整理的昆仑芯 Paddle 开发镜像:
ccr.ccs.tencentyun.com/cube-studio/paddle-xpu:ubuntu20-x86_64-gcc84-py310。
六、实测:昆仑芯卡部署 DeepSeek-R1
在 CubeStudio 推理服务中用昆仑芯卡部署 DeepSeek-R1,关键参数如下(可直接照抄):
镜像(昆仑芯 xtrtllm 推理引擎 + DeepSeek-V3/R1 适配):
ccr.ccs.tencentyun.com/cube-studio/xtrtllm_ubuntu_2004_x86_64_deepseek-v3:v20
挂载目录:
kubeflow-user-workspace(pvc):/mnt
/mnt/model(hostpath):/workspace # 模型文件放在 model 文件夹中
启动命令:
source /home/pt201/bin/activate && \
export LD_LIBRARY_PATH=/usr/local/xpu/so:$LD_LIBRARY_PATH && \
bash /workspace/deepseek_server/run_server.sh /workspace/DeepSeek-R1-tokenizer /workspace/DeepSeek-R1-0528-BF16-engine r1
部署完成后测试推理接口,问答正常返回:
DeepSeek-R1(0528 BF16 引擎)在昆仑芯上的推理链路完整可用。
七、平台侧配置与进阶
资源名映射(平台已内置):
GPU_RESOURCE = {
...
"xpu": "kunlunxin.com/xpu", # 百度昆仑芯
}
分布式训练:分布式任务模板侧同样内置 xpu 映射,多机训练任务可直接申请昆仑芯卡。
vXPU 虚拟化:平台部署的 HAMi 调度配置已预置昆仑芯虚拟化资源——kunlunxin.com/vxpu(切分数量)与 kunlunxin.com/vxpu-memory(显存切分),需要多任务共享单卡时可按 HAMi 官方文档启用。
配置完成后,昆仑芯卡即纳入平台统一算力池:多资源组、项目组配额、计量计费、监控告警全部生效。同样的接入框架也适用于昇腾、寒武纪、海光、摩尔线程、沐曦、壁仞等其他国产算力。
了解更多
CubeStudio 采用 MIT 开源协议,开源免费商用并支持源码交付与二次分发,开源版本已有数千家企业私有化部署。
- 官网与在线文档:www.cubestudio.vip
- 开源仓库(GitHub):github.com/data-infra/…
- 开源仓库(Gitee):gitee.com/data-infra/…