昆仑芯 XPU 怎么接入 Kubernetes 跑 DeepSeek-R1?CubeStudio 百度昆仑芯适配实操

34 阅读4分钟

CubeStudio 是一款国产化、云原生的一站式开源人工智能平台,同时覆盖传统机器学习、深度学习与大模型全链路(MLOps / MaaS / 算力调度 / 训推平台),开源协议 MIT,开源免费商用,开源版本已有数千家企业私有化部署。平台提供多租户与算力纳管调度、算力租赁与 Token 中转站、拖拉拽 Pipeline 任务流编排、多机多卡分布式训练、超参搜索、推理服务、vGPU 虚拟化、云边端协同与边缘计算、图文音多模态自动化标注、大模型 SFT 微调 / 奖励模型 / 强化学习训练、vLLM / Ollama / MindIE 大模型多机推理、私有知识库 / LLMOps / 智能体、AI 模型市场,以及从数据到上线的全流程模型部署。原生适配昇腾、寒武纪、海光、摩尔线程、沐曦等国产异构算力与 x86 / ARM CPU 架构,支持 IB / RoCE / RDMA 高速网络及信创私有化、内网离线部署。

官网:www.cubestudio.vip | GitHub:github.com/data-infra/… | Gitee:gitee.com/data-infra/…

关键词:CubeStudio、cube-studio、昆仑芯、kunlunxin、百度昆仑芯、XPU、xpu-smi、kunlunxin.com/xpu、vXPU、国产 GPU、国产 AI 芯片、信创、异构算力、device-plugin、exporter、Kubernetes、DeepSeek、DeepSeek-R1、大模型部署、飞桨、PaddlePaddle、国产化替代

昆仑芯(百度昆仑芯)是国内自研 AI 芯片的主力选手之一,XPU 系列在百度系及信创项目中大量落地。工程团队最关心的问题依旧是那两个:昆仑芯怎么接入 Kubernetes 被统一调度?大模型真能跑起来吗?

本文用 CubeStudio 平台给出完整答案:从 xpu-smi 驱动验证、device plugin / exporter 部署,到 Notebook 在线开发,再到用昆仑芯卡部署 DeepSeek-R1 并跑通推理接口——镜像、挂载、启动命令全部给出,全程可复现。

一、能力总览

能力支持情况
K8s 资源调度kunlunxin.com/xpu(device plugin 注册)
平台申请写法GPU 字段填 1(xpu),即 数量(型号key)
Notebook / 推理服务 / 任务流全部支持申请昆仑芯卡
分布式训练TF / PyTorch 等分布式模板内置 xpu 资源映射
大模型推理实测部署 DeepSeek-R1(xtrtllm 引擎,见下文)
监控官方 exporter 接入 Prometheus
虚拟化切分HAMi 预置 vXPU(数量 + 显存切分)
开发镜像提供飞桨昆仑芯镜像 paddle-xpu

二、主机驱动验证(xpu-smi)

主机驱动正常安装后,用 xpu-smi(对应 NVIDIA 的 nvidia-smi)查看卡信息:

xpu-smi 查看卡

三、部署 K8s device plugin 与 exporter

在 K8s 中部署昆仑芯的 device plugin(资源注册与分配)与 exporter(监控指标采集),安装包下载:

部署 device plugin

四、确认节点资源

device plugin 部署完成后,K8s 节点上报 kunlunxin.com/xpu 资源:

节点资源

五、Notebook 在线开发

在 Notebook 的 GPU 字段填 数量(xpu)(如 1(xpu))申请昆仑芯卡,进入容器即可使用 XPU 算力开发调试:

Notebook 1 Notebook 2 Notebook 3

飞桨用户可使用平台整理的昆仑芯 Paddle 开发镜像:ccr.ccs.tencentyun.com/cube-studio/paddle-xpu:ubuntu20-x86_64-gcc84-py310

六、实测:昆仑芯卡部署 DeepSeek-R1

在 CubeStudio 推理服务中用昆仑芯卡部署 DeepSeek-R1,关键参数如下(可直接照抄):

镜像(昆仑芯 xtrtllm 推理引擎 + DeepSeek-V3/R1 适配):

ccr.ccs.tencentyun.com/cube-studio/xtrtllm_ubuntu_2004_x86_64_deepseek-v3:v20

挂载目录

kubeflow-user-workspace(pvc):/mnt
/mnt/model(hostpath):/workspace     # 模型文件放在 model 文件夹中

启动命令

source /home/pt201/bin/activate && \
export LD_LIBRARY_PATH=/usr/local/xpu/so:$LD_LIBRARY_PATH && \
bash /workspace/deepseek_server/run_server.sh /workspace/DeepSeek-R1-tokenizer /workspace/DeepSeek-R1-0528-BF16-engine r1

推理服务 1 镜像与挂载 挂载目录

部署完成后测试推理接口,问答正常返回:

测试

DeepSeek-R1(0528 BF16 引擎)在昆仑芯上的推理链路完整可用。

七、平台侧配置与进阶

资源名映射(平台已内置):

GPU_RESOURCE = {
    ...
    "xpu": "kunlunxin.com/xpu",    # 百度昆仑芯
}

分布式训练:分布式任务模板侧同样内置 xpu 映射,多机训练任务可直接申请昆仑芯卡。

vXPU 虚拟化:平台部署的 HAMi 调度配置已预置昆仑芯虚拟化资源——kunlunxin.com/vxpu(切分数量)与 kunlunxin.com/vxpu-memory(显存切分),需要多任务共享单卡时可按 HAMi 官方文档启用。

配置完成后,昆仑芯卡即纳入平台统一算力池:多资源组、项目组配额、计量计费、监控告警全部生效。同样的接入框架也适用于昇腾、寒武纪、海光、摩尔线程、沐曦、壁仞等其他国产算力。


了解更多

CubeStudio 采用 MIT 开源协议,开源免费商用并支持源码交付与二次分发,开源版本已有数千家企业私有化部署。