海光 DCU 怎么接入 Kubernetes 和 AI 平台?CubeStudio 海光 DCU 适配实操(整卡 / 共享 / 两种 vDCU 虚拟化 + DeepSeek 部署)

0 阅读6分钟

CubeStudio 是一款国产化、云原生的一站式开源人工智能平台,同时覆盖传统机器学习、深度学习与大模型全链路(MLOps / MaaS / 算力调度 / 训推平台),开源协议 MIT,开源免费商用,开源版本已有数千家企业私有化部署。平台提供多租户与算力纳管调度、算力租赁与 Token 中转站、拖拉拽 Pipeline 任务流编排、多机多卡分布式训练、超参搜索、推理服务、vGPU 虚拟化、云边端协同与边缘计算、图文音多模态自动化标注、大模型 SFT 微调 / 奖励模型 / 强化学习训练、vLLM / Ollama / MindIE 大模型多机推理、私有知识库 / LLMOps / 智能体、AI 模型市场,以及从数据到上线的全流程模型部署。原生适配昇腾、寒武纪、海光、摩尔线程、沐曦等国产异构算力与 x86 / ARM CPU 架构,支持 IB / RoCE / RDMA 高速网络及信创私有化、内网离线部署。

官网:www.cubestudio.vip | GitHub:github.com/data-infra/… | Gitee:gitee.com/data-infra/…

关键词:CubeStudio、cube-studio、海光、DCU、Hygon、hygon.com/dcu、vDCU、K100、Z100、hy-smi、DTK、dcu-device-plugin、HAMi、国产 GPU、信创、异构算力、Kubernetes、DeepSeek、大模型部署、vLLM、GPU 虚拟化、GPU 共享、中科可控、国产化替代

海光 DCU 是信创市场存量最大的国产加速卡之一——x86 生态兼容性好、ROCm 系软件栈迁移成本低,政企项目里出现频率极高。它也是国产卡里云原生生态最完整的:device plugin、exporter、类 MIG 虚拟化、驱动层与 HAMi 两条 vDCU 路线一应俱全。

本文给出海光 DCU 在 CubeStudio 平台的完整接入路径:驱动 / DTK 版本选择、device plugin 部署、整卡 / 共享 / 虚拟化三种占用方式,直到 DeepSeek 大模型部署实测。CubeStudio 已在搭载 DCU 的中科可控服务器 X7340H0(CPU:Hygon C86 7380)上完成全面兼容性测试。

一、能力总览

能力支持情况
K8s 资源调度hygon.com/dcu(dcu-device-plugin v2.3.0)
占用方式整卡独占 / 共享 / 禁用(HIP_VISIBLE_DEVICES=-1
平台申请写法1(dcu)1(vdcu),即 数量(型号key)
vDCU 虚拟化两条路线:驱动层静态切分(hy-smi virtual)/ HAMi 动态切分
分布式训练分布式任务模板内置 dcu / vdcu 资源映射
大模型DeepSeek 部署实测跑通;vLLM DCU 专用镜像(DTK 版)
监控dcu-exporter + Grafana 看板 JSON
兼容性背书中科可控 X7340H0(Hygon C86 7380)全面兼容性测试通过

官方资料:海光开发者社区(cancon.hpccube.com)· 光源镜像仓库(sourcefind.cn)

二、驱动与 DTK 版本选择

先按硬件型号选驱动 / DTK 组合:

驱动版本支持硬件推荐 DTK 版本
rock-4.0 ~ 4.5.2Z100 / Z100L21.04 ~ 23.04
rock-5.2.0Z100 / Z100L / K10022.10 ~ 23.10
rock-5.7.1-6.2.26+Z100 / Z100L / K100 / K100-AI24.04 / 25.04
rock-6.3.8+BW1000 / K100-AI / K100 / Z100L / Z10025.04

接入 K8s device plugin(v2.3.0)建议:DTK ≥ 24.04、驱动 ≥ 6.3.15、K8s ≥ 1.18。

安装要点:

chmod +x rock*.run && ./rock*.run     # 新驱动会自动卸载旧驱动
systemctl restart hymgr

# 校验
lsmod | grep -E "hydcu|hycu"          # 6.2.x 模块名 hydcu;6.3.x 起为 hycu
hy-smi --showdriverversion
hy-smi virtual -show-device-info

避坑提示:K100 / K100-AI 首次安装建议更新 vbios 并重启;6.3.x 驱动下容器建议挂载 /sys/kernel/debug,否则容器内看不到 DCU 进程信息。

三、device plugin 部署(整卡 / 共享)

kubectl label node <node-name> hygon.com/dcu=true --overwrite   # 标准模式节点标签
kubectl apply -f dcu-device.yaml

插件镜像 image.sourcefind.cn:5000/dcu/admin/base/dcu-device-plugin:v2.3.0,支持标准模式与 MIG(MIG 官方即将弃用,且开启后 vDCU 不可用)。部署后 kubectl describe node 可见 hygon.com/dcu 资源,平台 Web 界面即可按单卡 / 共享两种模式使用:

web 界面选择 DCU

四、vDCU 虚拟化:两条路线

路线 A:驱动层静态切分(可与物理卡混用)

# 均匀切分:0 号物理卡均分为 4 个 vDCU
hy-smi virtual -d 0 --create-vdevices 4

# 不均匀切分:按算力单元与显存指定
hy-smi virtual -d 0 --create-vdevices 4 \
  --vdevice-compute-units "40,30,30,20" \
  --vdevice-memory-size "25000,15000,15000,10000"

hy-smi virtual -show-vdevice-info      # 查看
hy-smi virtual -d 0 --destroy-vdevices # 销毁

device plugin 的 RESOURCE_REGISTER_STRATEGY=mixed 时,切分出的 vDCU 与物理卡可混用;节点会出现 hygon.com/dcu-share-30c-16g 这类资源名,平台里注册为 vdcu1 后用 1(vdcu1) 申请。

路线 B:HAMi 动态切分

kubectl label node <node-name> dcu=on --overwrite
kubectl apply -f hami/vdcu-admission-webhook.yaml
kubectl apply -f hami/vdcu-scheduler.yaml
kubectl apply -f hami/k8s-dcu-plugin-hami.yaml

部署后节点出现 hygon.com/dcunum 资源,平台里对应 key vdcu,用 1(vdcu) 申请。

关键规则:hygon.com/dcunum 的数量值本身无意义,须同步指定 hygon.com/dcumemhygon.com/dcucores 确定切分规格;只给 dcunum 不给显存/算力,一块 vDCU 会占满整张物理卡。

两条路线怎么选:固定切分规格、要求稳定 → 路线 A;按任务动态分配、切分粒度灵活 → 路线 B。

五、平台侧配置

资源名映射(平台已内置三个 key):

GPU_RESOURCE = {
    ...
    "dcu":  "hygon.com/dcu",                # 整卡 / 共享
    "vdcu": "hygon.com/dcunum",             # HAMi 动态虚拟化
    "vdcu1":"hygon.com/dcu-share-30c-16g",  # 驱动层静态虚拟化
}
GPU_NONE = {
    "dcu": ['HIP_VISIBLE_DEVICES', '-1'],   # 0 卡容器禁用 DCU 可见性
}

分布式任务模板同样内置 dcu / vdcu 映射,多机多卡训练直接申请:

Pipeline 分布式训练

容器内路径避坑(device 未自动挂载或报库错误时):

环境变量:LD_LIBRARY_PATH=/opt/dtk/lib:/opt/dtk/hipblas/lib:/opt/hyhal/lib:/usr/lib64:/lib64:/usr/lib:/lib
启动命令加:bash /opt/dtk/env.sh
手动挂载:/opt/hyhal、/dev、/dev/kfd、/dev/dri(hostpath)

DCU 基础镜像(平台整理,按需启用):

用途镜像
Notebook / 开发(PyTorch on DTK)image.sourcefind.cn:5000/dcu/admin/base/jupyterlab-pytorch:2.4.1-ubuntu22.04-dtk25.04.1-py3.10-devel
大模型推理(vLLM DCU 版)image.sourcefind.cn:5000/dcu/admin/base/vllm:0.8.5-ubuntu22.04-dtk25.04.1-py3.10

六、实测:DCU 上部署 DeepSeek

Notebook 在线开发验证后,在推理服务中用 DCU 部署 DeepSeek 并完成请求-响应闭环:

Notebook 在线开发

DeepSeek 部署

客户端请求返回

七、兼容性测试结论

CubeStudio 在基于海光平台、搭载 DCU 的中科可控服务器 X7340H0(CPU:Hygon C86 7380)上完成了全面的产品兼容性测试,结果满足预期:

  • DCU 生态与 NVIDIA GPU 高度类似:device plugin、类 MIG 虚拟化、exporter 采集、独占 / 共享 / 禁用占用方式齐备;
  • 主流深度学习框架提供 DCU 替换包,算法代码无需换语言重写;
  • 官方提供 Notebook 与深度学习框架基础镜像,业务无需从零构建 DCU 镜像。

接入后 DCU 纳入平台统一算力池:多资源组、项目组配额、计量计费、监控告警全部生效。同样的接入框架也适用于昇腾、寒武纪、摩尔线程、沐曦、昆仑芯、壁仞等其他国产算力。


了解更多

CubeStudio 采用 MIT 开源协议,开源免费商用并支持源码交付与二次分发,开源版本已有数千家企业私有化部署。