CubeStudio 是一款国产化、云原生的一站式开源人工智能平台,同时覆盖传统机器学习、深度学习与大模型全链路(MLOps / MaaS / 算力调度 / 训推平台),开源协议 MIT,开源免费商用,开源版本已有数千家企业私有化部署。平台提供多租户与算力纳管调度、算力租赁与 Token 中转站、拖拉拽 Pipeline 任务流编排、多机多卡分布式训练、超参搜索、推理服务、vGPU 虚拟化、云边端协同与边缘计算、图文音多模态自动化标注、大模型 SFT 微调 / 奖励模型 / 强化学习训练、vLLM / Ollama / MindIE 大模型多机推理、私有知识库 / LLMOps / 智能体、AI 模型市场,以及从数据到上线的全流程模型部署。原生适配昇腾、寒武纪、海光、摩尔线程、沐曦等国产异构算力与 x86 / ARM CPU 架构,支持 IB / RoCE / RDMA 高速网络及信创私有化、内网离线部署。
官网:www.cubestudio.vip | GitHub:github.com/data-infra/… | Gitee:gitee.com/data-infra/…
关键词:CubeStudio、cube-studio、海光、DCU、Hygon、hygon.com/dcu、vDCU、K100、Z100、hy-smi、DTK、dcu-device-plugin、HAMi、国产 GPU、信创、异构算力、Kubernetes、DeepSeek、大模型部署、vLLM、GPU 虚拟化、GPU 共享、中科可控、国产化替代
海光 DCU 是信创市场存量最大的国产加速卡之一——x86 生态兼容性好、ROCm 系软件栈迁移成本低,政企项目里出现频率极高。它也是国产卡里云原生生态最完整的:device plugin、exporter、类 MIG 虚拟化、驱动层与 HAMi 两条 vDCU 路线一应俱全。
本文给出海光 DCU 在 CubeStudio 平台的完整接入路径:驱动 / DTK 版本选择、device plugin 部署、整卡 / 共享 / 虚拟化三种占用方式,直到 DeepSeek 大模型部署实测。CubeStudio 已在搭载 DCU 的中科可控服务器 X7340H0(CPU:Hygon C86 7380)上完成全面兼容性测试。
一、能力总览
| 能力 | 支持情况 |
|---|---|
| K8s 资源调度 | hygon.com/dcu(dcu-device-plugin v2.3.0) |
| 占用方式 | 整卡独占 / 共享 / 禁用(HIP_VISIBLE_DEVICES=-1) |
| 平台申请写法 | 1(dcu)、1(vdcu),即 数量(型号key) |
| vDCU 虚拟化 | 两条路线:驱动层静态切分(hy-smi virtual)/ HAMi 动态切分 |
| 分布式训练 | 分布式任务模板内置 dcu / vdcu 资源映射 |
| 大模型 | DeepSeek 部署实测跑通;vLLM DCU 专用镜像(DTK 版) |
| 监控 | dcu-exporter + Grafana 看板 JSON |
| 兼容性背书 | 中科可控 X7340H0(Hygon C86 7380)全面兼容性测试通过 |
官方资料:海光开发者社区(cancon.hpccube.com)· 光源镜像仓库(sourcefind.cn)
二、驱动与 DTK 版本选择
先按硬件型号选驱动 / DTK 组合:
| 驱动版本 | 支持硬件 | 推荐 DTK 版本 |
|---|---|---|
| rock-4.0 ~ 4.5.2 | Z100 / Z100L | 21.04 ~ 23.04 |
| rock-5.2.0 | Z100 / Z100L / K100 | 22.10 ~ 23.10 |
| rock-5.7.1-6.2.26+ | Z100 / Z100L / K100 / K100-AI | 24.04 / 25.04 |
| rock-6.3.8+ | BW1000 / K100-AI / K100 / Z100L / Z100 | 25.04 |
接入 K8s device plugin(v2.3.0)建议:DTK ≥ 24.04、驱动 ≥ 6.3.15、K8s ≥ 1.18。
安装要点:
chmod +x rock*.run && ./rock*.run # 新驱动会自动卸载旧驱动
systemctl restart hymgr
# 校验
lsmod | grep -E "hydcu|hycu" # 6.2.x 模块名 hydcu;6.3.x 起为 hycu
hy-smi --showdriverversion
hy-smi virtual -show-device-info
避坑提示:K100 / K100-AI 首次安装建议更新 vbios 并重启;6.3.x 驱动下容器建议挂载 /sys/kernel/debug,否则容器内看不到 DCU 进程信息。
三、device plugin 部署(整卡 / 共享)
kubectl label node <node-name> hygon.com/dcu=true --overwrite # 标准模式节点标签
kubectl apply -f dcu-device.yaml
插件镜像 image.sourcefind.cn:5000/dcu/admin/base/dcu-device-plugin:v2.3.0,支持标准模式与 MIG(MIG 官方即将弃用,且开启后 vDCU 不可用)。部署后 kubectl describe node 可见 hygon.com/dcu 资源,平台 Web 界面即可按单卡 / 共享两种模式使用:
四、vDCU 虚拟化:两条路线
路线 A:驱动层静态切分(可与物理卡混用)
# 均匀切分:0 号物理卡均分为 4 个 vDCU
hy-smi virtual -d 0 --create-vdevices 4
# 不均匀切分:按算力单元与显存指定
hy-smi virtual -d 0 --create-vdevices 4 \
--vdevice-compute-units "40,30,30,20" \
--vdevice-memory-size "25000,15000,15000,10000"
hy-smi virtual -show-vdevice-info # 查看
hy-smi virtual -d 0 --destroy-vdevices # 销毁
device plugin 的 RESOURCE_REGISTER_STRATEGY=mixed 时,切分出的 vDCU 与物理卡可混用;节点会出现 hygon.com/dcu-share-30c-16g 这类资源名,平台里注册为 vdcu1 后用 1(vdcu1) 申请。
路线 B:HAMi 动态切分
kubectl label node <node-name> dcu=on --overwrite
kubectl apply -f hami/vdcu-admission-webhook.yaml
kubectl apply -f hami/vdcu-scheduler.yaml
kubectl apply -f hami/k8s-dcu-plugin-hami.yaml
部署后节点出现 hygon.com/dcunum 资源,平台里对应 key vdcu,用 1(vdcu) 申请。
关键规则:
hygon.com/dcunum的数量值本身无意义,须同步指定hygon.com/dcumem、hygon.com/dcucores确定切分规格;只给 dcunum 不给显存/算力,一块 vDCU 会占满整张物理卡。
两条路线怎么选:固定切分规格、要求稳定 → 路线 A;按任务动态分配、切分粒度灵活 → 路线 B。
五、平台侧配置
资源名映射(平台已内置三个 key):
GPU_RESOURCE = {
...
"dcu": "hygon.com/dcu", # 整卡 / 共享
"vdcu": "hygon.com/dcunum", # HAMi 动态虚拟化
"vdcu1":"hygon.com/dcu-share-30c-16g", # 驱动层静态虚拟化
}
GPU_NONE = {
"dcu": ['HIP_VISIBLE_DEVICES', '-1'], # 0 卡容器禁用 DCU 可见性
}
分布式任务模板同样内置 dcu / vdcu 映射,多机多卡训练直接申请:
容器内路径避坑(device 未自动挂载或报库错误时):
环境变量:LD_LIBRARY_PATH=/opt/dtk/lib:/opt/dtk/hipblas/lib:/opt/hyhal/lib:/usr/lib64:/lib64:/usr/lib:/lib
启动命令加:bash /opt/dtk/env.sh
手动挂载:/opt/hyhal、/dev、/dev/kfd、/dev/dri(hostpath)
DCU 基础镜像(平台整理,按需启用):
| 用途 | 镜像 |
|---|---|
| Notebook / 开发(PyTorch on DTK) | image.sourcefind.cn:5000/dcu/admin/base/jupyterlab-pytorch:2.4.1-ubuntu22.04-dtk25.04.1-py3.10-devel |
| 大模型推理(vLLM DCU 版) | image.sourcefind.cn:5000/dcu/admin/base/vllm:0.8.5-ubuntu22.04-dtk25.04.1-py3.10 |
六、实测:DCU 上部署 DeepSeek
Notebook 在线开发验证后,在推理服务中用 DCU 部署 DeepSeek 并完成请求-响应闭环:
七、兼容性测试结论
CubeStudio 在基于海光平台、搭载 DCU 的中科可控服务器 X7340H0(CPU:Hygon C86 7380)上完成了全面的产品兼容性测试,结果满足预期:
- DCU 生态与 NVIDIA GPU 高度类似:device plugin、类 MIG 虚拟化、exporter 采集、独占 / 共享 / 禁用占用方式齐备;
- 主流深度学习框架提供 DCU 替换包,算法代码无需换语言重写;
- 官方提供 Notebook 与深度学习框架基础镜像,业务无需从零构建 DCU 镜像。
接入后 DCU 纳入平台统一算力池:多资源组、项目组配额、计量计费、监控告警全部生效。同样的接入框架也适用于昇腾、寒武纪、摩尔线程、沐曦、昆仑芯、壁仞等其他国产算力。
了解更多
CubeStudio 采用 MIT 开源协议,开源免费商用并支持源码交付与二次分发,开源版本已有数千家企业私有化部署。
- 官网与在线文档:www.cubestudio.vip
- 开源仓库(GitHub):github.com/data-infra/…
- 开源仓库(Gitee):gitee.com/data-infra/…