MiniMax H3 量化版 Linux服务器部署实战 <ComfyUI启动 包含踩坑记录>

22 阅读10分钟

MiniMax H3 量化版本地部署实战:ComfyUI启动 包含踩坑记录

minimax-h3.png

说实话,在前两天 MiniMax [H3](MiniMax-H3 · 模型库) 刚发布时,最让我眼前一亮的不是参数表,而是它能把画面和立体声音频一次生成出来。第一次在 ComfyUI 里真正跑通 5-15 秒视频,看到画面、环境声和节奏一起出来,那种感觉很直接:这次不只是“能生成视频”,而是真的有点作品味了!并且能够在自己本地化部署就有这种效果真的很惊讶,对比与之前的LTX 2.3 以及 Wan 效果上好了太多。个人感觉目前暂只弱于在 Seedance ,毕竟这个不需要Seedance那么高昂的价格使用~

兴奋归兴奋,真正把模型搬到本地服务器上,还是会碰到一连串很现实的问题:到底该下载哪些权重?下载哪些 torch 版本、哪些 cuda 版本,并且两者之间是什么关系?模型跑通后,又该怎样让 ComfyUI 稳定常驻?这些问题如果不提前理清,很容易在几百 GB 的权重和不同 CUDA 版本之间来回折腾。

这篇文章记录的就是这次完整落地过程。服务器有两张 RTX 4090,但本文只指定物理 GPU1 运行 ComfyUI,不讨论另一张卡上的服务。从虚拟环境、量化权重和模型路径,到 T2V、I2V、R2V 三种工作流与 systemd 托管,全部按真实执行顺序整理,命令可以直接跟着操作。

本文只安装运行 MiniMax H3 所需的 CUDA Runtime。基础部署不需要系统 CUDA Toolkit,也不要求 nvcc;源码编译 SageAttention 才需要,相关内容放在系列第二篇SageAttention使用中。

代码块中以 # 开头的独立行是说明性注释,Bash、.env 和 systemd 读取时会忽略,可以和命令一起复制。不要把注释移动到以 `` 结尾的续行后面。

一、实测环境与部署结构

本文环境不是最低配置,而是一套真实运行环境。

项目实测配置
操作系统Ubuntu 24.04 amd64
系统内存48GB
GPU2 × NVIDIA GeForce RTX 4090 48GB(本文使用物理 GPU1)
NVIDIA 驱动580.126.09
nvidia-smi 显示的 CUDA 版本13.0
Python3.12.13
PyTorch2.13.0+cu130
ComfyUI0.30.0
comfy-kitchen0.2.26
comfy-aimdo0.4.11

部署完成后的目录结构如下:

 /home/your-user/projects/comfyui-minimax-h3/
 ├── .venv/
 ├── .env
 ├── app/                         # ComfyUI 0.30.0
 │   └── extra_model_paths.yaml
 └── start-comfyui-h3.sh
 ​
 /data/models/hf/MiniMax-H3-Comfy/
 ├── diffusion_models/
 ├── text_encoders/
 └── vae/

本文通过 CUDA_VISIBLE_DEVICES=1 只向 ComfyUI 暴露物理 GPU1。进程内部会将唯一可见的卡重新编号为逻辑 cuda:0,因此日志出现 cuda:0 属于正常映射;宿主机上的 nvidia-smi 仍会显示任务位于物理 GPU1。

二、安装基础工具并创建 ComfyUI 环境

先安装基础依赖:

 # 刷新 Ubuntu 软件包索引
 sudo apt-get update
 ​
 # 安装下载、会话和视频处理依赖
 sudo apt-get install -y \
   git curl wget ca-certificates tmux \
   ffmpeg libgl1 libglib2.0-0

除了 Git 和下载工具,ffmpeg 用于视频相关处理,libgl1libglib2.0-0 则避免部分图像/视频依赖在无桌面服务器上缺少运行库。

image.png

安装 uv 后创建项目:

 # 安装 uv,并让当前 Shell 立即识别 uv
 curl -LsSf https://astral.sh/uv/install.sh | sh
 source "$HOME/.local/bin/env"
 ​
 # 创建独立项目目录
 mkdir -p /home/your-user/projects/comfyui-minimax-h3
 cd /home/your-user/projects/comfyui-minimax-h3
 ​
 # 固定 ComfyUI 版本,避免后续主分支更新改变依赖
 git clone \
   --branch v0.30.0 \
   --depth 1 \
   https://github.com/Comfy-Org/ComfyUI.git \
   app
 ​
 # 使用 uv 安装 Python 3.12 并创建项目虚拟环境
 uv python install 3.12
 uv venv --python 3.12 --seed .venv
 source .venv/bin/activate
 ​
 # 核对 Python 和 ComfyUI 版本
 python --version
 git -C app describe --tags --always

克隆时看到 detached HEAD 是按标签检出时的正常提示。部署环境应保持在经过验证的版本,不需要在该目录直接开发提交。

从 ComfyUI 官方仓库检出 v0.30.0image.png

随后确认 ComfyUI 标签、uv 管理的 Python 版本和虚拟环境均正确:

验证 ComfyUI 0.30.0 并创建 Python 3.12 uv 虚拟环境image.png

模型、缓存和生成目录放在 /data,避免占满项目盘:

 # 创建模型、缓存和生成文件目录
 sudo mkdir -p \
   /data/models/hf/MiniMax-H3-Comfy \
   /data/cache/modelscope \
   /data/cache/huggingface \
   /data/comfyui-h3/input \
   /data/comfyui-h3/output \
   /data/comfyui-h3/temp
 ​
 # 将目录所有权交给当前登录用户
 sudo chown -R "$(id -un):$(id -gn)" \
   /data/models/hf/MiniMax-H3-Comfy \
   /data/cache/modelscope \
   /data/cache/huggingface \
   /data/comfyui-h3

三、安装 PyTorch cu130 和 ComfyUI 依赖

PyTorch wheel 自带 CUDA Runtime,所以这一步不需要 /usr/local/cuda-13.0,也不需要执行 nvcc --version

 cd /home/your-user/projects/comfyui-minimax-h3
 source .venv/bin/activate
 ​
 # 从 PyTorch 官方 cu130 索引安装固定版本
 uv pip install \
   "torch==2.13.0" \
   "torchvision==0.28.0" \
   "torchaudio==2.11.0" \
   --index-url https://download.pytorch.org/whl/cu130
 ​
 # 安装 ComfyUI 自身依赖
 uv pip install -r app/requirements.txt

这里固定的是本文已经验证的组合:PyTorch 2.13.0+cu130、TorchVision 0.28.0+cu130 和 TorchAudio 2.11.0+cu130。未来如果升级其中一个组件,应重新执行本节的 CUDA、矩阵和音频依赖验证,不要只因为版本号更新就直接覆盖生产环境。

为什么这里选择 cu130,而不是更新的 cu132 或 CUDA 13.3

“驱动版本”“PyTorch wheel 使用的 CUDA Runtime”和“系统 CUDA Toolkit”是三套有关联但不等价的版本。本文现场驱动是 580.126.09,PyTorch 使用官方 cu130 wheel;这一组合已经完成 MiniMax H3 原生工作流和后续 SageAttention 源码编译验证。

按照 NVIDIA CUDA 13.3 Release Notes 中的 Toolkit/Driver 对照表,Linux 上各版本直接配套的最低驱动如下:

CUDA Toolkit对应版本的最低 Linux 驱动
13.0 GA / Update 1 / Update 2580.65.06 / 580.82.07 / 580.95.05
13.1 GA / Update 1590.44.01 / 590.48.01
13.2 GA / Update 1595.45.04 / 595.58.03
13.3 GA / Update 1610.43.02

因此 580.126.09 满足 CUDA 13.0 Update 2 的直接驱动要求,但不满足 CUDA 13.1~13.3 对应 Toolkit 的直接配套版本。CUDA 13.x 还存在同一大版本内的 Minor Version Compatibility,但旧驱动可能无法提供新 Toolkit 的全部特性,不能把“最低兼容驱动为 580”理解为可以无条件混装任意 13.x 组件。

PyTorch 官方已经提供 cu132 wheel,并不意味着当前环境必须升级;更不能因为 CUDA Toolkit 13.3 更新,就假定现有驱动、PyTorch wheel 和第三方 CUDA 扩展会自动形成兼容组合。生产环境应同时核对:

  1. NVIDIA 驱动是否满足目标 Toolkit/Runtime 的要求;
  2. PyTorch 是否提供目标 CUDA 版本的官方 wheel;
  3. SageAttention 等源码扩展是否支持目标 GPU 架构与 Toolkit;
  4. 现有工作流是否完成回归验证。

本文保持 cu130,是为了减少变量并复用已经验证的组合,而不是认为更新版本本身不可用。

下载安装 CUDA Runtime 与 PyTorch wheel 时,uv 会显示各个 NVIDIA 组件的下载进度:

通过 PyTorch cu130 官方索引安装固定版本组件image.png

安装结束后可以在清单中核对 torch==2.13.0+cu130torchvision==0.28.0+cu130 和相关 CUDA 13 运行库: PyTorch cu130 与 CUDA 13 运行库安装完成image.png

接着安装 ComfyUI 0.30.0 自身依赖,包括前端、工作流模板、comfy-kitchencomfy-aimdo 和视频处理组件: image.pngimage.png

《可选操作》在本文使用的物理 GPU1 上执行验证:

 # 只向验证进程暴露物理 GPU1
 CUDA_VISIBLE_DEVICES=1 python - <<'PY'
 import torch
 import torchvision
 import torchaudio
 ​
 print("PyTorch:", torch.__version__)
 print("TorchVision:", torchvision.__version__)
 print("TorchAudio:", torchaudio.__version__)
 print("PyTorch CUDA:", torch.version.cuda)
 print("CUDA available:", torch.cuda.is_available())
 ​
 if not torch.cuda.is_available():
     raise SystemExit("CUDA 不可用")
 ​
 # 核对 GPU 名称与 Compute Capability
 print("GPU:", torch.cuda.get_device_name(0))
 print("Compute capability:", torch.cuda.get_device_capability(0))
 ​
 # 执行一次实际 CUDA 矩阵计算,而不只检查布尔状态
 x = torch.randn((1024, 1024), device="cuda", dtype=torch.float16)
 print("矩阵计算:", (x @ x).shape)
 PY

PyTorch 2.13 cu130、CUDA 与 RTX 4090 验证结果image.png

四、只下载三类工作流需要的量化权重

MiniMax H3 仓库同时包含多种精度和重复用途的权重。当时完整仓库接近 395GB,而三种官方工作流所需的量化组合约为 63.44GB。这里明确指定文件,避免误下载完整快照。

文件用途约占空间
minimax_h3_fl2va_pruned_int8_convrot.safetensorsT2V、I2V、首尾帧视频20.97GB
minimax_h3_ref2va_pruned_int8_convrot.safetensors图片/视频/音频参考生成20.97GB
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors多模态文本编码器15.69GB
minimax_h3_video_vae_fp16.safetensors视频 VAE5.21GB
minimax_h3_audio_vae_fp32.safetensors音频 VAE0.61GB

安装 ModelScope Hub 客户端:

 cd /home/your-user/projects/comfyui-minimax-h3
 source .venv/bin/activate
 ​
 # 固定经过本文验证的 ModelScope Hub 客户端版本
 uv pip install "modelscope-hub==0.1.8" huggingface_hub

本文固定使用 0.1.8。该版本发布到 PyPI 的 console entry points 是 msmodelscope,推荐优先使用短命令 ms

 # 确认 0.1.8 提供的 ms 入口及版本
 command -v ms
 ms -V
 ms --help

modelscope 是同一版本提供的第二个入口,但它可能和完整的 modelscope 框架包发生命令名覆盖。本文只安装轻量的 modelscope-hub 客户端,并统一使用 ms,避免把包名、Python 模块名和 CLI 名称混在一起。

如果 ms 仍然找不到,可以按下面顺序确认虚拟环境,并使用 Python 模块入口兜底:

 # 确认当前确实位于项目虚拟环境
 echo "$VIRTUAL_ENV"
 ​
 # 检查两个可用的 console entry point
 command -v ms || true
 command -v modelscope || true
 ls -l "$VIRTUAL_ENV/bin/ms" "$VIRTUAL_ENV/bin/modelscope" 2>/dev/null || true
 ​
 # 检查已安装文件,并测试不依赖入口脚本的模块方式
 uv pip show -f modelscope-hub
 python -m modelscope_hub.cli.main --help

只要 ms --help 或最后一条 Python 模块命令能够输出帮助,SDK 就已经可用。只有确认 .venv/bin/ms 确实缺失时,才需要在已激活的虚拟环境中执行 uv pip install --reinstall "modelscope-hub==0.1.8";无需重建整个 ComfyUI 环境。

modelscope 0.18 版本 ms指令 20 modelscope 0.18 版本 ms指令.png

modelscope 0.19以上的 版本 ms-hub指令 20 modelscope 0.19以上的 版本 ms-hub指令.png

下载需要的五个权重和 README:

 cd /home/your-user/projects/comfyui-minimax-h3
 source .venv/bin/activate
 ​
 # 指向 ModelScope 国内站,并配置缓存与大文件下载重试
 export MODELSCOPE_ENDPOINT=https://modelscope.cn
 export MODELSCOPE_CACHE=/data/cache/modelscope
 export MODELSCOPE_DOWNLOAD_PARALLEL_WORKERS=4
 export MODELSCOPE_DOWNLOAD_MAX_RETRIES=10
 ​
 # 权重直接写入 ComfyUI 使用的外部模型目录
 MODEL_DIR=/data/models/hf/MiniMax-H3-Comfy
 ​
 # 只下载三类工作流需要的量化权重,不拉取完整仓库
 ms download \
   Comfy-Org/MiniMax-H3 \
   diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors \
   diffusion_models/minimax_h3_ref2va_pruned_int8_convrot.safetensors \
   text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \
   vae/minimax_h3_video_vae_fp16.safetensors \
   vae/minimax_h3_audio_vae_fp32.safetensors \
   README.md \
   --local-dir "$MODEL_DIR"

这里明确传入了多个文件路径,0.1.8 会依次处理这些文件;--max-workers 只用于未指定文件列表的整仓 snapshot 下载,因此不在这条命令里添加。MODELSCOPE_DOWNLOAD_PARALLEL_WORKERS=4 控制的是单个大文件的分段下载并发。

如果 ms 入口脚本缺失,但 Python 模块入口可用,可以仅把首行 ms download 替换为:

 python -m modelscope_hub.cli.main download

后面的仓库、文件列表和参数保持不变。下载中断后重新执行同一条完整命令即可继续检查并下载缺失内容。

通过 ModelScope 下载 MiniMax H3 量化权重image.png

完成后检查目录和体积:

 # 按文件大小列出权重,随后检查总占用
 find /data/models/hf/MiniMax-H3-Comfy \
   -type f -printf '%s  %p\n' \
   | sort -n
 ​
 du -sh /data/models/hf/MiniMax-H3-Comfy

五、把外部模型目录接入 ComfyUI

模型不必复制进 app/models。创建 /home/your-user/projects/comfyui-minimax-h3/app/extra_model_paths.yaml

ComfyUI 仓库自带 extra_model_paths.yaml.example,可以先从示例中确认支持的键,再增加 MiniMax H3 配置。不要直接把整份示例中的无关路径全部启用。

image.png

 minimax_h3:
   base_path: /data/models/hf/MiniMax-H3-Comfy
   diffusion_models: diffusion_models
   text_encoders: text_encoders
   vae: vae

image.png 在项目根目录创建 .env

 # 本文使用物理 GPU1
 COMFYUI_PHYSICAL_GPU=1
 ​
 # 监听所有 IPv4 网卡
 COMFYUI_LISTEN=0.0.0.0
 COMFYUI_PORT=8188
 # .env 可能继续加入本地配置,因此限制为当前用户可读写
 chmod 600 /home/your-user/projects/comfyui-minimax-h3/.env

image.png

0.0.0.0 的含义是服务监听服务器所有 IPv4 网卡,不是浏览器要访问的地址。局域网访问仍然使用:

 http://SERVER_LAN_IP:8188

监听 0.0.0.0 会扩大可访问范围。不要把 8188 端口直接暴露到公网;至少应配合主机防火墙、内网 ACL、VPN 或带认证的反向代理。

六、创建带 GPU 占用检查的启动脚本

创建 /home/your-user/projects/comfyui-minimax-h3/start-comfyui-h3.sh

 #!/usr/bin/env bash
 # 任一命令失败、变量未定义或管道失败时立即退出
 set -euo pipefail
 ​
 PROJECT_DIR=/home/your-user/projects/comfyui-minimax-h3
 APP_DIR="$PROJECT_DIR/app"
 ​
 cd "$PROJECT_DIR"
 ​
 # 自动导出 .env 中读取到的变量
 set -a
 source "$PROJECT_DIR/.env"
 set +a
 ​
 GPU_ID="${COMFYUI_PHYSICAL_GPU:-1}"
 LISTEN_ADDRESS="${COMFYUI_LISTEN:-127.0.0.1}"
 LISTEN_PORT="${COMFYUI_PORT:-8188}"
 ​
 # 在启动服务前校验 GPU 编号和必要文件
 [[ "$GPU_ID" =~ ^[0-9]+$ ]] || {
   echo "Invalid GPU id: $GPU_ID" >&2
   exit 64
 }
 ​
 [[ -x "$PROJECT_DIR/.venv/bin/python" ]] || {
   echo "Python environment does not exist: $PROJECT_DIR/.venv" >&2
   exit 1
 }
 ​
 [[ -f "$APP_DIR/main.py" ]] || {
   echo "ComfyUI does not exist: $APP_DIR" >&2
   exit 1
 }
 ​
 # 若目标 GPU 已有计算进程,则以状态码 78 退出
 busy_pids="$(
   nvidia-smi \
     -i "$GPU_ID" \
     --query-compute-apps=pid \
     --format=csv,noheader,nounits 2>/dev/null \
     | sed '/^[[:space:]]*$/d' \
     || true
 )"
 ​
 if [[ -n "$busy_pids" ]]; then
   echo "Physical GPU $GPU_ID is occupied by PID(s): $busy_pids" >&2
   exit 78
 fi
 ​
 # 限定运行 GPU,并集中设置模型缓存目录
 export CUDA_VISIBLE_DEVICES="$GPU_ID"
 export HF_HOME=/data/cache/huggingface
 export HUGGINGFACE_HUB_CACHE=/data/cache/huggingface/hub
 export MODELSCOPE_CACHE=/data/cache/modelscope
 export HF_XET_HIGH_PERFORMANCE=1
 export PYTHONUNBUFFERED=1
 ​
 cd "$APP_DIR"
 ​
 # 用 ComfyUI 替换当前 Shell,使 systemd 能正确跟踪主进程
 exec "$PROJECT_DIR/.venv/bin/python" main.py \
   --listen "$LISTEN_ADDRESS" \
   --port "$LISTEN_PORT" \
   --extra-model-paths-config "$APP_DIR/extra_model_paths.yaml" \
   --input-directory /data/comfyui-h3/input \
   --output-directory /data/comfyui-h3/output \
   --temp-directory /data/comfyui-h3/temp

把脚本中的 your-user 替换为服务器真实用户名,然后检查并首次手动启动:

 # 增加执行权限,并先做 Bash 语法检查
 chmod +x /home/your-user/projects/comfyui-minimax-h3/start-comfyui-h3.sh
 bash -n /home/your-user/projects/comfyui-minimax-h3/start-comfyui-h3.sh
 ​
 # 首次前台启动,便于直接观察错误
 /home/your-user/projects/comfyui-minimax-h3/start-comfyui-h3.sh

看到 To see the GUI go to: http://0.0.0.0:8188 后,再从浏览器访问服务器实际局域网地址。

首次启动还会初始化 ComfyUI 的 SQLite 数据库和资源索引。日志最终出现 Starting server 和 GUI 地址,说明后端已经完成启动:

image.pngimage.png

七、加载官方 MiniMax H3 工作流

ComfyUI 0.30.0 及以上版本可以从模板库打开三个原生工作流:

ComfyUI 模板库中的 MiniMax H3 三种官方工作流12Snipaste_2026-08-05_21-17-22.png

工作流Diffusion Model支持的主要输入
Text-to-VideoFL2VA INT8文字
Image-to-VideoFL2VA INT8文字、首帧、可选尾帧
Reference-to-VideoRef2VA INT8文字、参考图片、参考视频、参考音频

三种工作流共用同一个 Qwen3-VL 文本编码器、Video VAE 和 Audio VAE。Ref2VA 并不能替代 FL2VA:R2V 使用 Ref2VA,而 T2V/I2V 应选择 FL2VA。

如果只运行 Reference-to-Video,可以不下载 minimax_h3_fl2va_pruned_int8_convrot.safetensors;但只要还需要文生视频或图生视频,就必须同时保留 FL2VA 权重。根据 ComfyUI 官方 H3 工作流说明,Ref2VA 可以在文字提示词之外接收最多 9 张参考图片、3 段带声音的视频和 3 段音频,并生成带原生立体声音频的视频。它是“参考条件视频生成”模型,不是可以任意接收所有模态并输出任意模态的通用多模态对话模型。

建议第一次验证使用:

 宽高比:16:9
 Megapixels:0.4
 输出分辨率:864 × 480
 Multiple:32
 时长:5 秒
 帧率:24 FPS

H3 官方分辨率选择器会把宽高约束到 32 的倍数。先用预览分辨率跑通,再逐步提高 Megapixels,定位问题会容易很多。

下图是第一次运行官方案例时的节点配置。可以同时核对 5 秒时长、FL2VA INT8、Qwen3-VL 编码器和两个 VAE 是否选择正确:

13测试官方案例实现.png

八、原生注意力下的现场结果

在 5 秒、16:9、864×480 的 T2V 工作流中,现场单次任务耗时为 113.89 秒。这个数字用于后续 SageAttention 对照,不代表所有机器都能复现相同速度。

14 5s时长16比9 864 x 480 分辨率 耗时验证 显存占用 22GB.png

对应的 nvidia-smi 现场记录显示,T2V 生成时目标 GPU 处于满负载,显存使用约 22.7GB:

image.png

同一套 FL2VA 权重也完成了图生视频,现场单次任务约 102.18 秒:

17 5s 16比9 864 x 480 分辨率 图生视频耗时大小 以及效果.png

生成过程中目标 GPU 接近满载,显存占用会随工作流、分辨率、时长和动态卸载状态变化:

18 图生视频显存显存占用大小.png

九、交给 systemd 托管

手动验证完成后,创建 /etc/systemd/system/comfyui.service

 [Unit]
 Description=ComfyUI MiniMax H3 Quantized Service
 # 等待网络就绪,并确认 ComfyUI 入口存在
 Wants=network-online.target
 After=network-online.target
 ConditionPathExists=/home/your-user/projects/comfyui-minimax-h3/app/main.py
 ​
 [Service]
 Type=simple
 User=your-user
 Group=your-user
 WorkingDirectory=/home/your-user/projects/comfyui-minimax-h3
 ExecStart=/home/your-user/projects/comfyui-minimax-h3/start-comfyui-h3.sh
 ​
 # 普通失败自动重启;GPU 被占用时不进入重启循环
 Restart=on-failure
 RestartSec=15
 RestartPreventExitStatus=78
 TimeoutStartSec=0
 LimitNOFILE=1048576
 ​
 [Install]
 WantedBy=multi-user.target

替换用户名后加载并启动:

 # unit 文件变化后重新加载 systemd 配置
 sudo systemctl daemon-reload
 ​
 # 设置开机启动并立即启动服务
 sudo systemctl enable --now comfyui.service
 ​
 # 查看当前状态与最近 200 行日志
 sudo systemctl status comfyui.service --no-pager
 journalctl -u comfyui.service -n 200 --no-pager

实时查看生成日志:

 # 持续跟踪 ComfyUI 服务日志,按 Ctrl+C 退出
 journalctl -u comfyui.service -f

image.png

RestartPreventExitStatus=78 与启动脚本的 GPU 占用检查配合:如果目标 GPU 已被其他计算任务占用,服务会明确退出,而不是持续重启并争抢显存。

十、常见问题

1. 如何确认 ComfyUI 实际使用的 GPU?

本文把 COMFYUI_PHYSICAL_GPU 设置为 1CUDA_VISIBLE_DEVICES=1 生效后,物理 GPU1 会成为进程内唯一可见的卡,因此日志显示逻辑 cuda:0。可以在宿主机执行 nvidia-smi,根据 ComfyUI 的 Python PID、显存占用和 GPU 利用率确认任务实际位于物理 GPU1。

2. 为什么会出现 ms-hub: command not found

因为 modelscope-hub==0.1.8 在 PyPI 中注册的命令是 msmodelscope,不是 ms-hub。所以这个报错首先说明命令名不属于当前安装版本,并不代表依赖没有安装,也不代表 0.1.8 太旧。因为 ms-hub 这个指令是 modelscope-hub>0.1.8 的版本中才替换的。所以如果下载的是大于 0.1.8 版本 那么就是将 原来的指令中 ms 换成 ms-hubmodelscope 换成 modelscope-hub

先确认虚拟环境并使用正确入口:

 source /home/your-user/projects/comfyui-minimax-h3/.venv/bin/activate
 ​
 # 主入口:modelscope-hub 0.1.8 提供的 ms
 command -v ms || true
 ms --help
 ​
 # 备用入口
 command -v modelscope || true
 uv pip show -f modelscope-hub
 python -m modelscope_hub.cli.main --help

本文的命令优先级是:ms → Python 模块入口;modelscope 只作为备用,因为安装完整 ModelScope 框架后可能发生同名入口覆盖。文章不再使用 ms-hubmodelscope-hub

3. 出现 VRAM grow failed

这类错误不一定等于显卡物理显存耗尽。MiniMax H3 会使用 DynamicVRAM、CPU 卸载和 pinned memory,系统主存不足、主存压力或其他进程占用也可能导致扩容失败。

依次检查:

 # 分别检查显存、系统主存和占用主存最多的进程
 nvidia-smi
 free -h
 ps -eo pid,comm,rss --sort=-rss | head

处理顺序建议为:停止无关任务、降低 Megapixels 或时长、重启 ComfyUI 清理 CUDA 状态,最后再考虑增加系统内存。本文环境从较低主存升级到 48GB 后,动态卸载空间更充裕,但具体需求仍取决于工作流。

十一、结语

到这里,MiniMax H3 的量化权重、三种官方工作流和 systemd 常驻已经形成一个完整基线。先保留这个原生注意力基线,再安装加速组件,才能判断加速是否真实有效,也能在发生问题时快速回退。

下一篇:MiniMax H3 接入 SageAttention 实测加速 <ComfyUI 启动 包含踩坑记录>

参考资料