MiniMax H3 量化版本地部署实战:ComfyUI启动 包含踩坑记录
说实话,在前两天 MiniMax [H3](MiniMax-H3 · 模型库) 刚发布时,最让我眼前一亮的不是参数表,而是它能把画面和立体声音频一次生成出来。第一次在 ComfyUI 里真正跑通 5-15 秒视频,看到画面、环境声和节奏一起出来,那种感觉很直接:这次不只是“能生成视频”,而是真的有点作品味了!并且能够在自己本地化部署就有这种效果真的很惊讶,对比与之前的LTX 2.3 以及 Wan 效果上好了太多。个人感觉目前暂只弱于在 Seedance ,毕竟这个不需要Seedance那么高昂的价格使用~
兴奋归兴奋,真正把模型搬到本地服务器上,还是会碰到一连串很现实的问题:到底该下载哪些权重?下载哪些 torch 版本、哪些 cuda 版本,并且两者之间是什么关系?模型跑通后,又该怎样让 ComfyUI 稳定常驻?这些问题如果不提前理清,很容易在几百 GB 的权重和不同 CUDA 版本之间来回折腾。
这篇文章记录的就是这次完整落地过程。服务器有两张 RTX 4090,但本文只指定物理 GPU1 运行 ComfyUI,不讨论另一张卡上的服务。从虚拟环境、量化权重和模型路径,到 T2V、I2V、R2V 三种工作流与 systemd 托管,全部按真实执行顺序整理,命令可以直接跟着操作。
本文只安装运行 MiniMax H3 所需的 CUDA Runtime。基础部署不需要系统 CUDA Toolkit,也不要求
nvcc;源码编译 SageAttention 才需要,相关内容放在系列第二篇SageAttention使用中。
代码块中以
#开头的独立行是说明性注释,Bash、.env和 systemd 读取时会忽略,可以和命令一起复制。不要把注释移动到以 `` 结尾的续行后面。
一、实测环境与部署结构
本文环境不是最低配置,而是一套真实运行环境。
| 项目 | 实测配置 |
|---|---|
| 操作系统 | Ubuntu 24.04 amd64 |
| 系统内存 | 48GB |
| GPU | 2 × NVIDIA GeForce RTX 4090 48GB(本文使用物理 GPU1) |
| NVIDIA 驱动 | 580.126.09 |
nvidia-smi 显示的 CUDA 版本 | 13.0 |
| Python | 3.12.13 |
| PyTorch | 2.13.0+cu130 |
| ComfyUI | 0.30.0 |
| comfy-kitchen | 0.2.26 |
| comfy-aimdo | 0.4.11 |
部署完成后的目录结构如下:
/home/your-user/projects/comfyui-minimax-h3/
├── .venv/
├── .env
├── app/ # ComfyUI 0.30.0
│ └── extra_model_paths.yaml
└── start-comfyui-h3.sh
/data/models/hf/MiniMax-H3-Comfy/
├── diffusion_models/
├── text_encoders/
└── vae/
本文通过 CUDA_VISIBLE_DEVICES=1 只向 ComfyUI 暴露物理 GPU1。进程内部会将唯一可见的卡重新编号为逻辑 cuda:0,因此日志出现 cuda:0 属于正常映射;宿主机上的 nvidia-smi 仍会显示任务位于物理 GPU1。
二、安装基础工具并创建 ComfyUI 环境
先安装基础依赖:
# 刷新 Ubuntu 软件包索引
sudo apt-get update
# 安装下载、会话和视频处理依赖
sudo apt-get install -y \
git curl wget ca-certificates tmux \
ffmpeg libgl1 libglib2.0-0
除了 Git 和下载工具,ffmpeg 用于视频相关处理,libgl1、libglib2.0-0 则避免部分图像/视频依赖在无桌面服务器上缺少运行库。
安装 uv 后创建项目:
# 安装 uv,并让当前 Shell 立即识别 uv
curl -LsSf https://astral.sh/uv/install.sh | sh
source "$HOME/.local/bin/env"
# 创建独立项目目录
mkdir -p /home/your-user/projects/comfyui-minimax-h3
cd /home/your-user/projects/comfyui-minimax-h3
# 固定 ComfyUI 版本,避免后续主分支更新改变依赖
git clone \
--branch v0.30.0 \
--depth 1 \
https://github.com/Comfy-Org/ComfyUI.git \
app
# 使用 uv 安装 Python 3.12 并创建项目虚拟环境
uv python install 3.12
uv venv --python 3.12 --seed .venv
source .venv/bin/activate
# 核对 Python 和 ComfyUI 版本
python --version
git -C app describe --tags --always
克隆时看到 detached HEAD 是按标签检出时的正常提示。部署环境应保持在经过验证的版本,不需要在该目录直接开发提交。
随后确认 ComfyUI 标签、uv 管理的 Python 版本和虚拟环境均正确:
模型、缓存和生成目录放在 /data,避免占满项目盘:
# 创建模型、缓存和生成文件目录
sudo mkdir -p \
/data/models/hf/MiniMax-H3-Comfy \
/data/cache/modelscope \
/data/cache/huggingface \
/data/comfyui-h3/input \
/data/comfyui-h3/output \
/data/comfyui-h3/temp
# 将目录所有权交给当前登录用户
sudo chown -R "$(id -un):$(id -gn)" \
/data/models/hf/MiniMax-H3-Comfy \
/data/cache/modelscope \
/data/cache/huggingface \
/data/comfyui-h3
三、安装 PyTorch cu130 和 ComfyUI 依赖
PyTorch wheel 自带 CUDA Runtime,所以这一步不需要 /usr/local/cuda-13.0,也不需要执行 nvcc --version。
cd /home/your-user/projects/comfyui-minimax-h3
source .venv/bin/activate
# 从 PyTorch 官方 cu130 索引安装固定版本
uv pip install \
"torch==2.13.0" \
"torchvision==0.28.0" \
"torchaudio==2.11.0" \
--index-url https://download.pytorch.org/whl/cu130
# 安装 ComfyUI 自身依赖
uv pip install -r app/requirements.txt
这里固定的是本文已经验证的组合:PyTorch 2.13.0+cu130、TorchVision 0.28.0+cu130 和 TorchAudio 2.11.0+cu130。未来如果升级其中一个组件,应重新执行本节的 CUDA、矩阵和音频依赖验证,不要只因为版本号更新就直接覆盖生产环境。
为什么这里选择 cu130,而不是更新的 cu132 或 CUDA 13.3
“驱动版本”“PyTorch wheel 使用的 CUDA Runtime”和“系统 CUDA Toolkit”是三套有关联但不等价的版本。本文现场驱动是 580.126.09,PyTorch 使用官方 cu130 wheel;这一组合已经完成 MiniMax H3 原生工作流和后续 SageAttention 源码编译验证。
按照 NVIDIA CUDA 13.3 Release Notes 中的 Toolkit/Driver 对照表,Linux 上各版本直接配套的最低驱动如下:
| CUDA Toolkit | 对应版本的最低 Linux 驱动 |
|---|---|
| 13.0 GA / Update 1 / Update 2 | 580.65.06 / 580.82.07 / 580.95.05 |
| 13.1 GA / Update 1 | 590.44.01 / 590.48.01 |
| 13.2 GA / Update 1 | 595.45.04 / 595.58.03 |
| 13.3 GA / Update 1 | 610.43.02 |
因此 580.126.09 满足 CUDA 13.0 Update 2 的直接驱动要求,但不满足 CUDA 13.1~13.3 对应 Toolkit 的直接配套版本。CUDA 13.x 还存在同一大版本内的 Minor Version Compatibility,但旧驱动可能无法提供新 Toolkit 的全部特性,不能把“最低兼容驱动为 580”理解为可以无条件混装任意 13.x 组件。
PyTorch 官方已经提供 cu132 wheel,并不意味着当前环境必须升级;更不能因为 CUDA Toolkit 13.3 更新,就假定现有驱动、PyTorch wheel 和第三方 CUDA 扩展会自动形成兼容组合。生产环境应同时核对:
- NVIDIA 驱动是否满足目标 Toolkit/Runtime 的要求;
- PyTorch 是否提供目标 CUDA 版本的官方 wheel;
- SageAttention 等源码扩展是否支持目标 GPU 架构与 Toolkit;
- 现有工作流是否完成回归验证。
本文保持 cu130,是为了减少变量并复用已经验证的组合,而不是认为更新版本本身不可用。
下载安装 CUDA Runtime 与 PyTorch wheel 时,uv 会显示各个 NVIDIA 组件的下载进度:
安装结束后可以在清单中核对 torch==2.13.0+cu130、torchvision==0.28.0+cu130 和相关 CUDA 13 运行库:
接着安装 ComfyUI 0.30.0 自身依赖,包括前端、工作流模板、comfy-kitchen、comfy-aimdo 和视频处理组件:
《可选操作》在本文使用的物理 GPU1 上执行验证:
# 只向验证进程暴露物理 GPU1
CUDA_VISIBLE_DEVICES=1 python - <<'PY'
import torch
import torchvision
import torchaudio
print("PyTorch:", torch.__version__)
print("TorchVision:", torchvision.__version__)
print("TorchAudio:", torchaudio.__version__)
print("PyTorch CUDA:", torch.version.cuda)
print("CUDA available:", torch.cuda.is_available())
if not torch.cuda.is_available():
raise SystemExit("CUDA 不可用")
# 核对 GPU 名称与 Compute Capability
print("GPU:", torch.cuda.get_device_name(0))
print("Compute capability:", torch.cuda.get_device_capability(0))
# 执行一次实际 CUDA 矩阵计算,而不只检查布尔状态
x = torch.randn((1024, 1024), device="cuda", dtype=torch.float16)
print("矩阵计算:", (x @ x).shape)
PY
四、只下载三类工作流需要的量化权重
MiniMax H3 仓库同时包含多种精度和重复用途的权重。当时完整仓库接近 395GB,而三种官方工作流所需的量化组合约为 63.44GB。这里明确指定文件,避免误下载完整快照。
| 文件 | 用途 | 约占空间 |
|---|---|---|
minimax_h3_fl2va_pruned_int8_convrot.safetensors | T2V、I2V、首尾帧视频 | 20.97GB |
minimax_h3_ref2va_pruned_int8_convrot.safetensors | 图片/视频/音频参考生成 | 20.97GB |
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | 多模态文本编码器 | 15.69GB |
minimax_h3_video_vae_fp16.safetensors | 视频 VAE | 5.21GB |
minimax_h3_audio_vae_fp32.safetensors | 音频 VAE | 0.61GB |
安装 ModelScope Hub 客户端:
cd /home/your-user/projects/comfyui-minimax-h3
source .venv/bin/activate
# 固定经过本文验证的 ModelScope Hub 客户端版本
uv pip install "modelscope-hub==0.1.8" huggingface_hub
本文固定使用 0.1.8。该版本发布到 PyPI 的 console entry points 是 ms 和 modelscope,推荐优先使用短命令 ms:
# 确认 0.1.8 提供的 ms 入口及版本
command -v ms
ms -V
ms --help
modelscope 是同一版本提供的第二个入口,但它可能和完整的 modelscope 框架包发生命令名覆盖。本文只安装轻量的 modelscope-hub 客户端,并统一使用 ms,避免把包名、Python 模块名和 CLI 名称混在一起。
如果 ms 仍然找不到,可以按下面顺序确认虚拟环境,并使用 Python 模块入口兜底:
# 确认当前确实位于项目虚拟环境
echo "$VIRTUAL_ENV"
# 检查两个可用的 console entry point
command -v ms || true
command -v modelscope || true
ls -l "$VIRTUAL_ENV/bin/ms" "$VIRTUAL_ENV/bin/modelscope" 2>/dev/null || true
# 检查已安装文件,并测试不依赖入口脚本的模块方式
uv pip show -f modelscope-hub
python -m modelscope_hub.cli.main --help
只要 ms --help 或最后一条 Python 模块命令能够输出帮助,SDK 就已经可用。只有确认 .venv/bin/ms 确实缺失时,才需要在已激活的虚拟环境中执行 uv pip install --reinstall "modelscope-hub==0.1.8";无需重建整个 ComfyUI 环境。
modelscope 0.18 版本 ms指令
modelscope 0.19以上的 版本 ms-hub指令
下载需要的五个权重和 README:
cd /home/your-user/projects/comfyui-minimax-h3
source .venv/bin/activate
# 指向 ModelScope 国内站,并配置缓存与大文件下载重试
export MODELSCOPE_ENDPOINT=https://modelscope.cn
export MODELSCOPE_CACHE=/data/cache/modelscope
export MODELSCOPE_DOWNLOAD_PARALLEL_WORKERS=4
export MODELSCOPE_DOWNLOAD_MAX_RETRIES=10
# 权重直接写入 ComfyUI 使用的外部模型目录
MODEL_DIR=/data/models/hf/MiniMax-H3-Comfy
# 只下载三类工作流需要的量化权重,不拉取完整仓库
ms download \
Comfy-Org/MiniMax-H3 \
diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors \
diffusion_models/minimax_h3_ref2va_pruned_int8_convrot.safetensors \
text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \
vae/minimax_h3_video_vae_fp16.safetensors \
vae/minimax_h3_audio_vae_fp32.safetensors \
README.md \
--local-dir "$MODEL_DIR"
这里明确传入了多个文件路径,0.1.8 会依次处理这些文件;--max-workers 只用于未指定文件列表的整仓 snapshot 下载,因此不在这条命令里添加。MODELSCOPE_DOWNLOAD_PARALLEL_WORKERS=4 控制的是单个大文件的分段下载并发。
如果 ms 入口脚本缺失,但 Python 模块入口可用,可以仅把首行 ms download 替换为:
python -m modelscope_hub.cli.main download
后面的仓库、文件列表和参数保持不变。下载中断后重新执行同一条完整命令即可继续检查并下载缺失内容。
完成后检查目录和体积:
# 按文件大小列出权重,随后检查总占用
find /data/models/hf/MiniMax-H3-Comfy \
-type f -printf '%s %p\n' \
| sort -n
du -sh /data/models/hf/MiniMax-H3-Comfy
五、把外部模型目录接入 ComfyUI
模型不必复制进 app/models。创建 /home/your-user/projects/comfyui-minimax-h3/app/extra_model_paths.yaml:
ComfyUI 仓库自带 extra_model_paths.yaml.example,可以先从示例中确认支持的键,再增加 MiniMax H3 配置。不要直接把整份示例中的无关路径全部启用。
minimax_h3:
base_path: /data/models/hf/MiniMax-H3-Comfy
diffusion_models: diffusion_models
text_encoders: text_encoders
vae: vae
在项目根目录创建
.env:
# 本文使用物理 GPU1
COMFYUI_PHYSICAL_GPU=1
# 监听所有 IPv4 网卡
COMFYUI_LISTEN=0.0.0.0
COMFYUI_PORT=8188
# .env 可能继续加入本地配置,因此限制为当前用户可读写
chmod 600 /home/your-user/projects/comfyui-minimax-h3/.env
0.0.0.0 的含义是服务监听服务器所有 IPv4 网卡,不是浏览器要访问的地址。局域网访问仍然使用:
http://SERVER_LAN_IP:8188
监听 0.0.0.0 会扩大可访问范围。不要把 8188 端口直接暴露到公网;至少应配合主机防火墙、内网 ACL、VPN 或带认证的反向代理。
六、创建带 GPU 占用检查的启动脚本
创建 /home/your-user/projects/comfyui-minimax-h3/start-comfyui-h3.sh:
#!/usr/bin/env bash
# 任一命令失败、变量未定义或管道失败时立即退出
set -euo pipefail
PROJECT_DIR=/home/your-user/projects/comfyui-minimax-h3
APP_DIR="$PROJECT_DIR/app"
cd "$PROJECT_DIR"
# 自动导出 .env 中读取到的变量
set -a
source "$PROJECT_DIR/.env"
set +a
GPU_ID="${COMFYUI_PHYSICAL_GPU:-1}"
LISTEN_ADDRESS="${COMFYUI_LISTEN:-127.0.0.1}"
LISTEN_PORT="${COMFYUI_PORT:-8188}"
# 在启动服务前校验 GPU 编号和必要文件
[[ "$GPU_ID" =~ ^[0-9]+$ ]] || {
echo "Invalid GPU id: $GPU_ID" >&2
exit 64
}
[[ -x "$PROJECT_DIR/.venv/bin/python" ]] || {
echo "Python environment does not exist: $PROJECT_DIR/.venv" >&2
exit 1
}
[[ -f "$APP_DIR/main.py" ]] || {
echo "ComfyUI does not exist: $APP_DIR" >&2
exit 1
}
# 若目标 GPU 已有计算进程,则以状态码 78 退出
busy_pids="$(
nvidia-smi \
-i "$GPU_ID" \
--query-compute-apps=pid \
--format=csv,noheader,nounits 2>/dev/null \
| sed '/^[[:space:]]*$/d' \
|| true
)"
if [[ -n "$busy_pids" ]]; then
echo "Physical GPU $GPU_ID is occupied by PID(s): $busy_pids" >&2
exit 78
fi
# 限定运行 GPU,并集中设置模型缓存目录
export CUDA_VISIBLE_DEVICES="$GPU_ID"
export HF_HOME=/data/cache/huggingface
export HUGGINGFACE_HUB_CACHE=/data/cache/huggingface/hub
export MODELSCOPE_CACHE=/data/cache/modelscope
export HF_XET_HIGH_PERFORMANCE=1
export PYTHONUNBUFFERED=1
cd "$APP_DIR"
# 用 ComfyUI 替换当前 Shell,使 systemd 能正确跟踪主进程
exec "$PROJECT_DIR/.venv/bin/python" main.py \
--listen "$LISTEN_ADDRESS" \
--port "$LISTEN_PORT" \
--extra-model-paths-config "$APP_DIR/extra_model_paths.yaml" \
--input-directory /data/comfyui-h3/input \
--output-directory /data/comfyui-h3/output \
--temp-directory /data/comfyui-h3/temp
把脚本中的 your-user 替换为服务器真实用户名,然后检查并首次手动启动:
# 增加执行权限,并先做 Bash 语法检查
chmod +x /home/your-user/projects/comfyui-minimax-h3/start-comfyui-h3.sh
bash -n /home/your-user/projects/comfyui-minimax-h3/start-comfyui-h3.sh
# 首次前台启动,便于直接观察错误
/home/your-user/projects/comfyui-minimax-h3/start-comfyui-h3.sh
看到 To see the GUI go to: http://0.0.0.0:8188 后,再从浏览器访问服务器实际局域网地址。
首次启动还会初始化 ComfyUI 的 SQLite 数据库和资源索引。日志最终出现 Starting server 和 GUI 地址,说明后端已经完成启动:
七、加载官方 MiniMax H3 工作流
ComfyUI 0.30.0 及以上版本可以从模板库打开三个原生工作流:
| 工作流 | Diffusion Model | 支持的主要输入 |
|---|---|---|
| Text-to-Video | FL2VA INT8 | 文字 |
| Image-to-Video | FL2VA INT8 | 文字、首帧、可选尾帧 |
| Reference-to-Video | Ref2VA INT8 | 文字、参考图片、参考视频、参考音频 |
三种工作流共用同一个 Qwen3-VL 文本编码器、Video VAE 和 Audio VAE。Ref2VA 并不能替代 FL2VA:R2V 使用 Ref2VA,而 T2V/I2V 应选择 FL2VA。
如果只运行 Reference-to-Video,可以不下载 minimax_h3_fl2va_pruned_int8_convrot.safetensors;但只要还需要文生视频或图生视频,就必须同时保留 FL2VA 权重。根据 ComfyUI 官方 H3 工作流说明,Ref2VA 可以在文字提示词之外接收最多 9 张参考图片、3 段带声音的视频和 3 段音频,并生成带原生立体声音频的视频。它是“参考条件视频生成”模型,不是可以任意接收所有模态并输出任意模态的通用多模态对话模型。
建议第一次验证使用:
宽高比:16:9
Megapixels:0.4
输出分辨率:864 × 480
Multiple:32
时长:5 秒
帧率:24 FPS
H3 官方分辨率选择器会把宽高约束到 32 的倍数。先用预览分辨率跑通,再逐步提高 Megapixels,定位问题会容易很多。
下图是第一次运行官方案例时的节点配置。可以同时核对 5 秒时长、FL2VA INT8、Qwen3-VL 编码器和两个 VAE 是否选择正确:
八、原生注意力下的现场结果
在 5 秒、16:9、864×480 的 T2V 工作流中,现场单次任务耗时为 113.89 秒。这个数字用于后续 SageAttention 对照,不代表所有机器都能复现相同速度。
对应的 nvidia-smi 现场记录显示,T2V 生成时目标 GPU 处于满负载,显存使用约 22.7GB:
同一套 FL2VA 权重也完成了图生视频,现场单次任务约 102.18 秒:
生成过程中目标 GPU 接近满载,显存占用会随工作流、分辨率、时长和动态卸载状态变化:
九、交给 systemd 托管
手动验证完成后,创建 /etc/systemd/system/comfyui.service:
[Unit]
Description=ComfyUI MiniMax H3 Quantized Service
# 等待网络就绪,并确认 ComfyUI 入口存在
Wants=network-online.target
After=network-online.target
ConditionPathExists=/home/your-user/projects/comfyui-minimax-h3/app/main.py
[Service]
Type=simple
User=your-user
Group=your-user
WorkingDirectory=/home/your-user/projects/comfyui-minimax-h3
ExecStart=/home/your-user/projects/comfyui-minimax-h3/start-comfyui-h3.sh
# 普通失败自动重启;GPU 被占用时不进入重启循环
Restart=on-failure
RestartSec=15
RestartPreventExitStatus=78
TimeoutStartSec=0
LimitNOFILE=1048576
[Install]
WantedBy=multi-user.target
替换用户名后加载并启动:
# unit 文件变化后重新加载 systemd 配置
sudo systemctl daemon-reload
# 设置开机启动并立即启动服务
sudo systemctl enable --now comfyui.service
# 查看当前状态与最近 200 行日志
sudo systemctl status comfyui.service --no-pager
journalctl -u comfyui.service -n 200 --no-pager
实时查看生成日志:
# 持续跟踪 ComfyUI 服务日志,按 Ctrl+C 退出
journalctl -u comfyui.service -f
RestartPreventExitStatus=78 与启动脚本的 GPU 占用检查配合:如果目标 GPU 已被其他计算任务占用,服务会明确退出,而不是持续重启并争抢显存。
十、常见问题
1. 如何确认 ComfyUI 实际使用的 GPU?
本文把 COMFYUI_PHYSICAL_GPU 设置为 1。CUDA_VISIBLE_DEVICES=1 生效后,物理 GPU1 会成为进程内唯一可见的卡,因此日志显示逻辑 cuda:0。可以在宿主机执行 nvidia-smi,根据 ComfyUI 的 Python PID、显存占用和 GPU 利用率确认任务实际位于物理 GPU1。
2. 为什么会出现 ms-hub: command not found
因为 modelscope-hub==0.1.8 在 PyPI 中注册的命令是 ms 和 modelscope,不是 ms-hub。所以这个报错首先说明命令名不属于当前安装版本,并不代表依赖没有安装,也不代表 0.1.8 太旧。因为 ms-hub 这个指令是 modelscope-hub>0.1.8 的版本中才替换的。所以如果下载的是大于 0.1.8 版本 那么就是将 原来的指令中 ms 换成 ms-hub,modelscope 换成 modelscope-hub
先确认虚拟环境并使用正确入口:
source /home/your-user/projects/comfyui-minimax-h3/.venv/bin/activate
# 主入口:modelscope-hub 0.1.8 提供的 ms
command -v ms || true
ms --help
# 备用入口
command -v modelscope || true
uv pip show -f modelscope-hub
python -m modelscope_hub.cli.main --help
本文的命令优先级是:ms → Python 模块入口;modelscope 只作为备用,因为安装完整 ModelScope 框架后可能发生同名入口覆盖。文章不再使用 ms-hub 或 modelscope-hub。
3. 出现 VRAM grow failed
这类错误不一定等于显卡物理显存耗尽。MiniMax H3 会使用 DynamicVRAM、CPU 卸载和 pinned memory,系统主存不足、主存压力或其他进程占用也可能导致扩容失败。
依次检查:
# 分别检查显存、系统主存和占用主存最多的进程
nvidia-smi
free -h
ps -eo pid,comm,rss --sort=-rss | head
处理顺序建议为:停止无关任务、降低 Megapixels 或时长、重启 ComfyUI 清理 CUDA 状态,最后再考虑增加系统内存。本文环境从较低主存升级到 48GB 后,动态卸载空间更充裕,但具体需求仍取决于工作流。
十一、结语
到这里,MiniMax H3 的量化权重、三种官方工作流和 systemd 常驻已经形成一个完整基线。先保留这个原生注意力基线,再安装加速组件,才能判断加速是否真实有效,也能在发生问题时快速回退。
下一篇:MiniMax H3 接入 SageAttention 实测加速 <ComfyUI 启动 包含踩坑记录>
参考资料
- ComfyUI:MiniMax H3 Workflow Examples
- ComfyUI 0.30.0 requirements.txt
- PyTorch cu130 软件源
- PyTorch cu132 软件源
- NVIDIA CUDA Toolkit Release Notes:Toolkit 与驱动版本表
- NVIDIA CUDA Minor Version Compatibility
- PyPI:modelscope-hub 0.1.8(该版本文档使用
ms) - modelscope-hub v0.1.8
pyproject.toml:ms与modelscopeentry points - ModelScope:Comfy-Org/MiniMax-H3
- ModelScope:MiniMax/MiniMax-H3 官方模型卡
- ModelScope:Comfy-Org/MiniMax-H3 社区反馈页
- vLLM Recipes:MiniMax H3 TI2V