AMD RX 6000 也能跑 vLLM!Windows 原生 ROCm 7.15 一键部署,实测 60 tok/s(无需 WSL)

0 阅读1分钟

很多人以为 AMD 显卡在 Windows 上跑大模型只能靠 llama.cpp 的 Vulkan 后端,或者装 WSL2 绕圈子。其实还有第三条路:原生 ROCm + vLLM,就在 Windows 11 上。

开源项目 vllm-rocm-windows-rdna2 做到了这一点,而且是一键安装:双击 INSTALL.bat,自动完成 GPU 检测、下载预编译组件、部署模型、跑基准测试。全程不需要编译器,不需要手动装 ROCm,连 WSL2 都不用。

原理:基于 ROCm/TheRock 把 HIP 运行时、rocBLAS、Tensile 编译成原生 Windows 二进制;通过 HSA_OVERRIDE_GFX_VERSION=10.3.1 把 RDNA2 显卡统一呈现为 gfx1031,配合 PyTorch 2.12 + ROCm 7.15,让 torch.cuda.is_available() 在 Windows 上返回 True。还专门写了 HIP W4 GEMV 内核(AWQ 4-bit)和 M=1 瘦身 GEMV(lm_head),兼容 CUDA graphs。

实测(RX 6750 XT 12GB,Windows 11 原生,无 WSL):

rocBLAS FP16 GEMM:25 674 Gflops ≈ 26 TFLOPS vLLM 解码 Qwen3.5-4B 4-bit:59-62 tok/s(基线 8.3 → 7.5 倍) 对比 llama.cpp Vulkan:约 40-45 tok/s,且 Vulkan 跑不了 vLLM 支持:RX 6400–6950 全系 + Radeon Pro V620;8GB 显存流畅跑 4B,4GB 小卡自动降级。RDNA3/RDNA4 流水线已预留(实验性)。

特性:OpenAI 兼容 API(http://127.0.0.1:8000/v1)、网页聊天带推理动画 + 实时 tok/s、SHA256 完整性校验、断点续传、一键卸载。

项目地址:github.com/sebastianme… (README 有完整中文版)

这可能是目前 Windows 上最接近 NVIDIA 体验的 AMD vLLM 方案,欢迎 RX 6000 用户实测反馈。

01_gpu_detection.png

02_rocblas_bench.png

03_vllm_tps.png