大半夜睡不着,终于成功在9000块的AMD AI9 hx 370笔记本上跑起了Qwen3.8-flash-next(iq3_xxs)!
prefill当然慢点,但吐Token速度能稳定在10-20tok/s,碾压27B的 7tok/s

而且智商强多了,这下算是暂时实现穷人版的Token自由了!

对了,我使用的是Strata,官方暂时不支持这个显卡(gfx1150),废了好大的劲下模型、装环境、编译,再让deepseek写个启动脚本才顺利跑起来,不容易[流泪]
展开
JSOS于2026-10-07 21:13发布的图片
JSOS于2026-10-07 21:13发布的图片
2