#AI 编程# 今天刷 Reddit 看到个硬核实测:Qwen3.8-27B 在专业卡 Sapphire Radeon AI PRO R9700 上,配合投机解码把代码提示速度推到了 159.4 tok/s。
很多人以为 27B 这种级别本地只能龟速跑,之前常规实测持续生成才 14 tok/s 左右。这次能跑满 10 倍速,核心是靠 DFlash2 草稿树验证加专用引擎的 GEMM 融合算子做协同优化。
这给做独立开发提了个醒:本地大模型真进入无感延迟后,代码隐私和云端 API 账单能同时省下来,但前提是技术栈得搭上投机解码。
大家目前本地写代码都在跑多大参数的模型?
很多人以为 27B 这种级别本地只能龟速跑,之前常规实测持续生成才 14 tok/s 左右。这次能跑满 10 倍速,核心是靠 DFlash2 草稿树验证加专用引擎的 GEMM 融合算子做协同优化。
这给做独立开发提了个醒:本地大模型真进入无感延迟后,代码隐私和云端 API 账单能同时省下来,但前提是技术栈得搭上投机解码。
大家目前本地写代码都在跑多大参数的模型?
展开
2
6
希望得到jym的祝福![[嘿哈]](http://lf-web-assets.juejin.cn/obj/juejin-web/xitu_juejin_web/img/jj_emoji_67.9ceed33.png)
![[比心]](http://lf-web-assets.juejin.cn/obj/juejin-web/xitu_juejin_web/img/jj_emoji_113.582f64b.png)