#AI 编程# 今天刷 Reddit 看到个硬核实测:Qwen3.8-27B 在专业卡 Sapphire Radeon AI PRO R9700 上,配合投机解码把代码提示速度推到了 159.4 tok/s。

很多人以为 27B 这种级别本地只能龟速跑,之前常规实测持续生成才 14 tok/s 左右。这次能跑满 10 倍速,核心是靠 DFlash2 草稿树验证加专用引擎的 GEMM 融合算子做协同优化。

这给做独立开发提了个醒:本地大模型真进入无感延迟后,代码隐私和云端 API 账单能同时省下来,但前提是技术栈得搭上投机解码。

大家目前本地写代码都在跑多大参数的模型?
展开
孟健AI编程于2026-10-09 14:22发布的图片
2