昊梵体育网

Qwen 3.8 27B 这个 27B 视觉模型刚开源就被推到了本地部署圈的风口

Qwen 3.8 27B 这个 27B 视觉模型刚开源就被推到了本地部署圈的风口:Apache 2 许可、参数规模对单台高配笔记本友好,官方基准把它自家上一代和当时还顶着付费旗舰帽子的 Qwen 3.7-Plus 都压了一头。冲着这颗基模型本身下载的人不少,结果开箱第一脚就踩坑——官方把推理强度默认设成了最高档 xhigh,LM Studio 那边的 17GB Q4_K_M 量化版本原样继承了这个默认。

最直观的后果是上下文被推理过程吃光。LM Studio 默认 8192 token 上下文下,随便问点简单问题,输出位置还没轮到,token 已经被内部推理烧完。Simon Willison 把上下文拉到 262,144 上限,画一张"骑自行车的鹈鹕 SVG",模型跑了 21 分钟、用掉 22,276 个推理 token,才吐出 3,223 个输出 token。慢是真的慢,但 SVG 成品也是他在本地能跑的模型里见过最好的一只鹈鹕——质量摆在那,拖后腿的是默认配置,不是权重。

想把响应速度拉回来,把 reasoning_effort 从 xhigh 调到 medium 或 low 就行。Willison 自己也吐槽,xhigh 当默认档是个挺反常识的设置,在消费级显卡上绝不是跑这个模型的正确姿势。

有个边界得标清楚:现在能看到的跑分全是 Qwen 官方自报,独立评测还没出,实际领先幅度可能跟宣传有出入;xhigh 这个默认到底是官方出厂决定还是 LM Studio 端 GGUF 量化版的取舍,双方文档都语焉不详。

你自己跑本地模型时,更想默认开最强推理换输出上限,还是默认低强度把响应速度先保住?