昊梵体育网

Windows 版 vLLM 成功部署 Qwen 3.8 27B 刚攻克了基于

Windows 版 vLLM 成功部署 Qwen 3.8 27B
刚攻克了基于 windows + vLLM 本地部署 Qwen3.8 27B 的难题,初步实现本地 token 自由。这次总计给 windows 版 vLLM 定制了 12 个补丁,几个环境脚本,并二次编译定制了一个 qwen 3.8 模型。
之前国外有基于 原生linux 和 wsl 环境部署成功的案例,但 windows 原生环境下还没有 vLLM 成功部署Qwen3.8 27B的案例。因为众所周知,vLLM之前是只限在Linux上运行的软件。
这次使用 3090 ti 24G 显卡,在特定规则下, 64k 上下文窗口下 decode 跑出了 123 token/s 的最高速度。视频展示的是 150K 上下文窗口下的输出速度,大约 75-85 token/s, 虽然慢了不少,但日常更实用些。vLLM 的特点,是输出速度超过基于 llama.cpp 底座的 LM studio,和一些并发优势。之前 vLLM 只能跑在原生 linux或 wsl 上,而 wsl 又有 20-30% 的 GPU 直通性能损失。这次 windows 下实现了直通,GPU 无性能损耗。