昊梵体育网

我必须立刻本地部署qwen3.8-27B 梁圣已经原地退化为牢梁了,deepse

我必须立刻本地部署qwen3.8-27B
梁圣已经原地退化为牢梁了,deepseek api原地涨价五倍。这个价格不能说完全没有性价比吧,但也导致了成本激增,尤其是写代码的话随随便便几兆几十兆的token消耗,蚁多咬死象,地主家也没有余粮。

然后呀然后,qwen3.8-27B终于是在一个小时前开放权重了,这不叫巧了么小梁?

从github拉取最新的llama-cpp
cmake -B build -DGGML_CUDA=ON -DCMAKE_CUDA_COMPILER=/usr/local/cuda/bin/nvcc
cmake --build build --config Release -j 24

去hf-mirror拉取qwen3.8-27B unsloth UD-Q6K_XL的权重,modelscope暂时还没找到,抱脸虫的话外网下载太慢。我的话因为显存只有40G,所以用的Q6K,只开了200K上下文给claude code用。相信在座的各位都是人手一张RTX PRO 6000 96G的,可以考虑一下fp8的权重,然后开满262k的上下文。

我用了一张3090和一张4080s,启动命令如下
/home/sunbird/demo/llama.cpp/build/bin/llama-server -fa on --spec-type draft-mtp --spec-draft-n-max 2 --temp 0.6 --top-p 0.95 --min-p 0.0 --top-k 20 -t 6 --webui --host 0.0.0.0 --port 11432 -ngl 99 -np 1 -ts 30,17 -mg 1 --cache-ram 32768 --model /home/sunbird/data/models/llm/Qwen3.8-27B-UD-Q6_K_XL.gguf --alias "Qwen3.6-27B" -c 200000 --reasoning-preserve

输出速度约50 tokens/s,完全够用

顺便吐槽下,qwen现在的思维链终于是中文的了,3.5和3.6纯英文思维链,笑死