昊梵体育网

今天测试一下sglang下的nvfp4 token 61左右,比我的llama.cpp Q8KXL要慢十几个token。 经常有人吹说你为什么不用sglang或vllm,用llama.cpp太low了。这些人怎么说呢,他们就是那种问你上下班为什么不开地铁的人,无聊。 llama.cpp是针对单机非并发场景设计的纯量化AI服务器,sglang是为了高并发设计 ​

今天测试一下sglang下的nvfp4 token 61左右,比我的llama.cpp Q8KXL要慢十几个token。

经常有人吹说你为什么不用sglang或vllm,用llama.cpp太low了。这些人怎么说呢,他们就是那种问你上下班为什么不开地铁的人,无聊。
llama.cpp是针对单机非并发场景设计的纯量化AI服务器,sglang是为了高并发设计的,sglang有一个杀手锏是Radix‑Ark架构,也就是Attention KV的直接会复用资源,不会每人都开辟一个新的,所以在高并发场景下性能很强。但这与llama.cpp的场景根本就没关系。
一个人自己本地工作站,老老实实地用llama.cpp+gguf,别去用wsl折腾sglang,纯属有病。