搞了个 Qwen3.8-27B 测试一下单机 h100,不到 100tps,但体感已经很快了,占用 GPU40 多 g,还可以,开到 1M 上下文 最大请求就很慢了,17 分钟才搞定。现在模型部署都是 Codex 自己搞,太方便了