磁盘占用 1.45GB,它在 CPU 上克隆了我的声音。
Qwen3-TTS 现在已集成到主线 llama.cpp 中。两个 GGUF 文件一起加载,而不是一个:说话者和音频分词器。在 Q4_K_M 量化下,这是 1.2GB + 255MB。Apache 2.0 许可。24kHz 单声道输出。
每个转发这条消息的人都说“Q4 没有质量损失”。我提供了一个 9 秒的我自己的声音参考片段,以及 40 个句子,英语和乌克兰语。
模型 峰值 RSS 9 秒音频 实时因子1.7B Q8_0 6.7 GB 11.4 s 1.27x1.7B Q4_K_M 4.9 GB 8.9 s 0.99x0.6B Q4_K_M 3.1 GB 4.2 s 0.47x
1.7B 模型在 Q4 量化下,在普通桌面 CPU 上达到了实时速度。0.6B 模型是两倍实时速度。整个过程没有使用 GPU。
它崩溃的地方:Q4_K_M 很好地保留了我的音色,但会使疑问句的韵律变平。40 个句子中有 6 个的语调下降,而参考片段中明显是上升的。Q8_0 完美处理了所有 40 个。所以:叙述,使用 Q4。对话或任何会话内容,那额外的 ~900MB 是必不可少的。
两个文件都必须下载,否则无法加载:
huggingface-cli download Serveurperso/Qwen3-TTS-GGUF \ qwen-talker-1.7b-customvoice-Q4_K_M.gguf \ qwen-tokenizer-12hz-Q4_K_M.gguf --local-dir models
customvoice 是从参考片段克隆声音的模式。base 模式仅支持指定的说话者。那一个词让我浪费了二十分钟。
